Moduł techniczny 4 z 4

Ewaluacja modelu AI i analiza błędów

Pytanie decyzyjne: czy kandydat jest lepszy od baseline w ważnych segmentach i czy znasz jego ograniczenia?

Ewaluacja to decyzja, nie jedna liczba

Ewaluacja modeli AI wymaga porównania kandydata z wcześniej ustalonym baseline. Oprócz wyniku globalnego sprawdź segmenty o odmiennym ryzyku oraz małą próbkę błędów. Dobór miary zależy od problemu; sama accuracy może ukrywać kosztowne pomyłki.

Artefakt: karta ewaluacji

Wersja danych i modelu:
Baseline oraz wynik:
Metryka i ustalony próg:
Wynik globalny:
Segmenty wysokiego ryzyka:
Kategorie błędów z przeglądu próbki:
Ograniczenia i niepewność:
Decyzja: iteracja / dodatkowy test / zatrzymanie:

Przegląd błędów

  1. Wybierz ograniczoną, udokumentowaną próbkę pomyłek.
  2. Oznacz kategorię błędu zamiast wyjaśniać go pojedynczym przykładem.
  3. Porównaj wynik w segmentach, dla których koszt pomyłki jest większy.
  4. Sprawdź, czy poprawa przewyższa baseline i wcześniej ustalony próg.

Nie wdrażaj i zatrzymaj eksperyment, gdy wynik testu nie spełnia progu, nie potrafisz wyjaśnić kluczowych błędów lub ryzyko w ważnym segmencie pozostaje nieakceptowalne. Wynik offline nie jest gwarancją działania w produkcji.

Przećwicz ocenę na dziesięciu zgłoszeniach

W przykładzie ewaluacji klasyfikatora znajdziesz syntetyczny plik CSV, wynik modelu i prosty baseline. Oba rozwiązania uzyskują accuracy 70%, ale wykrywają różną liczbę pilnych zgłoszeń. Twoim zadaniem jest policzenie precision i recall oraz zapisanie, jakich dowodów brakuje do dalszej decyzji.

Najpierw policz samodzielnie kategorie błędów, potem rozwiń rozwiązanie. Dzięki temu karta ewaluacji przestaje być pustym formularzem: każde pole wiąże się z konkretnym obliczeniem lub ograniczeniem.

Źródła i granica tego materiału

O baseline, metrykach i ograniczeniach pojedynczej miary: Google: Machine Learning Glossary — Metrics oraz Google: Measuring success.

Ten moduł kończy się decyzją techniczną po ewaluacji. Role organizacyjne, rejestr zastosowań, bramki przed wdrożeniem i monitoring rozwija osobny przewodnik AI Governance; nie powtarzamy go tutaj.

Autor: Maciej Pieniak · Aktualizacja: 12.09.2026.