Moduł techniczny 4 z 4
Ewaluacja modelu AI i analiza błędów
Pytanie decyzyjne: czy kandydat jest lepszy od baseline w ważnych segmentach i czy znasz jego ograniczenia?
Ewaluacja to decyzja, nie jedna liczba
Ewaluacja modeli AI wymaga porównania kandydata z wcześniej ustalonym baseline. Oprócz wyniku globalnego sprawdź segmenty o odmiennym ryzyku oraz małą próbkę błędów. Dobór miary zależy od problemu; sama accuracy może ukrywać kosztowne pomyłki.
Artefakt: karta ewaluacji
Wersja danych i modelu:
Baseline oraz wynik:
Metryka i ustalony próg:
Wynik globalny:
Segmenty wysokiego ryzyka:
Kategorie błędów z przeglądu próbki:
Ograniczenia i niepewność:
Decyzja: iteracja / dodatkowy test / zatrzymanie:
Przegląd błędów
- Wybierz ograniczoną, udokumentowaną próbkę pomyłek.
- Oznacz kategorię błędu zamiast wyjaśniać go pojedynczym przykładem.
- Porównaj wynik w segmentach, dla których koszt pomyłki jest większy.
- Sprawdź, czy poprawa przewyższa baseline i wcześniej ustalony próg.
Nie wdrażaj i zatrzymaj eksperyment, gdy wynik testu nie spełnia progu, nie potrafisz wyjaśnić kluczowych błędów lub ryzyko w ważnym segmencie pozostaje nieakceptowalne. Wynik offline nie jest gwarancją działania w produkcji.
Przećwicz ocenę na dziesięciu zgłoszeniach
W przykładzie ewaluacji klasyfikatora znajdziesz syntetyczny plik CSV, wynik modelu i prosty baseline. Oba rozwiązania uzyskują accuracy 70%, ale wykrywają różną liczbę pilnych zgłoszeń. Twoim zadaniem jest policzenie precision i recall oraz zapisanie, jakich dowodów brakuje do dalszej decyzji.
Najpierw policz samodzielnie kategorie błędów, potem rozwiń rozwiązanie. Dzięki temu karta ewaluacji przestaje być pustym formularzem: każde pole wiąże się z konkretnym obliczeniem lub ograniczeniem.
Źródła i granica tego materiału
O baseline, metrykach i ograniczeniach pojedynczej miary: Google: Machine Learning Glossary — Metrics oraz Google: Measuring success.
Ten moduł kończy się decyzją techniczną po ewaluacji. Role organizacyjne, rejestr zastosowań, bramki przed wdrożeniem i monitoring rozwija osobny przewodnik AI Governance; nie powtarzamy go tutaj.
Autor: Maciej Pieniak · Aktualizacja: 12.09.2026.