Pracownia · przykład do samodzielnej próby

Ewaluacja klasyfikatora zgłoszeń — przykład krok po kroku

Dwa rozwiązania mają po 70% poprawnych odpowiedzi, ale tylko jedno wykrywa pilne zgłoszenia. Policz wyniki i zdecyduj, co naprawdę warto porównać.

Problem i granica przykładu

Wyobraź sobie system, który oznacza zgłoszenia jako pilne albo zwykłe, aby pomóc zespołowi ustalić kolejność sprawdzania. Nie zamyka spraw i nie odpowiada klientom. Klasa dodatnia oznacza w tym ćwiczeniu „pilne”. Przeoczenie pilnego zgłoszenia oraz fałszywy alarm są różnymi błędami.

Poniższe dziesięć rekordów i przewidywania są syntetyczne. Nie uruchamialiśmy treningu ani eksperymentu na danych firmy. Przykład pozwala przećwiczyć rachunek i uzasadnienie decyzji; tak mały zbiór nie wystarcza do oceny gotowości produkcyjnej.

Pobierz wyniki przykładowe CSV. Możesz otworzyć je w arkuszu i samodzielnie policzyć kategorie.

Zbiór do obliczeń

ZgłoszenieEtykieta rzeczywistaPrzewidywanie
Z01pilnepilne
Z02pilnepilne
Z03pilnezwykłe
Z04zwykłepilne
Z05zwykłepilne
Z06–Z10 (5 rekordów)zwykłezwykłe
Dane syntetyczne: 10 zgłoszeń, w tym 3 pilne i 7 zwykłych.

Najpierw oznacz każde zgłoszenie: trafnie wykryte pilne (TP), fałszywy alarm (FP), przeoczone pilne (FN) albo trafnie odrzucone zwykłe (TN). Nie zmieniaj etykiet rzeczywistych tylko dlatego, że przewidywanie modelu wygląda przekonująco.

Sprawdź podział błędów

TP = 2 (Z01, Z02), FP = 2 (Z04, Z05), FN = 1 (Z03), TN = 5 (Z06–Z10). Suma wynosi 10. Każdy rekord należy do dokładnie jednej kategorii.

Trzy metryki, trzy różne pytania

PytanieObliczenieWynik
Jaka część wszystkich klasyfikacji była poprawna? Accuracy(TP + TN) / 10 = 7 / 1070%
Ile alarmów rzeczywiście dotyczyło pilnych zgłoszeń? PrecisionTP / (TP + FP) = 2 / 450%
Ile pilnych zgłoszeń wykryliśmy? RecallTP / (TP + FN) = 2 / 3około 66,7%
Wyniki obliczone dla syntetycznych przewidywań z tego ćwiczenia.

Definicje metryk i zależność ich wyboru od kosztu błędów opisuje Google Machine Learning Crash Course. Używamy ich tutaj do własnego przykładu, nie do porównywania dostępnych na rynku modeli.

Sam wynik 70% nie odpowiada na pytanie, czy zespół może polegać na alarmach. W przykładzie połowa alarmów jest fałszywa, a jedno z trzech pilnych zgłoszeń zostało pominięte.

Porównaj z prostym baseline

Rozwiązanie bazowe zawsze odpowiada „zwykłe”. Trafia w siedem zgłoszeń i również uzyskuje accuracy 70%. Nie wykrywa jednak żadnego pilnego przypadku: recall wynosi 0%. Nie generuje alarmów, więc precision ma zerowy mianownik i nie jest tu określona; nie zapisuj jej jako 100%.

Model i baseline mają zatem taką samą accuracy, lecz inne skutki. To jeszcze nie oznacza, że model należy wdrożyć. Ustal dopuszczalną liczbę przeoczeń, obciążenie zespołu alarmami oraz sposób postępowania z niepewnymi przypadkami.

  • Jeżeli najważniejsze jest wykrywanie pilnych spraw, przyjrzyj się przeoczonemu Z03 i podobnym przypadkom.
  • Jeżeli alarmów jest zbyt dużo, sprawdź Z04 i Z05 oraz skutki fałszywych alarmów.
  • Wybór progu lub kolejnej wersji modelu wykonuj na danych walidacyjnych. Oddzielny test służy późniejszej ocenie wybranego rozwiązania.

Zasady oddzielenia uczenia i oceny oraz unikania przecieku opisuje dokumentacja scikit-learn. Nie dopasowuj przygotowania danych na zbiorze testowym.

Zapisz decyzję, nie tylko procent

Twoim wynikiem jest krótka karta: cel klasyfikacji, tabela TP/FP/FN/TN, trzy metryki, wynik baseline i jeden następny eksperyment. Przykładowa decyzja: „Nie podejmujemy decyzji o wdrożeniu. Najpierw zbieramy więcej reprezentatywnych przypadków i sprawdzamy przyczyny przeoczeń oraz fałszywych alarmów”. To wniosek o brakujących dowodach, a nie o tym, że model na pewno jest zły.

Ćwiczenie jest ukończone, gdy umiesz wyjaśnić, dlaczego dwa wyniki 70% nie oznaczają tego samego działania systemu. W rozszerzeniu policz, jak zmienią się metryki po poprawieniu Z03 przy zachowaniu pozostałych przewidywań.

Sprawdź rozszerzenie

Po poprawieniu Z03: TP = 3, FN = 0, FP = 2, TN = 5. Accuracy = 80%, precision = 60%, recall = 100%. To przeliczenie hipotetycznej poprawki, nie nowy pomiar skuteczności modelu.

Przejdź do karty ewaluacji i analizy błędów albo wróć do definicji problemu i metryki.

Materiał redakcyjny szkolenie-ai.pl · Dane i wyniki syntetyczne · Źródła definicji sprawdzone: 13.09.2026.