Pracownia · przykład do samodzielnej próby
Ewaluacja klasyfikatora zgłoszeń — przykład krok po kroku
Dwa rozwiązania mają po 70% poprawnych odpowiedzi, ale tylko jedno wykrywa pilne zgłoszenia. Policz wyniki i zdecyduj, co naprawdę warto porównać.
Problem i granica przykładu
Wyobraź sobie system, który oznacza zgłoszenia jako pilne albo zwykłe, aby pomóc zespołowi ustalić kolejność sprawdzania. Nie zamyka spraw i nie odpowiada klientom. Klasa dodatnia oznacza w tym ćwiczeniu „pilne”. Przeoczenie pilnego zgłoszenia oraz fałszywy alarm są różnymi błędami.
Poniższe dziesięć rekordów i przewidywania są syntetyczne. Nie uruchamialiśmy treningu ani eksperymentu na danych firmy. Przykład pozwala przećwiczyć rachunek i uzasadnienie decyzji; tak mały zbiór nie wystarcza do oceny gotowości produkcyjnej.
Pobierz wyniki przykładowe CSV. Możesz otworzyć je w arkuszu i samodzielnie policzyć kategorie.
Zbiór do obliczeń
| Zgłoszenie | Etykieta rzeczywista | Przewidywanie |
|---|---|---|
| Z01 | pilne | pilne |
| Z02 | pilne | pilne |
| Z03 | pilne | zwykłe |
| Z04 | zwykłe | pilne |
| Z05 | zwykłe | pilne |
| Z06–Z10 (5 rekordów) | zwykłe | zwykłe |
Najpierw oznacz każde zgłoszenie: trafnie wykryte pilne (TP), fałszywy alarm (FP), przeoczone pilne (FN) albo trafnie odrzucone zwykłe (TN). Nie zmieniaj etykiet rzeczywistych tylko dlatego, że przewidywanie modelu wygląda przekonująco.
Sprawdź podział błędów
TP = 2 (Z01, Z02), FP = 2 (Z04, Z05), FN = 1 (Z03), TN = 5 (Z06–Z10). Suma wynosi 10. Każdy rekord należy do dokładnie jednej kategorii.
Trzy metryki, trzy różne pytania
| Pytanie | Obliczenie | Wynik |
|---|---|---|
| Jaka część wszystkich klasyfikacji była poprawna? Accuracy | (TP + TN) / 10 = 7 / 10 | 70% |
| Ile alarmów rzeczywiście dotyczyło pilnych zgłoszeń? Precision | TP / (TP + FP) = 2 / 4 | 50% |
| Ile pilnych zgłoszeń wykryliśmy? Recall | TP / (TP + FN) = 2 / 3 | około 66,7% |
Definicje metryk i zależność ich wyboru od kosztu błędów opisuje Google Machine Learning Crash Course. Używamy ich tutaj do własnego przykładu, nie do porównywania dostępnych na rynku modeli.
Sam wynik 70% nie odpowiada na pytanie, czy zespół może polegać na alarmach. W przykładzie połowa alarmów jest fałszywa, a jedno z trzech pilnych zgłoszeń zostało pominięte.
Porównaj z prostym baseline
Rozwiązanie bazowe zawsze odpowiada „zwykłe”. Trafia w siedem zgłoszeń i również uzyskuje accuracy 70%. Nie wykrywa jednak żadnego pilnego przypadku: recall wynosi 0%. Nie generuje alarmów, więc precision ma zerowy mianownik i nie jest tu określona; nie zapisuj jej jako 100%.
Model i baseline mają zatem taką samą accuracy, lecz inne skutki. To jeszcze nie oznacza, że model należy wdrożyć. Ustal dopuszczalną liczbę przeoczeń, obciążenie zespołu alarmami oraz sposób postępowania z niepewnymi przypadkami.
- Jeżeli najważniejsze jest wykrywanie pilnych spraw, przyjrzyj się przeoczonemu Z03 i podobnym przypadkom.
- Jeżeli alarmów jest zbyt dużo, sprawdź Z04 i Z05 oraz skutki fałszywych alarmów.
- Wybór progu lub kolejnej wersji modelu wykonuj na danych walidacyjnych. Oddzielny test służy późniejszej ocenie wybranego rozwiązania.
Zasady oddzielenia uczenia i oceny oraz unikania przecieku opisuje dokumentacja scikit-learn. Nie dopasowuj przygotowania danych na zbiorze testowym.
Zapisz decyzję, nie tylko procent
Twoim wynikiem jest krótka karta: cel klasyfikacji, tabela TP/FP/FN/TN, trzy metryki, wynik baseline i jeden następny eksperyment. Przykładowa decyzja: „Nie podejmujemy decyzji o wdrożeniu. Najpierw zbieramy więcej reprezentatywnych przypadków i sprawdzamy przyczyny przeoczeń oraz fałszywych alarmów”. To wniosek o brakujących dowodach, a nie o tym, że model na pewno jest zły.
Ćwiczenie jest ukończone, gdy umiesz wyjaśnić, dlaczego dwa wyniki 70% nie oznaczają tego samego działania systemu. W rozszerzeniu policz, jak zmienią się metryki po poprawieniu Z03 przy zachowaniu pozostałych przewidywań.
Sprawdź rozszerzenie
Po poprawieniu Z03: TP = 3, FN = 0, FP = 2, TN = 5. Accuracy = 80%, precision = 60%, recall = 100%. To przeliczenie hipotetycznej poprawki, nie nowy pomiar skuteczności modelu.
Przejdź do karty ewaluacji i analizy błędów albo wróć do definicji problemu i metryki.
Materiał redakcyjny szkolenie-ai.pl · Dane i wyniki syntetyczne · Źródła definicji sprawdzone: 13.09.2026.