Moduł techniczny 3 z 4
Train, validation i test: podział danych bez przecieku
Pytanie decyzyjne: jaki podział odzwierciedla przyszłe użycie modelu i nie pozwala mu zobaczyć odpowiedzi przed oceną?
Trzy role, nie jeden procent
Część treningowa służy do uczenia, walidacyjna do wyboru ustawień, a testowa do końcowej oceny. Udziały nie są uniwersalną receptą: wybierz jednostkę grupowania zgodną z problemem, na przykład użytkownika, organizację albo czas.
Artefakt: plan podziału
Wersja danych:
Jednostka grupowania:
Reguła train / validation / test:
Uzasadnienie podziału czasowego lub grupowego:
Seed i narzędzie losowania:
Kontrola duplikatów między częściami:
Data zamrożenia testu:
Osoba zatwierdzająca:
Kontrola przecieku
- Ustal podział przed doborem cech i modelu.
- Sprawdź, czy ten sam użytkownik, dokument lub bliski duplikat nie trafia do różnych części.
- Parametry przetwarzania ucz wyłącznie na train, potem stosuj je na pozostałych częściach.
- Nie zmieniaj rozwiązania po obejrzeniu wyniku testu; wtedy test przestaje być niezależny.
Zatrzymaj eksperyment, jeżeli nie potrafisz odseparować przyszłości od przeszłości albo nie masz wystarczających danych do niezależnej oceny. Wynik należy wtedy opisać jako niepewny, nie jako dowód gotowości.
Źródło i następny krok
Praktyczne omówienie przecieku danych oraz zasady, by nie dopasowywać przetwarzania do testu: scikit-learn: Common pitfalls. Następnie przejdź do ewaluacji i analizy błędów.
Autor: Maciej Pieniak · Aktualizacja: 12.09.2026.