Moduł techniczny 3 z 4

Train, validation i test: podział danych bez przecieku

Pytanie decyzyjne: jaki podział odzwierciedla przyszłe użycie modelu i nie pozwala mu zobaczyć odpowiedzi przed oceną?

Trzy role, nie jeden procent

Część treningowa służy do uczenia, walidacyjna do wyboru ustawień, a testowa do końcowej oceny. Udziały nie są uniwersalną receptą: wybierz jednostkę grupowania zgodną z problemem, na przykład użytkownika, organizację albo czas.

Artefakt: plan podziału

Wersja danych:
Jednostka grupowania:
Reguła train / validation / test:
Uzasadnienie podziału czasowego lub grupowego:
Seed i narzędzie losowania:
Kontrola duplikatów między częściami:
Data zamrożenia testu:
Osoba zatwierdzająca:

Kontrola przecieku

  1. Ustal podział przed doborem cech i modelu.
  2. Sprawdź, czy ten sam użytkownik, dokument lub bliski duplikat nie trafia do różnych części.
  3. Parametry przetwarzania ucz wyłącznie na train, potem stosuj je na pozostałych częściach.
  4. Nie zmieniaj rozwiązania po obejrzeniu wyniku testu; wtedy test przestaje być niezależny.

Zatrzymaj eksperyment, jeżeli nie potrafisz odseparować przyszłości od przeszłości albo nie masz wystarczających danych do niezależnej oceny. Wynik należy wtedy opisać jako niepewny, nie jako dowód gotowości.

Źródło i następny krok

Praktyczne omówienie przecieku danych oraz zasady, by nie dopasowywać przetwarzania do testu: scikit-learn: Common pitfalls. Następnie przejdź do ewaluacji i analizy błędów.

Autor: Maciej Pieniak · Aktualizacja: 12.09.2026.