Moduł techniczny 2 z 4
Dane treningowe AI: jakość, źródło i gotowość
Pytanie decyzyjne: czy zbiór ma znane pochodzenie, dozwolony cel użycia i wystarczający opis do odpowiedzialnego eksperymentu?
Jednostka obserwacji i etykieta
Zapisz, czym jest jeden rekord, kto lub co nadało etykietę oraz dla jakiego celu ją utworzono. Odróżnij dane do treningu od materiału zarezerwowanego wyłącznie do ewaluacji.
Artefakt: karta pochodzenia danych
Źródło i właściciel danych:
Podstawa użycia oraz licencja:
Cel użycia i ograniczenia:
Jednostka rekordu i etykieta:
Braki, duplikaty, nierównowaga:
Dane wrażliwe i minimalizacja:
Wersja zbioru oraz data zmiany:
Możliwość usunięcia rekordu:
Kontrola gotowości
- Sprawdź, czy znasz źródło każdego segmentu zbioru.
- Porównaj jego skład z sytuacją, w której ma działać model.
- Oznacz braki, duplikaty i niespójne etykiety zamiast ukrywać je w średniej.
- Oddziel dane, których nie wolno użyć do treningu.
Zatrzymaj eksperyment, gdy nie znasz praw do danych, ich źródła albo nie potrafisz spełnić żądania usunięcia danych, jeśli ma ono zastosowanie. To nie jest drobne ryzyko jakości.
Źródła i następny krok
Wzór dokumentowania motywacji, składu i przeznaczenia zbioru: Gebru i in.: Datasheets for Datasets. Następnie zaplanuj podział zbioru danych.
Autor: Maciej Pieniak · Aktualizacja: 12.09.2026.