Dane, na których uczy się model, pod kontrolą.
Artykuł 10 wymaga, aby zbiory danych do uczenia, walidacji i testowania systemu AI o wysokim ryzyku podlegały praktykom zarządzania danymi: sprawdzano ich trafność, reprezentatywność, luki i ewentualne stronniczości. Model kształtowany jest przez dane, na których się uczy, a te dane są przetwarzane w kodzie, w potoku, który je waliduje i przygotowuje przed uczeniem.
The shapes the same control failure takes.
Zarządzanie danymi słabnie, gdy zmiana pozwala modelowi uczyć się na danych, które nie zostały zbadane. Powtarzające się wzorce:
Krok walidacji zbioru danych został usunięty
Sprawdzenie danych treningowych (schemat, brakujące wartości, podstawowa jakość) zostało pominięte, aby przyspieszyć proces, więc model uczy się na dowolnych danych, które akurat zawiera zbiór.
Pominięto sprawdzenie stronniczości lub reprezentatywności
Krok, który badał dane pod kątem luk lub nierównowagi w grupach, których dotyczy, został usunięty, więc znana klasa stronniczości pozostaje niezauważona.
Pochodzenie danych zostało pominięte
Rejestr źródła pochodzenia danych treningowych przestał być gromadzony, więc dane stojące za modelem nie mogą być już śledzone ani kontrolowane.
Nowe źródło danych zostało dodane bez kontroli
Nowe źródło zostało włączone do uczenia bez zastosowania jakiejkolwiek kontroli, która dotyczy istniejących źródeł.
Filtrowanie nieprawidłowych rekordów zostało usunięte
Usunięto usuwanie duplikatów lub nieprawidłowych, uszkodzonych lub niewłaściwych rekordów, co obniża jakość danych, na których uczy się model.
Krok walidacji zbioru danych, usunięty przed uczeniem.
Potok ponownego uczenia uruchamia krok walidacji (schemat, brakujące wartości, podstawowe sprawdzenia reprezentatywności) przed rozpoczęciem uczenia. Aby przyspieszyć eksperyment, walidacja została usunięta, a model teraz uczy się na dowolnych danych, które akurat zawiera zbiór.
async function retrain(dataset) {- await validateDataset(dataset) // schema, gaps, representativeness const model = await train(dataset) return model}Usunięcie walidacji oznacza, że system o wysokim ryzyku może uczyć się na danych, które nie zostały zbadane pod kątem jakości, luk lub stronniczości, czego Art. 10 (zarządzanie danymi) wymaga dla zbiorów do uczenia, walidacji i testowania. Zachowaj krok walidacji. Czy system jest o wysokim ryzyku i objęty zakresem, to kwestia Twojej własnej oceny.
Zarządzanie danymi jest sprawdzane na poziomie potoku i dokumentacji.
Sprawdzenie zgodności dla systemu o wysokim ryzyku dotyczy sposobu, w jaki dane były zarządzane: czy dane do uczenia, walidacji i testowania zostały zbadane pod kątem jakości, reprezentatywności i stronniczości oraz czy zostało to udokumentowane. Zmiana, która usunęła walidację lub sprawdzenie stronniczości, albo włączyła niekontrolowane źródło, to konkretna luka, która ujawnia się w diffie potoku danych.
Przegląd, a nie program zarządzania danymi.
heygrc sygnalizuje zmiany dotyczące Art. 10 i cytuje artykuł, aby naprawa nastąpiła w pull request. Nie ocenia zbiorów danych pod kątem stronniczości ani nie prowadzi procesu zarządzania danymi. Wychwytuje moment, w którym zmiana pozwala systemowi o wysokim ryzyku uczyć się na niekontrolowanych danych, na poziomie diffu.