heygrc
Zarządzanie danymi wg EU AI Act w kodzie

Dane, na których uczy się model, pod kontrolą.

Artykuł 10 wymaga, aby zbiory danych do uczenia, walidacji i testowania systemu AI o wysokim ryzyku podlegały praktykom zarządzania danymi: sprawdzano ich trafność, reprezentatywność, luki i ewentualne stronniczości. Model kształtowany jest przez dane, na których się uczy, a te dane są przetwarzane w kodzie, w potoku, który je waliduje i przygotowuje przed uczeniem.

How it shows up in a diff

The shapes the same control failure takes.

Zarządzanie danymi słabnie, gdy zmiana pozwala modelowi uczyć się na danych, które nie zostały zbadane. Powtarzające się wzorce:

  • Krok walidacji zbioru danych został usunięty

    Sprawdzenie danych treningowych (schemat, brakujące wartości, podstawowa jakość) zostało pominięte, aby przyspieszyć proces, więc model uczy się na dowolnych danych, które akurat zawiera zbiór.

  • Pominięto sprawdzenie stronniczości lub reprezentatywności

    Krok, który badał dane pod kątem luk lub nierównowagi w grupach, których dotyczy, został usunięty, więc znana klasa stronniczości pozostaje niezauważona.

  • Pochodzenie danych zostało pominięte

    Rejestr źródła pochodzenia danych treningowych przestał być gromadzony, więc dane stojące za modelem nie mogą być już śledzone ani kontrolowane.

  • Nowe źródło danych zostało dodane bez kontroli

    Nowe źródło zostało włączone do uczenia bez zastosowania jakiejkolwiek kontroli, która dotyczy istniejących źródeł.

  • Filtrowanie nieprawidłowych rekordów zostało usunięte

    Usunięto usuwanie duplikatów lub nieprawidłowych, uszkodzonych lub niewłaściwych rekordów, co obniża jakość danych, na których uczy się model.

Worked example

Krok walidacji zbioru danych, usunięty przed uczeniem.

Potok ponownego uczenia uruchamia krok walidacji (schemat, brakujące wartości, podstawowe sprawdzenia reprezentatywności) przed rozpoczęciem uczenia. Aby przyspieszyć eksperyment, walidacja została usunięta, a model teraz uczy się na dowolnych danych, które akurat zawiera zbiór.

ml/retrain.ts+0 -1
async function retrain(dataset) {-  await validateDataset(dataset) // schema, gaps, representativeness  const model = await train(dataset)  return model}
heygrcEU AI Act Art. 10

Usunięcie walidacji oznacza, że system o wysokim ryzyku może uczyć się na danych, które nie zostały zbadane pod kątem jakości, luk lub stronniczości, czego Art. 10 (zarządzanie danymi) wymaga dla zbiorów do uczenia, walidacji i testowania. Zachowaj krok walidacji. Czy system jest o wysokim ryzyku i objęty zakresem, to kwestia Twojej własnej oceny.

What an auditor does with this

Zarządzanie danymi jest sprawdzane na poziomie potoku i dokumentacji.

Sprawdzenie zgodności dla systemu o wysokim ryzyku dotyczy sposobu, w jaki dane były zarządzane: czy dane do uczenia, walidacji i testowania zostały zbadane pod kątem jakości, reprezentatywności i stronniczości oraz czy zostało to udokumentowane. Zmiana, która usunęła walidację lub sprawdzenie stronniczości, albo włączyła niekontrolowane źródło, to konkretna luka, która ujawnia się w diffie potoku danych.

What this is, and is not

Przegląd, a nie program zarządzania danymi.

heygrc sygnalizuje zmiany dotyczące Art. 10 i cytuje artykuł, aby naprawa nastąpiła w pull request. Nie ocenia zbiorów danych pod kątem stronniczości ani nie prowadzi procesu zarządzania danymi. Wychwytuje moment, w którym zmiana pozwala systemowi o wysokim ryzyku uczyć się na niekontrolowanych danych, na poziomie diffu.