I dati da cui un modello apprende, governati.
L'Articolo 10 richiede che i dataset di addestramento, validazione e test dietro un sistema di IA ad alto rischio siano soggetti a pratiche di governance dei dati: esaminati per pertinenza, rappresentatività, lacune e possibili pregiudizi. Un modello è plasmato dai dati da cui apprende, e tali dati vengono gestiti nel codice, nella pipeline che li valida e prepara prima dell'addestramento.
The shapes the same control failure takes.
La governance dei dati si indebolisce quando una modifica permette a un modello di addestrarsi su dati non esaminati. Le forme ricorrenti:
Un passaggio di validazione del dataset viene rimosso
Un controllo sui dati di addestramento (schema, valori mancanti, qualità di base) viene eliminato per accelerare i processi, così il modello si addestra su qualsiasi dato il dataset contenga.
Un controllo su pregiudizi o rappresentatività viene saltato
Un passaggio che esaminava i dati per lacune o distorsioni tra i gruppi interessati viene rimosso, così una classe nota di pregiudizio rimane non esaminata.
La provenienza viene eliminata
La registrazione dell'origine dei dati di addestramento non viene più acquisita, così i dati dietro un modello non possono più essere tracciati o governati.
Una nuova fonte dati viene aggiunta senza governance
Una nuova fonte viene integrata nell'addestramento senza applicare alcuna governance a quella esistente.
Il filtraggio dei record non validi viene rimosso
La deduplicazione o la rimozione di record corrotti o fuori ambito viene eliminata, degradando la qualità dei dati da cui il modello apprende.
Un passaggio di validazione del dataset, rimosso prima dell'addestramento.
Una pipeline di riaddestramento esegue un passaggio di validazione (schema, valori mancanti, controlli di rappresentatività di base) prima di addestrare. Per accelerare un esperimento, la validazione viene rimossa e il modello ora si addestra su qualsiasi dato il dataset contenga.
async function retrain(dataset) {- await validateDataset(dataset) // schema, gaps, representativeness const model = await train(dataset) return model}La rimozione della validazione significa che il sistema ad alto rischio può addestrarsi su dati non esaminati per qualità, lacune o pregiudizi, cosa che l'Art. 10 (governance dei dati) richiede per i dataset di addestramento, validazione e test. Mantenere il passaggio di validazione. Se un sistema sia ad alto rischio e in ambito è da valutare autonomamente.
La governance dei dati viene verificata nella pipeline e nella documentazione.
La conformità per un sistema ad alto rischio esamina come i suoi dati sono stati governati: che i dati di addestramento, validazione e test siano stati esaminati per qualità, rappresentatività e pregiudizi, e che ciò sia documentato. Una modifica che ha rimosso un controllo di validazione o pregiudizio, o ha integrato una fonte non governata, è il divario concreto dietro questo, e si evidenzia nel diff della pipeline dati.
Una revisione, non un programma di governance dei dati.
heygrc segnalare le modifiche che interessano l'Art. 10 e cita l'articolo in modo che la correzione avvenga nella pull request. Non valuta i dataset per pregiudizi né esegue il processo di governance. Rileva il momento in cui una modifica permette a un sistema ad alto rischio di addestrarsi su dati non governati, nel diff.