De data waar een model van leert, beheerd.
Artikel 10 vereist dat de trainings-, validatie- en testdatasets achter een hoogrisico-AI-systeem onderworpen zijn aan databeheerpraktijken: gecontroleerd op relevantie, representativiteit, hiaten en mogelijke vooroordelen. Een model wordt gevormd door de data waar het van leert, en die data wordt verwerkt in code, in de pijplijn die deze valideert en voorbereidt voordat de training begint.
The shapes the same control failure takes.
Databeheer verzwakt wanneer een wijziging een model toestaat om te trainen op data die niet is gecontroleerd. De terugkerende vormen:
Een datasetvalidatiestap wordt verwijderd
Een controle op de trainingsdata (schema, ontbrekende waarden, basisqualiteit) wordt geschrapt om de zaken te versnellen, zodat het model traint op wat de data toevallig bevat.
Een bias- of representativiteitscontrole wordt overgeslagen
Een stap die de data controleerde op hiaten of scheefgroei tussen de groepen die het beïnvloedt, wordt verwijderd, zodat een bekende klasse vooroordelen ongecontroleerd blijft.
Herkomst wordt geschrapt
De registratie van waar de trainingsdata vandaan komt, wordt niet meer vastgelegd, zodat de data achter een model niet meer kan worden getraceerd of beheerd.
Een nieuwe databron wordt ongecontroleerd toegevoegd
Een nieuwe bron wordt aan de training toegevoegd zonder dat de beheerregels die op de bestaande bronnen van toepassing zijn, worden toegepast.
Filteren van slechte records wordt verwijderd
Deduplicatie of verwijdering van corrupte of buiten-scope records wordt geschrapt, waardoor de kwaliteit van de data waar het model van leert, achteruitgaat.
Een datasetvalidatiestap, verwijderd voor de training.
Een her-trainingspijplijn voert een validatiestap uit (schema, ontbrekende waarden, basisrepresentativiteitscontroles) voordat deze traint. Om een experiment te versnellen wordt de validatie verwijderd, en traint het model nu op wat de dataset toevallig bevat.
async function retrain(dataset) {- await validateDataset(dataset) // schema, gaps, representativeness const model = await train(dataset) return model}Het verwijderen van de validatie betekent dat het hoogrisicosysteem kan trainen op data die niet is gecontroleerd op kwaliteit, hiaten of vooroordelen, wat Art. 10 (databeheer) verwacht voor trainings-, validatie- en testsets. Houd de validatiestap aan. Of een systeem hoogrisico is en binnen de scope valt, is voor eigen beoordeling.
Databeheer wordt gecontroleerd in de pijplijn en de documentatie.
Conformiteit voor een hoogrisicosysteem kijkt naar hoe de data is beheerd: dat trainings-, validatie- en testdata is gecontroleerd op kwaliteit, representativiteit en vooroordelen, en dat dit is gedocumenteerd. Een wijziging die een validatie- of biascontrole heeft verwijderd, of een ongecontroleerde bron heeft toegevoegd, is de concrete leemte hierachter, en deze komt naar voren in de diff van de datapijplijn.
Een review, geen databeheerprogramma.
heygrc markeert wijzigingen die Art. 10 raken en citeert het artikel, zodat de correctie in de pull request plaatsvindt. Het beoordeelt uw datasets niet op vooroordelen of voert uw beheerproces niet uit. Het signaleert het moment waarop een wijziging een hoogrisicosysteem toestaat om te trainen op ongecontroleerde data, in de diff.