heygrc
Gouvernance des données selon l'EU AI Act dans le code

Les données sur lesquelles un modèle s'entraîne, gouvernées.

L'article 10 exige que les jeux de données d'entraînement, de validation et de test derrière un système d'IA à haut risque soient soumis à des pratiques de gouvernance des données : examen de leur pertinence, de leur représentativité, des lacunes et des biais possibles. Un modèle est façonné par les données sur lesquelles il s'entraîne, et ces données sont gérées dans le code, dans le pipeline qui les valide et les prépare avant l'entraînement.

How it shows up in a diff

The shapes the same control failure takes.

La gouvernance des données s'affaiblit lorsqu'un changement permet à un modèle de s'entraîner sur des données non examinées. Les formes récurrentes :

  • Une étape de validation du jeu de données est supprimée

    Une vérification des données d'entraînement (schéma, valeurs manquantes, qualité de base) est retirée pour accélérer les choses, de sorte que le modèle s'entraîne sur n'importe quelles données présentes dans le jeu.

  • Une vérification des biais ou de la représentativité est ignorée

    Une étape qui examinait les données pour détecter des lacunes ou des déséquilibres entre les groupes concernés est supprimée, de sorte qu'une classe connue de biais reste non examinée.

  • La traçabilité est abandonnée

    L'enregistrement de l'origine des données d'entraînement n'est plus capturé, de sorte que les données derrière un modèle ne peuvent plus être tracées ni gouvernées.

  • Une nouvelle source de données est ajoutée sans gouvernance

    Une nouvelle source est intégrée à l'entraînement sans appliquer les mêmes règles de gouvernance que pour les sources existantes.

  • Le filtrage des enregistrements défectueux est supprimé

    La déduplication ou la suppression des enregistrements corrompus ou hors champ est retirée, ce qui dégrade la qualité des données sur lesquelles le modèle s'entraîne.

Worked example

Une étape de validation du jeu de données, supprimée avant l'entraînement.

Un pipeline de réentraînement exécute une étape de validation (schéma, valeurs manquantes, vérifications de base de la représentativité) avant l'entraînement. Pour accélérer une expérience, la validation est supprimée, et le modèle s'entraîne désormais sur n'importe quelles données présentes dans le jeu.

ml/retrain.ts+0 -1
async function retrain(dataset) {-  await validateDataset(dataset) // schema, gaps, representativeness  const model = await train(dataset)  return model}
heygrcEU AI Act Art. 10

Supprimer la validation signifie que le système à haut risque peut s'entraîner sur des données non examinées pour leur qualité, leurs lacunes ou leurs biais, ce que l'Art. 10 (gouvernance des données) exige pour les jeux d'entraînement, de validation et de test. Conservez l'étape de validation. Le fait qu'un système soit à haut risque et concerné relève de votre propre évaluation.

What an auditor does with this

La gouvernance des données est vérifiée au niveau du pipeline et de la documentation.

La conformité pour un système à haut risque examine la manière dont ses données ont été gouvernées : que les données d'entraînement, de validation et de test ont été examinées pour leur qualité, leur représentativité et leurs biais, et que cela est documenté. Un changement qui supprime une validation ou une vérification des biais, ou qui intègre une source non gouvernée, est l'écart concret derrière cela, et il apparaît dans le diff du pipeline de données.

What this is, and is not

Une revue, pas un programme de gouvernance des données.

heygrc signale les changements qui concernent l'Art. 10 et cite l'article afin que la correction ait lieu dans la pull request. Il n'évalue pas vos jeux de données pour détecter des biais ni n'exécute votre processus de gouvernance. Il détecte le moment où un changement permet à un système à haut risque de s'entraîner sur des données non gouvernées, au niveau du diff.