heygrc
EU AI Act Daten-Governance im Code

Die Daten, von denen ein Modell lernt, werden verwaltet.

Artikel 10 verlangt, dass die Datensätze für Trainings-, Validierungs- und Testzwecke hinter einem Hochrisiko-KI-System einer Daten-Governance unterliegen: Sie müssen auf Relevanz, Repräsentativität, Lücken und mögliche Verzerrungen geprüft werden. Ein Modell wird durch die Daten geprägt, von denen es lernt, und diese Daten werden im Code verwaltet, in der Pipeline, die sie vor dem Training validiert und aufbereitet.

How it shows up in a diff

The shapes the same control failure takes.

Die Daten-Governance wird geschwächt, wenn eine Änderung es einem Modell ermöglicht, mit ungeprüften Daten zu trainieren. Die wiederkehrenden Muster:

  • Ein Validierungsschritt für den Datensatz wird entfernt

    Eine Prüfung der Trainingsdaten (Schema, fehlende Werte, grundlegende Qualität) wird entfernt, um den Prozess zu beschleunigen, sodass das Modell mit beliebigen Daten trainiert, die sich zufällig im Datensatz befinden.

  • Eine Prüfung auf Verzerrungen oder Repräsentativität wird übersprungen

    Ein Schritt, der die Daten auf Lücken oder Verzerrungen in den betroffenen Gruppen prüft, wird entfernt, sodass eine bekannte Verzerrungsklasse unentdeckt bleibt.

  • Die Herkunft wird nicht mehr erfasst

    Die Aufzeichnung, woher die Trainingsdaten stammen, wird nicht mehr erfasst, sodass die Daten hinter einem Modell nicht mehr nachverfolgt oder verwaltet werden können.

  • Eine neue Datenquelle wird ohne Governance hinzugefügt

    Eine neue Quelle wird in das Training eingebunden, ohne dass die Governance-Maßnahmen angewendet werden, die für die bestehenden Quellen gelten.

  • Das Filtern fehlerhafter Datensätze wird entfernt

    Das Entfernen von Duplikaten oder korrupten oder nicht relevanten Datensätzen wird entfernt, wodurch die Qualität der Daten, von denen das Modell lernt, beeinträchtigt wird.

Worked example

Ein Validierungsschritt für den Datensatz, vor dem Training entfernt.

Eine Retraining-Pipeline führt vor dem Training einen Validierungsschritt durch (Schema, fehlende Werte, grundlegende Repräsentativitätsprüfungen). Um ein Experiment zu beschleunigen, wird die Validierung entfernt, und das Modell trainiert nun mit beliebigen Daten, die sich zufällig im Datensatz befinden.

ml/retrain.ts+0 -1
async function retrain(dataset) {-  await validateDataset(dataset) // schema, gaps, representativeness  const model = await train(dataset)  return model}
heygrcEU AI Act Art. 10

Das Entfernen der Validierung bedeutet, dass das Hochrisiko-System mit Daten trainieren kann, die nicht auf Qualität, Lücken oder Verzerrungen geprüft wurden, was Art. 10 (Daten-Governance) für Trainings-, Validierungs- und Testdatensätze erwartet. Behalten Sie den Validierungsschritt bei. Ob ein System als Hochrisiko eingestuft wird und im Geltungsbereich liegt, ist Teil Ihrer eigenen Bewertung.

What an auditor does with this

Daten-Governance wird in der Pipeline und in der Dokumentation geprüft.

Die Konformitätsprüfung für ein Hochrisiko-System untersucht, wie dessen Daten verwaltet wurden: dass Trainings-, Validierungs- und Testdaten auf Qualität, Repräsentativität und Verzerrungen geprüft wurden und dass dies dokumentiert ist. Eine Änderung, die eine Validierung oder Verzerrungsprüfung entfernt oder eine nicht verwaltete Quelle einbindet, ist die konkrete Lücke dahinter, und sie zeigt sich im Diff der Daten-Pipeline.

What this is, and is not

Eine Prüfung, kein Daten-Governance-Programm.

heygrc markiert Änderungen, die Art. 10 betreffen, und verweist auf den Artikel, damit die Korrektur im Pull Request erfolgt. Es bewertet Ihre Datensätze nicht auf Verzerrungen oder führt Ihren Governance-Prozess aus. Es erkennt den Moment, in dem eine Änderung es einem Hochrisiko-System ermöglicht, mit nicht verwalteten Daten zu trainieren, und zwar im Diff.