heygrc
Gobernanza de datos del EU AI Act en código

Los datos de los que aprende un modelo, gobernados.

El Artículo 10 exige que los conjuntos de datos de entrenamiento, validación y prueba detrás de un sistema de IA de alto riesgo estén sujetos a prácticas de gobernanza de datos: se examinan en cuanto a relevancia, representatividad, lagunas y posibles sesgos. Un modelo se moldea con los datos de los que aprende, y esos datos se gestionan en el código, en el pipeline que los valida y prepara antes del entrenamiento.

How it shows up in a diff

The shapes the same control failure takes.

La gobernanza de datos se debilita cuando un cambio permite que un modelo se entrene con datos no examinados. Las formas recurrentes:

  • Se elimina un paso de validación del conjunto de datos

    Se suprime una verificación de los datos de entrenamiento (esquema, valores faltantes, calidad básica) para acelerar el proceso, por lo que el modelo se entrena con cualquier dato que contenga el conjunto.

  • Se omite una verificación de sesgo o representatividad

    Se elimina un paso que examinaba los datos en busca de lagunas o desequilibrios entre los grupos afectados, por lo que una clase conocida de sesgo queda sin revisar.

  • Se elimina el origen de los datos

    Ya no se registra de dónde provienen los datos de entrenamiento, por lo que los datos detrás de un modelo ya no pueden rastrearse ni gobernarse.

  • Se añade una nueva fuente de datos sin gobernanza

    Se incorpora una nueva fuente al entrenamiento sin aplicar ninguna de las prácticas de gobernanza que se usan con las fuentes existentes.

  • Se elimina el filtrado de registros defectuosos

    Se retira la deduplicación o eliminación de registros corruptos o fuera de alcance, lo que degrada la calidad de los datos con los que el modelo aprende.

Worked example

Un paso de validación del conjunto de datos, eliminado antes del entrenamiento.

Un pipeline de reentrenamiento ejecuta un paso de validación (esquema, valores faltantes, verificaciones básicas de representatividad) antes de entrenar. Para acelerar un experimento, se elimina la validación y el modelo ahora se entrena con cualquier dato que contenga el conjunto de datos.

ml/retrain.ts+0 -1
async function retrain(dataset) {-  await validateDataset(dataset) // schema, gaps, representativeness  const model = await train(dataset)  return model}
heygrcEU AI Act Art. 10

Eliminar la validación significa que el sistema de alto riesgo puede entrenarse con datos que no han sido examinados en cuanto a calidad, lagunas o sesgos, lo que el Art. 10 (gobernanza de datos) exige para los conjuntos de entrenamiento, validación y prueba. Mantén el paso de validación. Si el sistema es de alto riesgo y está dentro del alcance es para tu propia evaluación.

What an auditor does with this

La gobernanza de datos se verifica en el pipeline y en la documentación.

La conformidad para un sistema de alto riesgo examina cómo se gobernaron sus datos: que los datos de entrenamiento, validación y prueba se examinaron en cuanto a calidad, representatividad y sesgos, y que esto está documentado. Un cambio que eliminó una validación o verificación de sesgo, o incorporó una fuente sin gobernanza, es la brecha concreta detrás de esto, y se refleja en el diff del pipeline de datos.

What this is, and is not

Una revisión, no un programa de gobernanza de datos.

heygrc marca los cambios que afectan al Art. 10 y cita el artículo para que la corrección se realice en la solicitud de extracción. No evalúa tus conjuntos de datos en busca de sesgos ni ejecuta tu proceso de gobernanza. Detecta el momento en que un cambio permite que un sistema de alto riesgo se entrene con datos no gobernados, en el diff.