Los datos de los que aprende un modelo, gobernados.
El Artículo 10 exige que los conjuntos de datos de entrenamiento, validación y prueba detrás de un sistema de IA de alto riesgo estén sujetos a prácticas de gobernanza de datos: se examinan en cuanto a relevancia, representatividad, lagunas y posibles sesgos. Un modelo se moldea con los datos de los que aprende, y esos datos se gestionan en el código, en el pipeline que los valida y prepara antes del entrenamiento.
The shapes the same control failure takes.
La gobernanza de datos se debilita cuando un cambio permite que un modelo se entrene con datos no examinados. Las formas recurrentes:
Se elimina un paso de validación del conjunto de datos
Se suprime una verificación de los datos de entrenamiento (esquema, valores faltantes, calidad básica) para acelerar el proceso, por lo que el modelo se entrena con cualquier dato que contenga el conjunto.
Se omite una verificación de sesgo o representatividad
Se elimina un paso que examinaba los datos en busca de lagunas o desequilibrios entre los grupos afectados, por lo que una clase conocida de sesgo queda sin revisar.
Se elimina el origen de los datos
Ya no se registra de dónde provienen los datos de entrenamiento, por lo que los datos detrás de un modelo ya no pueden rastrearse ni gobernarse.
Se añade una nueva fuente de datos sin gobernanza
Se incorpora una nueva fuente al entrenamiento sin aplicar ninguna de las prácticas de gobernanza que se usan con las fuentes existentes.
Se elimina el filtrado de registros defectuosos
Se retira la deduplicación o eliminación de registros corruptos o fuera de alcance, lo que degrada la calidad de los datos con los que el modelo aprende.
Un paso de validación del conjunto de datos, eliminado antes del entrenamiento.
Un pipeline de reentrenamiento ejecuta un paso de validación (esquema, valores faltantes, verificaciones básicas de representatividad) antes de entrenar. Para acelerar un experimento, se elimina la validación y el modelo ahora se entrena con cualquier dato que contenga el conjunto de datos.
async function retrain(dataset) {- await validateDataset(dataset) // schema, gaps, representativeness const model = await train(dataset) return model}Eliminar la validación significa que el sistema de alto riesgo puede entrenarse con datos que no han sido examinados en cuanto a calidad, lagunas o sesgos, lo que el Art. 10 (gobernanza de datos) exige para los conjuntos de entrenamiento, validación y prueba. Mantén el paso de validación. Si el sistema es de alto riesgo y está dentro del alcance es para tu propia evaluación.
La gobernanza de datos se verifica en el pipeline y en la documentación.
La conformidad para un sistema de alto riesgo examina cómo se gobernaron sus datos: que los datos de entrenamiento, validación y prueba se examinaron en cuanto a calidad, representatividad y sesgos, y que esto está documentado. Un cambio que eliminó una validación o verificación de sesgo, o incorporó una fuente sin gobernanza, es la brecha concreta detrás de esto, y se refleja en el diff del pipeline de datos.
Una revisión, no un programa de gobernanza de datos.
heygrc marca los cambios que afectan al Art. 10 y cita el artículo para que la corrección se realice en la solicitud de extracción. No evalúa tus conjuntos de datos en busca de sesgos ni ejecuta tu proceso de gobernanza. Detecta el momento en que un cambio permite que un sistema de alto riesgo se entrene con datos no gobernados, en el diff.