Frescura y Sesgo de Datos de Entrenamiento
Los datos con los que se entrenó un modelo no dejan de envejecer el día que se pone en producción. Este plan vigila cuándo dejan de representar el mundo real, y con qué sesgos empezaron.
Qué incluye
- PDF con el plan de vigilancia de frescura: qué indicadores revisar y con qué frecuencia según la volatilidad del dominio
- Checklist de sesgo y representatividad: comprobaciones sobre grupos demográficos, periodos temporales y fuentes sobre/infrarrepresentadas
- Excel con plantilla de registro por dataset
- Aviso Legal
Por qué existe este documento
El Art. 10 del AI Act exige que los datos de entrenamiento sean "pertinentes, suficientemente representativos y, en la medida de lo posible, libres de errores" — pero esa evaluación no puede hacerse solo una vez, al construir el modelo, y darse por buena para siempre. Los datos con los que se entrenó un modelo de hace dos años describen un mundo que ya cambió, y la representatividad que tenían al principio puede haberse erosionado sin que nadie lo note hasta que aparece un problema en producción.
Preguntas frecuentes
¿En qué se diferencia esto del Pack Art. 10 AI Act?
El Pack Art. 10 cubre la documentación de gobierno de datos exigida en el momento de construir el sistema. Este producto es el seguimiento continuo posterior: vigilar si esos datos siguen siendo representativos y actuales con el tiempo.
¿Qué significa que un dataset de entrenamiento pierda "frescura"?
Significa que el mundo que describen esos datos ya no coincide con el mundo actual. Un modelo entrenado con datos de hace 3 años puede estar tomando decisiones basadas en una realidad que ya no existe.
¿En qué formato se entrega?
PDF con el plan de vigilancia de frescura y el checklist de sesgo/representatividad, más Excel con plantilla de registro por dataset.