LuAITools.com
提交工具
📡AI
Cuando el mundo avanza sin tu modelo

Deriva de datos

Cuando los datos del mundo real cambian en silencio mientras el modelo se queda en el mundo viejo, eso es data drift: la razón silenciosa por la que los modelos empiezan a fallar.

¿Qué es el data drift?

Un modelo entrena con datos del pasado, pero la realidad no se queda quieta. El data drift es lo que pasa cuando la distribución de los datos que llegan a producción se aleja poco a poco de los datos con los que entrenaste. Imagina un modelo que predice «qué compra la gente los fines de semana» con datos de 2019; unos años después la gente se comporta distinto, pero el modelo sigue creyendo que el mundo es el mismo.

¿Qué tipos hay?

Deriva de concepto
No cambian los datos, cambia la relación entre entrada y salida. La definición de «correo bueno» cambia a medida que evolucionan las tácticas de spam.
Cambio de covariable
Cambia la distribución de entrada — digamos la mezcla de edades de los usuarios — mientras la regla de fondo sigue igual.
Deriva de etiqueta
Cambia la distribución del propio objetivo, como la cuota de ventas de una categoría moviéndose.

¿Por qué ocurre?

El comportamiento de los usuarios, las estaciones, la regulación, la competencia — todo cambia, y hace que el «ahora» se vea distinto del «momento del entrenamiento». Cuanto más cerca del mundo real está un modelo, más le pega la deriva.

¿Cómo detectarla y tratarla?

Compara distribuciones sin parar
Con estadística, compara regularmente los datos de producción y los de entrenamiento, y salta la alarma cuando la brecha crece.
Reentrena a tiempo
Confirmada la deriva, reentrena con datos frescos para que el modelo se ponga al día.
Añade monitoreo
Mete la detección de deriva dentro del monitoreo y hazla un sistema de alerta temprana automático.

En resumen: el data drift es «el mundo cambió y el modelo no». Detectarlo y reentrenar es lo que mantiene fiable a la IA a largo plazo.

Comentarios