¿Qué son los datos sintéticos?
En pocas palabras, son datos que una IA se inventa. El modelo aprende primero los patrones de los datos reales y luego produce en masa ejemplos nuevos con la misma estructura y distribución, pero sin personas ni hechos reales dentro. Es como entrenar un generador de caras con fotos reales y luego producir infinitas caras que nunca existieron.¿Por qué querrías datos falsos?
Los datos reales son caros y difíciles de conseguirImágenes médicas, transacciones financieras, casos de enfermedades raras: escasean o están atrapados por las leyes de privacidad.
El riesgo de cumplimiento es real
Entrena con datos reales de usuarios y una filtración se convierte en un desastre. Los datos sintéticos no llevan información de nadie real, así que esquivan buena parte de eso.
Puedes generar justo lo que falta
¿Necesitas entrenar un modelo para detectar accidentes en días de lluvia y no tienes muestras? Genera miles.
¿Cómo se hacen?
Una vía común: que un modelo aprenda la distribución de los datos reales y luego use un modelo generativo — un modelo de difusión o una GAN — para producir muestras nuevas en masa. También puedes hacer que un modelo grande «escriba» texto sintético siguiendo reglas y usarlo para entrenar a uno más pequeño.La trampa
Por muy real que parezca, el dato sintético copia patrones de datos reales. Si la fuente tiene sesgo, el dato sintético lo amplifica. Abusa de él y el modelo puede «entrenarse en círculos», aprendiendo sus propias alucinaciones inventadas.En resumen: los datos sintéticos son datos falsos generados por IA — te ahorran el dolor de cabeza de la privacidad, pero heredan el riesgo de «entrenar con fantasía».
Comentarios