¿Qué es un golden dataset?
Para juzgar si una IA es buena, necesitas una «respuesta correcta». Un golden dataset es un lote de muestras de prueba que los humanos han etiquetado con cuidado y que todos aceptan como «la respuesta correcta». Piénsalo como la plantilla de soluciones de un examen: lo usas para puntuar al modelo y ver cómo va de verdad.¿Por qué llamarlo «dorado»?
Etiquetas de mucha calidadCada entrada la han revisado personas, una y otra vez. No son datos raspados al azar: son de nivel de respuesta de referencia.
Es el único árbitro
En un equipo de datos, el conjunto dorado es la referencia. Antes de lanzar un modelo, lo pasas por el conjunto dorado y ves si la puntuación subió o bajó.
¿En qué se diferencia de un conjunto de prueba normal?
Los normales: grandes, pero ruidososMuchos se generan con código o etiquetas débiles, así que se cuelan errores.
Los dorados: pequeños, pero fiables
Quizá unos cientos o miles de entradas, pero cada una aguanta el escrutinio: es la última palabra sobre lo correcto y lo incorrecto.
¿Cómo se usa?
Pruebas de regresiónPásalo tras cada cambio de modelo o de prompt, para no «arreglar una cosa y romper diez».
Elegir modelos y ajustar
¿Qué modelo candidato es mejor? Compara sus puntuaciones en el conjunto dorado y deja que decidan los datos.
En resumen: un golden dataset es la «plantilla de soluciones» de la IA: puntúa con ella a diario y apóyate en ella tras los cambios, para que nada empeore.
Comentarios