LuAITools.com
提交工具
🧪AI
La plantilla para puntuar a la IA

Conjunto de datos dorado

Un conjunto de datos dorado es un conjunto de prueba pequeño y etiquetado a mano que todos aceptan como correcto. Es la vara de medir la calidad de la IA y evita que el modelo empeore con cada cambio.

¿Qué es un golden dataset?

Para juzgar si una IA es buena, necesitas una «respuesta correcta». Un golden dataset es un lote de muestras de prueba que los humanos han etiquetado con cuidado y que todos aceptan como «la respuesta correcta». Piénsalo como la plantilla de soluciones de un examen: lo usas para puntuar al modelo y ver cómo va de verdad.

¿Por qué llamarlo «dorado»?

Etiquetas de mucha calidad
Cada entrada la han revisado personas, una y otra vez. No son datos raspados al azar: son de nivel de respuesta de referencia.
Es el único árbitro
En un equipo de datos, el conjunto dorado es la referencia. Antes de lanzar un modelo, lo pasas por el conjunto dorado y ves si la puntuación subió o bajó.

¿En qué se diferencia de un conjunto de prueba normal?

Los normales: grandes, pero ruidosos
Muchos se generan con código o etiquetas débiles, así que se cuelan errores.
Los dorados: pequeños, pero fiables
Quizá unos cientos o miles de entradas, pero cada una aguanta el escrutinio: es la última palabra sobre lo correcto y lo incorrecto.

¿Cómo se usa?

Pruebas de regresión
Pásalo tras cada cambio de modelo o de prompt, para no «arreglar una cosa y romper diez».
Elegir modelos y ajustar
¿Qué modelo candidato es mejor? Compara sus puntuaciones en el conjunto dorado y deja que decidan los datos.

En resumen: un golden dataset es la «plantilla de soluciones» de la IA: puntúa con ella a diario y apóyate en ella tras los cambios, para que nada empeore.

Comentarios