¿Qué es la evaluación automática?
La evaluación humana implica leer una muestra a la vez: lento y caro. La evaluación automática pone a un programa o a otro modelo en el papel de examinador: puntúa la salida, detecta errores y juzga la calidad solo, procesando miles de muestras en segundos.Los enfoques habituales
Reglas y métricasCoincidencia exacta, BLEU, ROUGE y compañía miden cuánto se acerca la respuesta de una máquina a una de referencia: ideal para tareas objetivas.
Un modelo como juez
Usa un LLM más potente para puntuar las respuestas de otro modelo. Se llama LLM-as-a-Judge y puede evaluar dimensiones más blandas como el tono y la coherencia.
Tests tipo aserción
Pon restricciones duras a la salida —«debe devolver JSON válido», «sin insultos»— y suspende cuando se violan.
Lo bueno y lo malo
A favor: rápido, barato, escalableCambias un prompt y ves los resultados completos en segundos, algo que los humanos no pueden hacer.
En contra: puede no pillar el punto
Las puntuaciones de máquina no siempre coinciden con el gusto humano, sobre todo en lo subjetivo como la creatividad o el humor.
Cómo usarla bien
El patrón habitual es «automatización para cubrir, humanos para juzgar»: usa la evaluación automática para feedback rápido en el día a día y la humana para la aprobación final antes de lanzar. Juntas, logras velocidad y seguridad.En resumen: la evaluación automática es el «examinador máquina» de la IA: rápido, barato y hecho para escalar, pero la última palabra la tienen las personas.
Comentarios