¿Qué es LLM-as-a-Judge?
Después de actualizar un modelo, ¿cómo sabes que de verdad mejoró? La forma más fiable es que humanos puntúen respuestas una a una: cara y lenta. LLM-as-a-Judge le da la vuelta: un «modelo juez» evalúa la salida del modelo candidato, la califica según criterios que fijas de antemano, escribe comentarios y decide qué es bueno o malo.¿Cómo juzga?
Comparación por paresPone lado a lado las respuestas del modelo A y del B y pregunta cuál es mejor: ideal para comprobar «¿ha empeorado la nueva versión?».
Puntuación de una sola respuesta
Asigna una nota o nivel a una respuesta: relevancia, precisión, utilidad, etcétera.
Evaluación por rúbrica
Le entregas al juez una rúbrica detallada y que revise criterio a criterio, reduciendo decisiones arbitrarias.
¿Qué lo hace atractivo?
Rápido y baratoUn humano tarda minutos por respuesta; un modelo juez tarda segundos y cuesta órdenes de magnitud menos.
Escalable
Correr miles o decenas de miles de evaluaciones al día deja de ser un problema.
Reproducible
Fija el prompt y los parámetros y los resultados son básicamente repetibles: ideal para pruebas de regresión.
La trampa
Los jueces también tienen sesgos: prefieren respuestas largas, su propio estilo, y se les escapan los errores factuales. Así que no pueden sustituir del todo a los humanos. Lo habitual: el juez hace un primer filtrado y los humanos revisan por muestreo, o varios jueces puntúan en cruz las mismas respuestas.En resumen: LLM-as-a-Judge convierte a una IA en examinadora: rápida, pero no tomes su nota como dogma.
Comentarios