LuAITools.com
提交工具
👁️AI
Personas reales puntuando la salida de la IA

Evaluación humana

La evaluación humana pone a personas reales a puntuar la salida de la IA, señalar fallos y dejar feedback: la vara definitiva para saber si es útil, segura y suena humana.

¿Qué es la evaluación humana?

Hay cosas que a las máquinas aún les cuesta medir: si una respuesta «se lee bien» u «ofende a alguien». La evaluación humana pone a personas reales delante de la salida de una IA, pidiéndoles que la puntúen en varias dimensiones y escriban comentarios, para juzgar si de verdad es buena.

¿Por qué no podemos saltarnos a las personas?

La calidad es subjetiva
«Útil», «creativa», «tono adecuado»: es difícil medirlos con precisión en código. El criterio humano es lo más directo.
La seguridad necesita un ojo humano
Discriminación, consejos peligrosos: esas líneas rojas, hoy por hoy, siguen necesitando personas que las detecten.

¿Cómo se suele hacer?

Puntuación
Los evaluadores puntúan las salidas en utilidad, precisión, seguridad, etc., con una escala del 1 al 5 o bueno/regular/malo.
Comparación lado a lado
Se ponen las respuestas de dos modelos una al lado de la otra y se pregunta cuál es mejor: el mismo ranking de preferencias que impulsa el RLHF.
Comentarios escritos
No solo puntuaciones, sino «por qué está mal y dónde»: ese feedback escrito vale oro para mejorar el modelo.

Los costes, y la salida

La evaluación humana es cara, lenta y depende del sesgo del evaluador. Por eso los equipos suelen combinarla con la automática: la evaluación automática corre a escala para cubrir rápido, mientras las personas vigilan la calidad y dan el veredicto final.

En resumen: la evaluación humana es el «examinador humano» de la IA: lo que las máquinas no pueden medir, lo deciden las personas.

Comentarios