LuAITools.com
提交工具
🎯AI
Aprendizaje por refuerzo con retroalimentación humana

RLHF

RLHF ajusta el comportamiento de un modelo a partir de rankings de preferencias humanas. Es una de las técnicas clave que hacen que la salida de la IA sea más segura y se alinee con lo que la gente quiere de verdad.

¿Qué es RLHF?

Justo después del preentrenamiento, un modelo grande es como un chico brillante que aún no ha aprendido a filtrar: sabe muchísimo, pero no distingue qué conviene decir, ni adivina qué respuesta esperas. RLHF — aprendizaje por refuerzo con retroalimentación humana — es el proceso de ponerle un mentor. Con las preferencias de las personas se le va moldeando hasta convertirlo en algo capaz y con tacto.

¿Por qué hace falta gente en el proceso?

Hablar bien no es lo mismo que acertar
El modelo puede generar párrafos enteros que no son lo que querías. Pregúntale cómo adelgazar y quizá te dé una lista de dietas peligrosas. El valor de la retroalimentación humana es enseñarle: esa respuesta es mala, esta es buena.
«Bueno» no tiene una regla fija: hay que enseñárselo
Qué es útil, qué es inofensivo, qué encaja con lo esperado: es todo muy subjetivo. Una máquina no puede aprenderlo sola; necesita montones de etiquetas humanas.

Cómo funciona RLHF, a grandes rasgos

Primero: entrenar un modelo de recompensa
Se le pide al modelo varias respuestas para la misma pregunta y se le pide a personas que las ordenen de mejor a peor. Con esos rankings se entrena un «evaluador» que aprende a puntuar respuestas: a más puntuación, más gustó.
Después: usar el evaluador para reajustar el modelo
Con el evaluador listo, se deja que el modelo genere respuestas, se puntúan, y se le empuja hacia puntuaciones más altas. Se repite una y otra vez, y el modelo va leyendo mejor lo que la gente quiere.

¿Qué problema resuelve de verdad?

RLHF es una gran parte de por qué productos como ChatGPT resultan útiles. Hace que las respuestas se acerquen a los valores humanos, alucinen menos y admitan con más naturalidad «no lo sé». Sin RLHF, un modelo grande solo es elocuente. Con él, aprende a ser útil de verdad — y a aceptar correcciones.

En resumen: RLHF usa el criterio humano como regla para moldear la IA, convirtiéndola de algo que sabe hablar en algo que sabe decir lo correcto.

Comentarios