¿Qué es RLHF?
Justo después del preentrenamiento, un modelo grande es como un chico brillante que aún no ha aprendido a filtrar: sabe muchísimo, pero no distingue qué conviene decir, ni adivina qué respuesta esperas. RLHF — aprendizaje por refuerzo con retroalimentación humana — es el proceso de ponerle un mentor. Con las preferencias de las personas se le va moldeando hasta convertirlo en algo capaz y con tacto.¿Por qué hace falta gente en el proceso?
Hablar bien no es lo mismo que acertarEl modelo puede generar párrafos enteros que no son lo que querías. Pregúntale cómo adelgazar y quizá te dé una lista de dietas peligrosas. El valor de la retroalimentación humana es enseñarle: esa respuesta es mala, esta es buena.
«Bueno» no tiene una regla fija: hay que enseñárselo
Qué es útil, qué es inofensivo, qué encaja con lo esperado: es todo muy subjetivo. Una máquina no puede aprenderlo sola; necesita montones de etiquetas humanas.
Cómo funciona RLHF, a grandes rasgos
Primero: entrenar un modelo de recompensaSe le pide al modelo varias respuestas para la misma pregunta y se le pide a personas que las ordenen de mejor a peor. Con esos rankings se entrena un «evaluador» que aprende a puntuar respuestas: a más puntuación, más gustó.
Después: usar el evaluador para reajustar el modelo
Con el evaluador listo, se deja que el modelo genere respuestas, se puntúan, y se le empuja hacia puntuaciones más altas. Se repite una y otra vez, y el modelo va leyendo mejor lo que la gente quiere.
¿Qué problema resuelve de verdad?
RLHF es una gran parte de por qué productos como ChatGPT resultan útiles. Hace que las respuestas se acerquen a los valores humanos, alucinen menos y admitan con más naturalidad «no lo sé». Sin RLHF, un modelo grande solo es elocuente. Con él, aprende a ser útil de verdad — y a aceptar correcciones.En resumen: RLHF usa el criterio humano como regla para moldear la IA, convirtiéndola de algo que sabe hablar en algo que sabe decir lo correcto.
Comentarios