¿Qué es el aprendizaje por refuerzo?
Piensa en cómo educas a un cachorro: hace algo bien, le das una golosina; lo hace mal, no hay golosina. Tras unas cuantas rondas, capta la idea. El aprendizaje por refuerzo (RL) usa esa misma lógica: una IA prueba cosas en un entorno, recibe recompensa por los aciertos y castigo por los errores, y poco a poco aprende una estrategia óptima.¿En qué se diferencia del aprendizaje supervisado?
Aprendizaje supervisado: aprender con la plantilla de respuestasAlguien etiqueta la respuesta correcta de cada ejemplo y el modelo la imita.
Aprendizaje por refuerzo: aprender por ensayo y error
No hay plantilla. El agente explora por su cuenta y deduce lo correcto a partir de señales de recompensa.
Algunas ideas clave
Agente y entornoEl agente realiza acciones en un entorno, y el entorno responde.
Recompensa
Puntos por los aciertos, penalizaciones por los errores: la única señal de aprendizaje que recibe.
Política
La regla que acaba aprendiendo: «ante esta situación, haz esto».
Por qué importa
El RL es lo que permitió a la IA ganar a humanos en Go y videojuegos, y hoy es pieza clave del RLHF y de los modelos de razonamiento. Cualquier problema sin respuesta única — solo ensayo y error — lo necesita.En resumen: el aprendizaje por refuerzo es «golosina si lo haces bien, nada si lo haces mal» — la IA se enseña a sí misma la mejor jugada probando y fallando.
Comentarios