LuAITools.com
提交工具
📚AI
Enseñar al modelo a seguir instrucciones

Ajuste fino supervisado

El ajuste fino supervisado (SFT) sigue entrenando un modelo base con pares de pregunta y respuesta de calidad, para que aprenda a seguir instrucciones y producir formatos correctos: el paso de «sabe hablar» a «sabe trabajar».

¿Qué es el ajuste fino supervisado?

Un modelo base ha leído océanos de texto y sabe «continuar» una frase, pero aún no sabe «seguir órdenes»: le preguntas algo y puede que siga escribiendo en lugar de responder. El ajuste fino supervisado (SFT) lo entrena una ronda más con pares de pregunta y respuesta cuidadosamente preparados, para que aprenda a responder lo que se le pide, y a responder bien.

¿En qué se diferencia del preentrenamiento?

Preentrenamiento: aprender el lenguaje
En esta fase el modelo solo lee a gran escala y aprende «qué suele venir después». Eso es gramática y sentido común, pero aún no mentalidad de servicio.
SFT: aprender a responder
Con muestras de pregunta-respuesta e instrucciones, el SFT le enseña que «este usuario necesita ayuda, así que dale una respuesta directa y útil». Solo después de esto el modelo empieza a sentirse un asistente.

¿De dónde salen los datos?

La calidad del SFT depende mucho de los datos. Los buenos datos de instrucciones suelen venir de redacción humana, de respuestas seleccionadas, o de modelos más potentes que hacen borradores que luego los humanos verifican. Datos más limpios y diversos, modelo más fiable.

Qué logra — y sus límites

El SFT enseña rápido el formato y el seguimiento de instrucciones con menos coste que el RLHF, pero solo «imita la respuesta modelo»: aún no distingue «bueno» de «mejor». Ahí entra el RLHF.

En resumen: el ajuste fino supervisado le muestra a la IA los «deberes modelo» para que aprenda a responder en consecuencia.

Comentarios