¿Qué es el ajuste fino supervisado?
Un modelo base ha leído océanos de texto y sabe «continuar» una frase, pero aún no sabe «seguir órdenes»: le preguntas algo y puede que siga escribiendo en lugar de responder. El ajuste fino supervisado (SFT) lo entrena una ronda más con pares de pregunta y respuesta cuidadosamente preparados, para que aprenda a responder lo que se le pide, y a responder bien.¿En qué se diferencia del preentrenamiento?
Preentrenamiento: aprender el lenguajeEn esta fase el modelo solo lee a gran escala y aprende «qué suele venir después». Eso es gramática y sentido común, pero aún no mentalidad de servicio.
SFT: aprender a responder
Con muestras de pregunta-respuesta e instrucciones, el SFT le enseña que «este usuario necesita ayuda, así que dale una respuesta directa y útil». Solo después de esto el modelo empieza a sentirse un asistente.
¿De dónde salen los datos?
La calidad del SFT depende mucho de los datos. Los buenos datos de instrucciones suelen venir de redacción humana, de respuestas seleccionadas, o de modelos más potentes que hacen borradores que luego los humanos verifican. Datos más limpios y diversos, modelo más fiable.Qué logra — y sus límites
El SFT enseña rápido el formato y el seguimiento de instrucciones con menos coste que el RLHF, pero solo «imita la respuesta modelo»: aún no distingue «bueno» de «mejor». Ahí entra el RLHF.En resumen: el ajuste fino supervisado le muestra a la IA los «deberes modelo» para que aprenda a responder en consecuencia.
Comentarios