LuAITools.com
提交工具
🎯AI
Enseñar al modelo a seguir órdenes

Ajuste por instrucciones

El ajuste por instrucciones entrena al modelo con muchos pares de instrucción y respuesta para que entienda mejor lo que quieres: de rematador de frases a buen oyente.

¿Qué es el ajuste por instrucciones?

Tras leer océanos de texto, un modelo base sabe continuar escribiendo, pero no necesariamente seguir órdenes. Le pides «traduce esto al inglés» y quizá siga alargando la frase. El ajuste por instrucciones lo entrena con un montón de pares «instrucción → respuesta», para que aprenda a leer tu intención y luego hacerlo.

¿En qué se diferencia del ajuste fino normal?

Pone énfasis en el formato
Los datos de instrucciones suelen tener la forma «por favor, haz X», así que tras el entrenamiento el modelo responde a órdenes de forma más fiable.
Pone énfasis en generalizar
El buen ajuste por instrucciones no memoriza respuestas: aprende una habilidad general, y así maneja instrucciones que nunca ha visto.

¿Qué aspecto tienen los datos?

Instrucciones simples
«Traduce esta frase al japonés: …».
Instrucciones complejas
«Lee este contrato, encuentra los riesgos potenciales y enumera tres».
Instrucciones multi-turno
Conversaciones simuladas que enseñan al modelo a repreguntar, aclarar y trabajar con el contexto.

¿Por qué importa?

El ajuste por instrucciones es el paso que lleva al modelo de «sabe hablar» a «sabe trabajar». Hace que una IA se sienta como un asistente que te entiende, no una máquina que solo sigue añadiendo palabras. Capacidades posteriores como el RLHF o el uso de herramientas suelen construirse sobre esta capa de «sabe recibir instrucciones».

En resumen: el ajuste por instrucciones entrena a una IA con miles de pares de «tarea más respuesta modelo», convirtiéndola de alguien que sabe hablar en alguien que resuelve cosas.

Comentarios