LuAITools.com
提交工具
⚖️AI
Alinear un modelo sin modelo de recompensa

Optimización directa de preferencias

El DPO optimiza un modelo directamente con datos de preferencia humana, saltándose el modelo de recompensa — más simple y barato que el RLHF.

¿Qué es la optimización directa de preferencias (DPO)?

Para que las respuestas de un modelo encajen con lo que prefieren los humanos, la ruta clásica es el RLHF: primero entrenar un «modelo de recompensa» que puntúe, y luego usarlo para guiar al modelo — muchos pasos y mucho coste. El DPO (Direct Preference Optimization) toma un camino más recto: se salta el modelo de recompensa y optimiza el modelo directamente con datos de «los humanos prefieren A antes que B».

¿En qué se diferencia del RLHF?

RLHF: el camino largo
Primero entrenas un evaluador y luego dejas que ese evaluador guíe al modelo — como contratar a un intermediario.
DPO: directo al grano
No hay evaluador que construir. Actualizas los parámetros del modelo directamente a partir de pares de preferencia: un proceso más corto y barato.

¿Cuál es la ventaja?

Más simple y estable
Quita la etapa de entrenar el modelo de recompensa y quitas mucho ajuste y muchos sitios donde algo puede romperse.
Más barato
No hace falta mantener todo un modelo extra como «juez», así que bajan el cómputo y el coste de ingeniería.

¿Cuáles son sus límites?

El DPO depende de datos de preferencia amplios y de calidad: dale malos datos y el resultado sufre. Y en algunos casos complejos, un modelo de recompensa explícito puede dar un feedback más fino, así que el DPO no sustituye del todo al RLHF. Más bien cada uno encaja en situaciones distintas.

En resumen: el DPO se salta el paso del «modelo de recompensa» del RLHF y optimiza el modelo directamente con preferencias humanas — más simple y más barato.

Comentarios