¿Qué es la optimización directa de preferencias (DPO)?
Para que las respuestas de un modelo encajen con lo que prefieren los humanos, la ruta clásica es el RLHF: primero entrenar un «modelo de recompensa» que puntúe, y luego usarlo para guiar al modelo — muchos pasos y mucho coste. El DPO (Direct Preference Optimization) toma un camino más recto: se salta el modelo de recompensa y optimiza el modelo directamente con datos de «los humanos prefieren A antes que B».¿En qué se diferencia del RLHF?
RLHF: el camino largoPrimero entrenas un evaluador y luego dejas que ese evaluador guíe al modelo — como contratar a un intermediario.
DPO: directo al grano
No hay evaluador que construir. Actualizas los parámetros del modelo directamente a partir de pares de preferencia: un proceso más corto y barato.
¿Cuál es la ventaja?
Más simple y estableQuita la etapa de entrenar el modelo de recompensa y quitas mucho ajuste y muchos sitios donde algo puede romperse.
Más barato
No hace falta mantener todo un modelo extra como «juez», así que bajan el cómputo y el coste de ingeniería.
¿Cuáles son sus límites?
El DPO depende de datos de preferencia amplios y de calidad: dale malos datos y el resultado sufre. Y en algunos casos complejos, un modelo de recompensa explícito puede dar un feedback más fino, así que el DPO no sustituye del todo al RLHF. Más bien cada uno encaja en situaciones distintas.En resumen: el DPO se salta el paso del «modelo de recompensa» del RLHF y optimiza el modelo directamente con preferencias humanas — más simple y más barato.
Comentarios