← Últimos artículos
🤖 AI

Autoregressive Direct Preference Optimization

Este artículo propone la Optimización de Preferencia Directa Autorregresiva (ADPO), una variante novedosa que reformula el objetivo de DPO aplicando explícitamente supuestos autorregresivos antes del modelo de Bradley-Terry, lo que resulta en una función de pérdida desplazada y la identificación de medidas distintas de longitud de token y de retroalimentación para una optimización de preferencias mejorada.

Autores originales: Masanari Oi, Mahiro Ukai, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

Publicado 2026-06-11
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Masanari Oi, Mahiro Ukai, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La visión general: Enseñando a un robot a escribir mejor

Imagina que estás enseñando a un robot a escribir historias. Tienes un libro de "Estándar de Oro" (el modelo de referencia) y un robot "Estudiante" (el modelo que se está aprendiendo). Quieres que el Estudiante escriba historias que los humanos prefieran por encima de las historias del Estándar de Oro.

Durante mucho tiempo, la mejor forma de hacer esto fue DPO (Optimización Directa de Preferencias). Piensa en DPO como un profesor que lee la historia completa que escribió el estudiante, la compara con la historia del Estándar de Oro y le da una única nota: "Bien" o "Mal".

El Problema:
El artículo argumenta que este sistema de calificación de "todo o nada" es un poco ineficiente. Los Grandes Modelos de Lenguaje (LLM) no escriben historias en un solo salto gigante; las escriben palabra por palabra (o token por token), como una persona escribiendo una frase. Sin embargo, el viejo método DPO espera hasta el final para dar retroalimentación. Es como un entrenador que espera hasta el final de un maratón para decirle al corredor: "Corriste bien", sin haber corregido nunca su técnica mientras corría.

La Solución: ADPO (DPO Autorregresivo)

Los autores proponen un nuevo método llamado ADPO. En lugar de esperar a que la historia termine para dar una nota, ADPO da retroalimentación paso a paso mientras la historia se está escribiendo.

La analogía de "La Película vs. La Fotografía"

  • DPO antiguo (La Fotografía): Imagina tomar una foto de una pintura terminada. Miras toda la imagen y dices: "Esta es mejor que esa". No sabes qué pinceladas la hicieron mejor.
  • Nuevo ADPO (La Película): Imagina observar al artista pintar la imagen en tiempo real. ADPO observa la primera pincelada, luego la segunda, luego la tercera. Pregunta: "¿Fue buena esta pincelada específica? ¿Fue la siguiente mejor?". Aprende a preferir el proceso de escribir, no solo el resultado final.

Las dos reglas de "Longitud"

Uno de los descubrimientos más interesantes del artículo es que existen realmente dos formas diferentes de medir la longitud al enseñar a estos modelos, y el método antiguo las confundía.

  1. Longitud de Tokens (El conteo de palabras): Esto es cuántas palabras escribe realmente el modelo. (Ej. "El gato se sentó" = 3 palabras).
  2. Longitud de Retroalimentación (Las unidades de calificación): Esto es cuántos fragmentos decide calificar el profesor a la vez.

La forma antigua: El profesor siempre calificaba la historia completa como un solo fragmento (Longitud de Retroalimentación = 1), independientemente de cuántas palabras tuviera.
La nueva forma (ADPO): El profesor puede elegir calificar la historia en fragmentos. Podría calificar cada palabra individual (Longitud de Retroalimentación = Conteo de Palabras), o podría calificar cada 10 palabras, o cada párrafo.

El artículo muestra que, al dividir la historia en fragmentos más pequeños (haciendo que la "Longitud de Retroalimentación" coincida con la "Longitud de Tokens"), el modelo aprende más rápido y escribe mejor.

Cómo funciona (La "Matemática" simplificada)

En el método antiguo, la matemática se veía así:

Toma la historia completa, calcula la diferencia, luego aplica una "sigmoide" (una función de suavizado) para obtener una puntuación.

En el nuevo método ADPO, la matemática cambia el orden:

Calcula la diferencia para cada paso, aplica la "sigmoide" a cada paso y, luego, súmalos todos.

La Analogía:

  • Forma Antigua: Mezclas todos los ingredientes para un pastel, lo horneas, lo pruebas entero y luego decides si necesitas más azúcar. (Demasiado tarde para arreglar la masa).
  • Nueva Forma: Pruebas la masa después de añadir la harina, luego después de los huevos, luego después del azúcar. Ajustas la receta sobre la marcha.

Los Resultados: ¿Funciona?

Los autores probaron este nuevo método en dos tipos de tareas:

  1. Problemas Matemáticos: Pidieron a los modelos que resolvieran problemas matemáticos complejos de palabras.
  2. Conversaciones: Pidieron a los modelos que charlaran con humanos.

Los Hallazgos:

  • Mejores Calificaciones: En casi todas las pruebas, los modelos entrenados con ADPO obtuvieron puntuaciones más altas que aquellos entrenados con el viejo método DPO.
  • Más fino es mejor: Los modelos funcionaron mejor cuando la "Longitud de Retroalimentación" era muy pequeña (revisando cada palabra individual). Esto demostró que los modelos se benefician de una retroalimentación constante y granular.
  • Sin costo adicional: Aunque revisar cada palabra suena a que tomaría más tiempo, los autores descubrieron que el tiempo extra requerido fue insignificante (menos del 6% más lento).

Resumen

El artículo presenta ADPO, una forma más inteligente de entrenar modelos de IA. En lugar de esperar a que la IA termine una tarea para darle una nota, ADPO le da retroalimentación en cada uno de los pasos del proceso. Al tratar la escritura de la IA como una secuencia de pequeños pasos en lugar de un gran bloque, los modelos aprenden a tomar mejores decisiones a lo largo de todo el proceso de generación, lo que resulta en un razonamiento matemático más inteligente y mejores conversaciones.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →