← Últimos artículos
💬 NLP

TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

Este artículo introduce la Optimización de Preferencias de Bregman a nivel de token (TBPO), un método novedoso que deriva un modelo de preferencias de Bradley-Terry a nivel de token a partir de comparaciones estándar a nivel de secuencia para mejorar la calidad de la alineación, la estabilidad del entrenamiento y la diversidad de la salida, manteniendo al mismo tiempo la simplicidad de la Optimización de Preferencias Directa (DPO).

Autores originales: Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van, Duy Minh Ho Nguyen, Khoa Doan, Trung Le

Publicado 2026-05-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van, Duy Minh Ho Nguyen, Khoa Doan, Trung Le

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot a escribir una historia. Le muestras dos versiones de la misma historia: una es una "ganadora" (buena, útil y segura) y la otra es una "perdedora" (mala, inútil o peligrosa). Tu objetivo es ajustar el robot para que aprenda a escribir la versión "ganadora".

Durante mucho tiempo, la forma estándar de hacer esto (llamada DPO) fue como calificar la historia completa de una sola vez. Decías: "Toda esta historia es genial, toda esa historia es mala". El robot luego intentaba ajustar su cerebro para mejorar toda la historia.

El Problema:
El artículo argumenta que esto es un poco como juzgar a un corredor de maratón solo por su tiempo de llegada, sin observar su zancada. Los modelos de lenguaje no escriben historias completas de una sola vez; escriben una palabra a la vez. Cada palabra que eligen es una decisión minúscula basada en lo que vino antes. Si el robot comete un pequeño error en la muy primera palabra, toda la historia puede salirse de los cauces, incluso si la calificación de "historia completa" finalmente mejora.

Los métodos existentes a "nivel de token" intentaron solucionar esto descomponiendo la historia, pero esencialmente seguían siendo solo distribuir la calificación de "historia completa" entre las palabras, en lugar de enseñar al robot a tomar la decisión correcta en cada paso individual.

La Solución: TokenRatio (TBPO)
Los autores proponen un nuevo método llamado Optimización de Preferencias Bregman a Nivel de Token (TBPO). Así es como lo explican usando analogías simples:

1. La analogía del "GPS paso a paso"

Imagina que conduces desde Nueva York hasta Los Ángeles.

  • Método Antiguo (a nivel de secuencia): Miras el destino final. Si llegas a LA, recibes una estrella dorada. Si terminas en Canadá, recibes una luz roja. Intentas ajustar tu conducción para obtener esa estrella dorada, pero no sabes exactamente en qué giro fue el error.
  • Método TBPO (a nivel de token): Este método actúa como un GPS que te da una puntuación paso a paso. En cada intersección individual (cada palabra), pregunta: "¿Tomaste el camino que lleva a la buena historia o a la mala?". Enseña al robot a tomar la decisión perfecta en cada paso individual, no solo a esperar que el resultado final sea bueno.

2. El problema de "Dos Caminos Diferentes"

Aquí está la parte complicada que resuelve el artículo. Al comparar una historia "ganadora" y una "perdedora", a menudo se ven muy diferentes desde muy temprano.

  • El Escenario: Imagina que la historia ganadora comienza con "El gato se sentó..." y la historia perdedora comienza con "El perro corrió...".
  • El Problema: Si solo comparas la siguiente palabra, no estás comparando solo la palabra; estás comparando dos puntos de partida completamente diferentes. Es como comparar a un corredor que comenzó en la cima de una colina contra uno que comenzó en la base. El que está arriba tiene una ventaja injusta.
  • La Solución: El artículo introduce un "factor de corrección" (llamado línea base).
    • TBPO-Q: Esta versión construye una pequeña "calculadora" ligera que estima lo "buena" que era la línea de salida (el prefijo). Resta esa ventaja para que solo juzgues la siguiente palabra, no toda la historia previa.
    • TBPO-A: Esta versión hace la misma matemática pero usa un truco diferente (llamado "normalización de ventaja") para cancelar las diferencias del punto de partida sin necesidad de una calculadora separada.

3. La Magia de la "Relación de Densidad"

El artículo utiliza un concepto matemático sofisticado llamado Ajuste de Relación de Densidad (específicamente usando algo llamado Divergencia Bregman).

  • Analogía Simple: Imagina que tienes una bolsa de canicas rojas (palabras buenas) y canicas azules (palabras malas). Quieres enseñarle al robot a elegir canicas rojas.
  • En lugar de solo contarlas, el método del artículo observa la relación de canicas rojas a azules en las historias "buenas" versus las historias "malas". Intenta hacer que la relación interna del robot coincida perfectamente con la relación "buena".
  • Al hacer esto a nivel de palabra, el robot aprende una "política" (un conjunto de reglas) que es óptima en cada momento individual, no solo para el resultado final.

¿Qué Descubrieron?
Los autores probaron este nuevo método en dos modelos de IA populares (Mistral y Llama 3) a través de muchas tareas diferentes:

  • Razonamiento más inteligente: Los modelos mejoraron en matemáticas y acertijos de lógica (como GSM8K y MMLU).
  • Mejor Alineación: Se volvieron más útiles y menos propensos a decir cosas dañinas.
  • Más Variedad: Un problema común en el entrenamiento de IA es que los modelos se vuelven aburridos y repetitivos (como un disco rayado). TBPO mantuvo a los modelos diversos y creativos, mientras que otros métodos los hicieron más robóticos.
  • Eficiencia: Lograron estos resultados sin necesidad de bucles complejos y costosos de aprendizaje por refuerzo. Fue una mejora "plug-and-play" sobre los métodos estándar.

En Resumen:
El artículo dice: "Dejen de calificar todo el ensayo de una sola vez. Enseñen a la IA a tomar la decisión correcta para cada palabra individual, mientras corrigen el hecho de que algunas historias comienzan con una ventaja". El resultado es una IA más inteligente, más útil y menos repetitiva.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →