← Últimos artículos
💬 NLP

Improving Diffusion Language Model Decoding through Joint Search in Generation Order and Token Space

Este artículo introduce Order-Token Search, un nuevo método de decodificación para Modelos de Lenguaje de Difusión que explora conjuntamente el orden de generación y el espacio de tokens para superar a los modelos de referencia existentes en tareas de razonamiento matemático y de codificación.

Autores originales: Yangyi Shen, Tianjian Feng, Jiaqi Han, Wen Wang, Tianlang Chen, Chunhua Shen, Jure Leskovec, Stefano Ermon

Publicado 2026-02-06
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yangyi Shen, Tianjian Feng, Jiaqi Han, Wen Wang, Tianlang Chen, Chunhua Shen, Jure Leskovec, Stefano Ermon

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de resolver un rompecabezas complejo, como un problema matemático o un desafío de programación, pero tienes un asistente mágico (el Modelo de Lenguaje de Difusión) que no solo escribe la respuesta de izquierda a derecha como un humano tecleando una letra. En su lugar, este asistente comienza con una página en blanco llena de marcadores de posición "MASK" e intenta llenarlos todos a la vez, adivinando qué palabras pertenecen en cada lugar.

El problema es que el asistente es un poco caótico. Puede llenar los espacios en cualquier orden que quiera. A veces, adivina la palabra correcta para el primer espacio, pero luego se queda atascado porque adivinó la palabra incorrecta para el segundo espacio. Otras veces, adivina las palabras correctas pero en el orden equivento, lo que conduce a un callejón sin salida.

La vieja forma: Adivinar y podar

Anteriormente, la gente intentaba solucionar esto de dos maneras principales, ambas con fallos:

  1. El enfoque "Confiado": El asistente mira los espacios en blanco sobre los que se siente más seguro y los llena primero. Es como un excursionista que solo camina por el sendero que parece más sólido.
    • Lo bueno: Generalmente obtiene una buena respuesta rápidamente.
    • Lo malo: Si el "sendero sólido" lleva a un acantilado (una respuesta incorrecta), el excursionista se queda atrapado allí. Nunca explora otros caminos que podrían haber sido mejores.
  2. El enfoque "Aleatorio": El asistente elige los espacios para llenar de forma completamente aleatoria.
    • Lo bueno: Explora una enorme variedad de caminos, por lo que es muy probable que eventualmente encuentre la solución correcta.
    • Lo malo: Es tan disperso que rara vez elige el mejor camino al primer intento. Es como un excursionista que vaga en círculos; puede encontrar el tesoro, pero también cavará muchos agujeros vacíos en el proceso.

La nueva solución: Búsqueda de Orden-Token (Order-Token Search)

Los autores de este artículo introdujeron un nuevo método llamado Order-Token Search. Piensa en esto como un Equipo de Exploradores trabajando juntos.

En lugar de enviar a un solo excursionista o a una multitud caótica, el método envía un pequeño equipo (un "haz" o beam) de exploradores. Así es como trabajan:

  1. Caminos divergentes (La búsqueda): A intervalos regulares, el equipo se divide. Cada explorador intenta una estrategia diferente:

    • El Explorador A decide llenar la primera palabra faltante.
    • El Explorador B decide llenar la última palabra faltante.
    • El Explorador C intenta una palabra diferente para el medio.
    • Analogía: Están explorando tanto dónde escribir a continuación (el orden) como qué escribir (el token).
  2. La tarjeta de puntuación (El estimador de verosimilitud): Esta es la parte mágica. El equipo tiene un juez especial (el estimador de verosimilitud) que no solo mira la respuesta final. En su lugar, el juez observa cada paso que dieron los exploradores.

    • ¿Hizo el explorador un movimiento lógico?
    • ¿Tiene sentido esta oración parcial dado lo que se escribió antes?
    • Analogía: Imagina a un entrenador observando una carrera de relevos. Si un corredor tropieza temprano, el entrenador no espera a que termine la carrera para detenerlo; lo detiene inmediatamente porque el paso que dio fue erróneo.
  3. Cortar los callejones sin salida (La poda): El juez califica el progreso de cada explorador. Si un explorador está tomando un camino que parece poco probable que tenga éxito (incluso si aún no ha terminado), el equipo corta ese camino y concentra los recursos en los exploradores que están en las mejores pistas.

Por qué esto es importante

El artículo probó esto en problemas matemáticos difíciles (como los conjuntos de datos GSM8K y MATH500) y tareas de programación (HumanEval).

  • El resultado: El "Equipo de Exploradores" (Order-Token Search) encontró consistentemente las respuestas correctas con más frecuencia que los métodos antiguos "Confiado" o "Aleatorio".
  • La comparación: Funcionó tan bien que igualó o incluso superó a métodos que requieren que la IA pase por un reentrenamiento costoso de meses (como diffu-GRPO). Esto significa que puedes obtener una IA mucho más inteligente simplemente cambiando cómo piensa durante la prueba, sin necesidad de reentrenar el cerebro mismo.

Una nota especial sobre el Sudoku

El artículo también probó esto en rompecabezas de Sudoku. Curiosamente, no funcionó bien allí. Los autores explican que el Sudoku requiere reglas globales estrictas (como "no repetir números en una fila") que la "tarjeta de puntuación" interna de la IA simplemente no parece poder entender. Es como darle a un equipo de excursionistas un mapa que no muestra los acantilados; no importa qué tan bien exploren, no pueden evitar caer al vacío si el mapa es erróneo. Esto sugiere que para algunas tareas, la IA misma necesita ser entrenada de manera diferente, no solo el método de búsqueda.

En pocas palabras

El artículo muestra que, al permitir que una IA explore múltiples formas diferentes de escribir (orden) y múltiples palabras diferentes (tokens) simultáneamente, y luego usar un sistema de puntuación inteligente para cortar las malas ideas a tiempo, podemos obtener resultados mucho mejores de los Modelos de Lenguaje de Difusión sin necesidad de reentrenarlos. Convierte un juego de adivinanzas caótico en una búsqueda estructurada y eficiente de la verdad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →