← Últimos artículos
💬 NLP

VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination

El artículo propone VoidPadding, un método que desacopla las funciones de relleno y terminación en los Modelos de Lenguaje de Difusión con Máscara mediante la introducción de un token [VOID] dedicado para el relleno, lo cual resuelve los problemas de desbordamiento de [EOS] y mejora significativamente el rendimiento y la eficiencia de decodificación en modelos ajustados por instrucciones.

Autores originales: Chunyu Liu, Zhengyang Fan, Kaisen Yang, Alex Lamb

Publicado 2026-06-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Chunyu Liu, Zhengyang Fan, Kaisen Yang, Alex Lamb

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a escribir historias. En la forma antigua (modelos autorregresivos), el robot escribe una palabra a la vez, de izquierda a derecha, como un humano tecleando. Pero en este nuevo método llamado Difusión con Máscara (Masked Diffusion), el robot comienza con una página en blanco llena de signos de interrogación e intenta adivinar todas las palabras a la vez, refinando sus conjeturas una y otra vez hasta que la historia tiene sentido.

El problema que identifica el artículo es que, cuando le enseñamos al robot, tenemos que darle ejemplos de práctica. Para que la práctica sea eficiente, tomamos historias cortas y las rellenamos con "palabras ficticias" para que todas quepan en el mismo tamaño de página.

El Problema: La Señal de "Pare" Confundida

En el pasado, los investigadores utilizaron un token especial llamado [EOS] (Fin de la Oración) como esa "palabra ficticia".

  • Su Trabajo 1: Decirle al robot: "Deja de escribir aquí, la historia ha terminado".
  • Su Trabajo 2: Rellenar el espacio vacío en la página para que el robot pueda practicar.

El artículo argumenta que darle al token [EOS] estos dos trabajos es como pedirle a un semáforo que sea tanto una señal de Pare como una barrera de construcción.

Cuando el robot está practicando, aprende que [EOS] significa "rellena este espacio". Pero cuando está escribiendo una historia real, ve el [EOS] y se confunde. Piensa: "¡Ah, necesito rellenar este espacio con más [EOS]!". Esto causa un fallo llamado desbordamiento de [EOS] (EOS overflow). El robot escribe un poco de texto y luego simplemente rellena el resto de la página con marcadores de "Fin de la Oración", cortando la historia prematuramente.

Esto empeora cuando el robot intenta escribir historias largas en bloques grandes. La señal de "Pare" se ve tan congestionada con señales "ficticias" que el robot no puede distinguir dónde termina la historia real.

La Solución: VoidPadding (Relleno de Vacío)

Los autores proponen una solución simple llamada VoidPadding. Introducen un nuevo token invisible llamado [VOID].

Piénsalo de esta manera:

  • [VOID] es la nueva "palabra ficticia". Rellena el espacio vacío en la página de práctica, pero no tiene significado. Es como un fantasma que ocupa espacio pero no habla.
  • [EOS] es ahora únicamente la señal de "Pare". Está reservado estrictamente para decirle al robot cuándo la historia ha terminado realmente.

Al separar estos roles, el robot aprende claramente:

  1. [VOID] = "Esto es solo espacio vacío, ignóralo".
  2. [EOS] = "La historia ha terminado, detente ahora".

Cómo Funciona en la Práctica

El artículo describe dos trucos ingeniosos que ocurren durante la "inferencia" (cuando el robot está realizando el trabajo de verdad):

  1. La Prohibición del "Fantasma": Cuando el robot está generando una historia, tiene estrictamente prohibido escribir [VOID]. Si intenta adivinar [VOID], el sistema dice: "No, eso es solo un fantasma". Esto evita que el robot llene accidentalmente su historia con fantasmas invisibles.
  2. El Parada Temprana: Debido a que [EOS] es ahora una señal de "Pare" pura, el robot puede escucharla. Tan pronto como ve una señal clara de [EOS], deja de escribir inmediatamente. No pierde tiempo llenando el resto de la página con basura. Esto hace que el robot sea mucho más rápido.
  3. El Expansor de Lienzo: A veces, el robot comienza con una página que es demasiado pequeña para la historia que quiere contar. El artículo introduce un truco llamado VoidExpansion. El robot observa las señales "fantasma" ([VOID]) que aprendió durante el entrenamiento. Si la página es demasiado corta, las señales [VOID] se verán "incómodas" (como un fantasma intentando apretujarse en una caja diminuta). El robot detecta esto, expande la página a un tamaño mayor y luego termina la historia.

Los Resultados

Los autores probaron esto en dos modelos de robot diferentes (LLaDA y Dream) utilizando acertijos matemáticos y de programación.

  • Mejor Calidad: Cuando los robots intentaban escribir respuestas largas, el método antiguo solía fallar y simplemente escupía "Fin de la Oración" una y otra vez. El nuevo método (VoidPadding) resolvió esto, manteniendo las respuestas largas y correctas.
  • Más Rápido: Debido a que los robots se detenían exactamente cuando terminaban (en lugar de llenar toda la página), completaron las tareas un 55% más rápido en promedio.
  • Robusto: El nuevo método funcionó bien tanto si el robot escribía respuestas cortas como si eran muy largas, y tanto si trabajaba en fragmentos pequeños como en fragmentos grandes.

Resumen

El artículo demuestra que, al dar a la señal de "Pare" y al relleno de "Espacio Vacío" dos nombres diferentes, podemos evitar que el robot se confunda. Esto hace que el robot escriba mejor, se detenga en el momento adecuado y trabaje mucho más rápido. Es un pequeño cambio en cómo enseñamos al robot que conduce a una gran mejora en cómo desempeña su tarea.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →