← Últimos artículos
🤖 machine learning

Attention Drift: What Autoregressive Speculative Decoding Models Learn

Este artículo identifica la "desviación de la atención" como una limitación clave en los modelos de decodificación especulativa autoregresiva, donde la atención se desplaza del prompt a los tokens generados debido a rutas residuales no normalizadas, y propone soluciones arquitectónicas como post-norm y RMSNorm por estado oculto que mejoran significativamente las longitudes de aceptación en diversas tareas y longitudes de contexto.

Autores originales: Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek, Kaan Oktay, Hongyang Zhang, Stephen Xia

Publicado 2026-05-12
📖 4 min de lectura☕ Lectura para el café

Autores originales: Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek, Kaan Oktay, Hongyang Zhang, Stephen Xia

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando acelerar a un bibliotecario muy inteligente, pero lento (el Modelo Objetivo) que está escribiendo una historia. Para ahorrar tiempo, contratas a un asistente rápido pero menos experimentado (el Borrador) para que adivine las siguientes palabras antes de que el bibliotecario las verifique. Si el asistente acierta, el bibliotecario simplemente dice "Buen trabajo" y continúa, omitiendo el trabajo lento de pensar esas palabras. Esto se llama Decodificación Especulativa.

Sin embargo, el artículo descubre un extraño fallo en cómo funcionan estos asistentes, al que los autores llaman "Deriva de Atención".

El Problema: El Asistente Se Obsesiona Consigo Mismo

Imagina que el bibliotecario está contando una historia sobre un dragón. El asistente debería mantener la vista en las instrucciones del bibliotecario (el prompt) para adivinar las siguientes palabras.

Pero esto es lo que sucede cuando el asistente intenta adivinar una larga cadena de palabras (como "dragón", "voló", "sobre", "la", "montaña"):

  1. El Inicio: Al principio, el asistente mira las instrucciones del bibliotecario.
  2. La Deriva: Tan pronto como el asistente empieza a adivinar sus propias palabras, se distrae. Deja de mirar las instrucciones originales del bibliotecario y empieza a mirar intensamente las palabras que acaba de escribir.
  3. El Resultado: El asistente se obsesiona con su propia salida reciente. Olvida el contexto de la historia. Si cambias la forma en que se introduce la historia (una "perturbación de plantilla") o haces la historia muy larga, el asistente se confunde por completo y deja de adivinar correctamente.

El artículo llama a esto Deriva de Atención. El enfoque del asistente "se desvía" del material fuente y se queda atrapado en sus propios pensamientos recientes.

¿Por Qué Sucede Esto? La Analogía del "Botón de Volumen"

Los autores profundizaron en las matemáticas para descubrir por qué sucede esto. Encontraron un problema oculto de "botón de volumen" en el cerebro del asistente (sus estados de datos internos).

  • El Diseño Actual (Pre-norm): Imagina que el asistente tiene un micrófono que se vuelve más fuerte cada vez que habla una palabra.
    • Palabra 1: Volumen normal.
    • Palabra 2: Ligeramente más fuerte.
    • Palabra 10: Gritando.
    • Palabra 20: Atronador.

Como el "volumen" interno del asistente (la magnitud de sus estados ocultos) sigue creciendo con cada palabra que adivina, empieza a sentirse como si estuviera apilando capas cada vez más complejas sobre el bibliotecario. Deja de actuar como un simple adivino y empieza a actuar como un modelo completamente nuevo y más profundo que intenta "refinar" las adivinanzas anteriores. Este volumen creciente hace que pierda el equilibrio y olvide las instrucciones originales.

La Solución: El "Botón de Reinicio" (Post-norm)

Los autores propusieron una solución sencilla: Post-norm.

Piensa en esto como añadir un botón de "reinicio de volumen" después de cada palabra que el asistente adivina.

  • Antes de que el asistente adivine la siguiente palabra, el sistema verifica su volumen interno y lo normaliza de nuevo a un nivel estándar.
  • Esto evita que el "volumen" se vuelva atronadoramente fuerte.
  • Obliga al asistente a mantenerse firme y tratar cada adivinanza como una predicción fresca e independiente, en lugar de una acumulación caótica de adivinanzas anteriores.

También añadieron un "reinicio" similar para los datos que provienen del bibliotecario antes de que el asistente empiece a adivinar, asegurando que la señal inicial no sea demasiado fuerte o desequilibrada.

Los Resultados: Un Asistente Más Robusto

Al añadir estos "botones de reinicio" (Post-norm), el asistente se volvió mucho mejor en su trabajo:

  • Menos Distracción: Dejó de desviarse de las instrucciones originales.
  • Más Robustez: Incluso si cambiabas el formato de la historia (como eliminar etiquetas específicas o cambiar el saludo), el asistente no se estrellaba. Manejaba estos cambios 2 veces mejor que la versión anterior.
  • Historias Más Largas: Podía manejar historias mucho más largas sin confundirse.
  • Entrenamiento Más Rápido: Como el asistente era más estable, podían entrenarlo en secuencias más cortas, y aún funcionaría bien en secuencias más largas después.

La Gran Conclusión

El artículo argumenta que la razón por la que estos asistentes fallan en situaciones reales y desordenadas no es solo porque son "tontos". Es porque su diseño interno hace que se vuelvan "fuertes" y obsesivos consigo mismos a medida que trabajan. Al simplemente añadir un paso de normalización para mantener su volumen interno estable, se vuelven fiables, consistentes y mucho más rápidos ayudando al modelo grande a escribir.

En resumen: El artículo descubrió que los redactores de IA se distraen con su propio trabajo porque su "volumen" interno sigue subiendo. Bajar ese volumen con una solución arquitectónica sencilla los hace mucho mejores en su trabajo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →