← Últimos artículos
🤖 machine learning

Why Do Accumulated Transformations Extrapolate?

Este artículo demuestra que reemplazar las rotaciones indexadas por posición con transformaciones ortogonales acumuladas y dependientes de los tokens (tales como reflexiones de Householder o rotaciones SO(2)) en los mecanismos de atención mejora inherentemente la extrapolación de longitud al crear una ventana de mezcla finita y suprimir los tokens distantes mediante la incoherencia, aunque el rendimiento eventualmente se degrada en longitudes extremas sin mecanismos de control de masa lejana explícitos como ALiBi.

Autores originales: Mahesh Godavarti

Publicado 2026-06-25
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Mahesh Godavarti

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El panorama general: ¿Por qué los modelos de IA se pierden en historias largas?

Imagina que estás leyendo un libro muy largo. En un modelo de IA estándar (como el que usa RoPE), el modelo recuerda dónde está una palabra por su posición absoluta (por ejemplo, "Palabra #500"). Si de repente le das un libro que es el doble de largo de lo que fue entrenado para leer, se confunde porque nunca ha visto la "Palabra #1000" antes.

Un nuevo método llamado PaTH (y la versión más simple probada en este artículo) intenta solucionar esto. En lugar de decir "Estoy en la posición 500", dice: "Estoy conectado con la palabra anterior mediante un giro específico". Construye una cadena de conexiones desde el inicio de la oración hasta la palabra actual.

Este artículo pregunta: ¿Por qué esta "cadena de conexiones" funciona tan bien para historias largas, pero eventualmente falla si la historia es demasiado larga?

Los autores descubrieron que la magia no se trata solo de la matemática específica utilizada en PaTH; se trata de que las conexiones son acumuladas (sumadas paso a paso) y dependen del contenido de las palabras.


Los tres mecanismos clave

El artículo explica este comportamiento utilizando tres ideas principales, las cuales podemos visualizar como una fiesta en un salón gigante.

1. La "Ventana de Mezcla" (Por qué funciona al principio)

La analogía: Imagina que estás en una fiesta. Quieres hablar con un amigo que está cerca de ti. Puedes escucharlo claramente.
Ahora, imagina que quieres hablar con alguien en el otro extremo de un salón enorme. En un modelo estándar, la distancia es solo un número. Pero en este nuevo modelo, para llegar a esa persona lejana, tu voz tiene que pasar a través de cientos de otras personas, cada una añadiendo un pequeño "giro" o "eco" aleatorio a tu mensaje.

La ciencia:

  • Cerca: Si la persona está cerca, el mensaje no ha sido muy retorcido. Sigue siendo claro.
  • Lejos: Si la persona está lejos, el mensaje ha pasado por tantos "giros" que se convierte en ruido completamente desordenado (incoherente).
  • El resultado: El modelo aprende a ignorar el "ruido" de lo lejano porque suena como estática. Esto crea una ventana de atención finita. No importa qué tan larga sea la historia, la zona "cercana" mantiene el mismo tamaño, y la zona "lejana" simplemente se convierte en más estática. Esto permite al modelo manejar historias más largas sin confundirse por la distancia en sí misma.

2. El "Problema de la Multitud" (Por qué eventualmente falla)

La analogía: Aunque las personas lejanas suenen como ruido de estática, imagina que el salón se vuelve tan grande que hay millones de personas en la "zona lejana".
Incluso si cada persona está susurrando un poco de estática, si tienes un millón de personas susurrando, el volumen total de la estática se vuelve ensordecedor. Ahoga la voz de tu amigo, aunque tu amigo esté justo al lado tuyo.

La ciencia:

  • El modelo es bueno ignorando tokens individuales lejanos.
  • Sin embargo, a medida que la longitud del contexto crece, el número de tokens lejanos también crece.
  • Eventualmente, el volumen puro de estos tokens "ignorados" se acumula en una cantidad masiva de interferencia. La atención del modelo se diluye.
  • La solución: El artículo señala que métodos como ALiBi (que usan una simple penalización por distancia) funcionan mejor en longitudes extremas porque le dicen explícitamente al modelo: "Ignora lo lejano por completo", en lugar de solo esperar que la matemática haga que suene como ruido.

3. La "Rotación de Valores" (La receta secreta)

La analogía: Hasta ahora, solo hemos hablado de cómo el modelo decide a quién escuchar (el "Score" o puntuación). ¿Pero qué pasa con el mensaje real (el "Value" o valor)?
Imagina que estás escuchando a un coro. El director (el modelo) decide ignorar a la fila de atrás. Pero si la fila de atrás sigue cantando una canción unificada y fuerte, esa canción aún podría filtrarse.
Sin embargo, si el director también le dice a la fila de atrás que cante en tonos aleatorios y diferentes, sus voces se cancelan entre sí. Incluso si el modelo accidentalmente los escucha, su mensaje es solo un caos de ruido que no interfiere con el cantante principal.

La ciencia:

  • El artículo muestra que si solo rotas el "Query" y el "Key" (los que toman las decisiones), obtienes buenos resultados.
  • Pero si también rotas el "Value" (la información real que se transmite), la información "lejana" que se filtra por las grietas se vuelve aún más caótica.
  • Este paso adicional extiende significativamente qué tan largo puede leer el modelo antes de que comience a degradarse.

Lo que demostraron los experimentos

Los autores construyeron modelos de IA pequeños para probar estas ideas, como un científico probando un nuevo motor en un túnel de viento.

  1. Los giros aleatorios funcionan: Incluso si usaron giros aleatorios (en lugar de aprendidos), los modelos manejaron contextos largos mucho mejor que los modelos estándar. Esto demuestra que el mecanismo de "mezcla" es la clave, no algún truco complejo aprendido.
  2. Rotar los valores ayuda: Los modelos que rotaron los "Valores" (el mensaje) funcionaron significativamente mejor en longitudes largas que aquellos que solo rotaron los "Queries/Keys" (la decisión).
  3. El límite: Incluso con estas mejoras, los modelos empeoraron eventualmente en longitudes extremadamente largas (como 65,000 palabras). Esto confirmó el "Problema de la Multitud": sin una regla específica para desterrar los tokens lejanos (como hace ALiBi), la cantidad pura de ellos eventualmente abrumará al sistema.

Resumen

  • Por qué funciona: Los giros acumulados y dependientes del contenido convierten la información distante en "ruido", creando una "zona cercana" estable que no cambia de tamaño incluso cuando la historia se vuelve más larga.
  • Por qué falla eventualmente: Si la historia es lo suficientemente larga, el "ruido" de los millones de tokens distantes se acumula en un rugido que ahoga la señal importante.
  • La mejora: Rotar los datos reales (Valores) hace que ese ruido sea aún más desordenado, empujando el punto de falla más allá.

El artículo concluye que, si bien las transformaciones acumuladas son una herramienta poderosa para la extrapolación de longitud, necesitan un "portero" (como un sesgo de distancia) para evitar que la multitud de tokens distantes abrume la fiesta en los límites más extremos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →