← Últimos artículos
💬 NLP

PaTH Attention: Position Encoding via Accumulating Householder Transformations

Este artículo presenta PaTH, un esquema de codificación de posición flexible y dependiente de los datos basado en transformaciones de Householder acumuladas que supera al Rotary Position Encoding (RoPE) estándar en tareas de modelado de lenguaje, ofreciendo al mismo tiempo un entrenamiento paralelo eficiente y la capacidad de convertir modelos RoPE preentrenados.

Autores originales: Songlin Yang, Yikang Shen, Kaiyue Wen, Shawn Tan, Mayank Mishra, Liliang Ren, Rameswar Panda, Yoon Kim

Publicado 2026-02-05
📖 4 min de lectura☕ Lectura para el café

Autores originales: Songlin Yang, Yikang Shen, Kaiyue Wen, Shawn Tan, Mayank Mishra, Liliang Ren, Rameswar Panda, Yoon Kim

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: La Memoria "Ciega"

Imagina a un modelo de lenguaje de gran tamaño (como el que estás usando para hablar) como un bibliotecario muy inteligente que lee un libro largo para responder a tus preguntas. Para entender la historia, el bibliotecario necesita saber no solo qué son las palabras, sino dónde aparecen en el libro.

Los modelos actuales utilizan un sistema llamado RoPE (Codificación de Posición Rotatoria) para recordar las posiciones de las palabras. Piensa en RoPE como una regla fija e impresa de antemano.

  • Si mueves una palabra de la página 1 a la página 2, la regla la desplaza una cantidad determinada.
  • El Defecto: Esta regla es "ciega" al contenido. Trata a la palabra "manzana" y a la palabra "cohete" exactamente de la misma manera solo porque están en el mismo lugar. No le importa si la historia trata de una fruta o de una nave espacial. Debido a esto, el bibliotecario a veces se confunde cuando la historia requiere una lógica compleja y paso a paso (como rastrear quién es el dueño de qué objeto en una lista larga).

La Solución: PaTH (La Regla "Inteligente")

Los autores presentan PaTH, una nueva forma de recordar las posiciones. En lugar de una regla fija, PaTH es como una regla dinámica que cambia de forma según la historia que está leyendo.

  • Cómo funciona: A medida que el bibliotecario lee cada palabra, PaTH aplica un "giro" matemático especial (llamado transformación de Householder) a la memoria de las palabras anteriores.
  • La Analogía: Imagina que estás caminando por un pasillo con espejos.
    • RoPE: Los espejos son fijos. No importa lo que lleves puesto, tu reflejo se ve igual.
    • PaTH: Los espejos son inteligentes. Si llevas puesto un sombrero rojo, el espejo tuerce tu reflejo de una manera. Si llevas un sombrero azul, el espejo lo tuerce de otra manera. El "giro" depende del contenido real (el sombrero) que sostienes.

Esto permite al modelo construir un "camino" de memoria que se adapta a los datos específicos que está procesando, lo que lo hace mucho mejor para resolver acertijos que requieren el seguimiento de estados (como recordar el valor de una variable en un código de computadora).

El Truco de Magia: Hacerlo Rápido

Normalmente, hacer una regla que cambie de forma para cada palabra sería increíblemente lento y computacionalmente costoso. Sería como intentar recalcular todos los ángulos de los espejos del pasillo cada vez que das un paso.

La segunda gran contribución del artículo es un algoritmo de aceleración (similar a algo llamado FlashAttention).

  • La Analogía: En lugar de recalcular todo el pasillo cada vez, los autores encontraron un atajo inteligente. Se dieron cuenta de que, si agrupan los espejos en pequeños bloques, pueden calcular el "giro" para todo el bloque a la vez utilizando una fórmula matemática compacta.
  • El Resultado: Construyeron un sistema que funciona casi tan rápido como el antiguo sistema de regla fija (RoPE), pero mantiene los beneficios de ser un sistema "inteligente y cambiante".

¿Qué Demostraron?

Los autores probaron este nuevo sistema de dos maneras:

  1. Acertijos Sintéticos (Los "Entrenadores"):
    Les dieron al modelo juegos de lógica simples, como un juego de "Flip-Flop" donde tiene que recordar la última vez que se movió un interruptor, o un juego de "Problemas de Palabras" que involucra reglas matemáticas complejas.

    • Resultado: Los modelos antiguos (RoPE) a menudo fallaban en estos acertijos, confundiéndose por la secuencia. El nuevo modelo PaTH los resolvió casi perfectamente, incluso con menos capas de "cerebro" que los otros.
  2. Tareas de Lenguaje Real:
    Entrenaron modelos con texto real (libros, código, conversaciones).

    • Resultado: Los modelos PaTH fueron mejores para comprender contextos largos (leer libros muy largos sin olvidar el principio) y funcionaron mejor en tareas de razonamiento, especialmente en programación y matemáticas.
    • Bonus: Demostraron que puedes tomar un modelo existente entrenado con la antigua "regla fija" (RoPE) y convertirlo para que use la "regla inteligente" (PaTH) con solo un poco de entrenamiento adicional, sin tener que empezar desde cero.

La Conclusión

PaTH es una nueva forma para que la IA recuerde el orden de las palabras. En lugar de usar un sistema rígido y universal, utiliza un sistema flexible que cambia según las propias palabras. Los autores descubrieron cómo hacer que este sistema flexible sea lo suficientemente rápido como para ser práctico, lo que resulta en modelos de IA que son mejores en lógica, en el seguimiento de información a largas distancias y en la comprensión de secuencias complejas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →