← Últimos artículos
💬 NLP

Position Encoding in Transformers: From Absolute and Relative Methods to Rotary Position Embeddings and Long-Context Scaling

Esta encuesta técnica proporciona un marco unificado para comprender los métodos de codificación de posición en los Transformers —desde enfoques absolutos y relativos hasta los Rotary Position Embeddings (RoPE)— al tiempo que analiza sus propiedades computacionales, las técnicas de escalado de contexto largo y la distinción crítica entre la capacidad de extrapolación de longitud y la generalización fiable de contexto largo.

Autores originales: Jiguo Li

Publicado 2026-08-12
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Jiguo Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a entender una historia. Tienes un cerebro superrápido que puede observar todas las palabras de una oración al mismo tiempo, en lugar de leerlas una por una como un humano. Esta es la magia del Transformer, el motor detrás de la IA moderna. Pero hay un inconveniente: debido a que este cerebro lo ve todo a la vez, no tiene idea de qué palabra fue primero, segunda o última. Si desordenaras las palabras en una oración, este cerebro pensaría que la versión desordenada es tan buena como la original. Para solucionar esto, tenemos que darle a la IA una forma de saber "dónde" se sitúa cada palabra en la línea. Llamamos a esto Codificación de Posición (Position Encoding). Piensa en ello como darle a cada palabra una etiqueta de nombre única o un número de asiento. Sin estas etiquetas, la IA es como un invitado en una fiesta que puede ver la cara de todos, pero no tiene idea de quién está parado junto a quién, o quién llegó primero.

Este artículo es una inmersión profunda en los diferentes sistemas de "etiquetas de nombre" que hemos inventado para la IA a lo largo de los años. Rastrea la historia desde los simples números de asiento hasta los complejos relojes rotatorios, y finalmente a una nueva generación de trucos que permiten a la IA leer libros de cientos de miles de palabras sin confundirse. El autor no solo está enumerando estos métodos; está determinando cuáles funcionan realmente cuando intentamos estirarlos para manejar historias masivas, y nos advierte que el hecho de que un sistema pueda aceptar una entrada larga no significa que realmente la entienda.

La evolución del "número de asiento" de la IA

Al principio, la forma más sencilla de darle a una palabra un número de asiento era simplemente buscarla en un diccionario. Esto se llama Posición Absolta Aprendida (Learned Absolute Position). Imagina a un profesor entregando una lista donde a la "Palabra 1" se le asigna un color específico, a la "Palabra 2" otro, y así sucesivamente. Funciona de maravilla para historias cortas, pero si intentas leer una novela y el profesor solo hizo una lista para las primeras 500 palabras, la IA se pierde cuando llega a la palabra 501.

Luego llegó la Codificación Sinusoidal (Sinusoidal Encoding). En lugar de una lista estática, la IA utiliza un patrón de onda matemática (como una onda senoidal) para generar números de asiento. Piensa en esto como un conjunto de relojes girando a diferentes velocidades. Algunos relojes avanzan rápido para marcar la diferencia entre la palabra 1 y la palabra 2, mientras que otros avanzan lentamente para marcar la diferencia entre la palabra 1 y la palabra 1,000. Esto es ingenioso porque la IA puede calcular un número de asiento para cualquier posición, incluso para aquellas que no ha visto antes. Sin embargo, el artículo señala que el hecho de que puedas calcular el número no significa que la IA sepa cómo usarlo para distancias muy largas.

Después, los investigadores se dieron cuenta de que, en el lenguaje, lo que más importa suele ser la distancia entre las palabras, no sus números de asiento absolutos. ¿Está la palabra "ello" cerca del sustantivo al que se refiere? Esto llevó a la Codificación de Posición Relativa (Relative Position Encoding). En lugar de decir "estoy en el asiento 50", la IA aprende a decir "estoy a 3 asientos de distancia de ti". Esto es como un juego de sillas musicales donde solo te importa quién está sentado junto a ti, no el número exacto en tu silla. Métodos como T5 y Transformer-XL usan esto para manejar textos largos enfocándose en la brecha entre las palabras.

La estrella del espectáculo: RoPE

El artículo destaca un método de tercera generación llamado RoPE (Rotary Position Embedding) como el campeón actual para muchos modelos de IA de gran tamaño. En lugar de añadir un número a la palabra o calcular una distancia, RoPE trata los datos de la palabra como una flecha giratoria. A medida que la palabra avanza en la línea, su flecha rota. Cuando la IA compara dos palabras, comprueba el ángulo entre sus flechas. Si las flechas están cerca, las palabras están cerca en la historia; si están lejos, las palabras están lejos.

La belleza de RoPE es que maneja naturalmente la "distancia" entre las palabras sin necesidad de una tabla de búsqueda separada. Es como si todos en la fiesta llevaran un reloj que gira a una velocidad basada en cuándo llegaron. Cuando dos personas hablan, solo miran la diferencia en las manecillas de sus relojes para saber cuánto tiempo han estado separadas.

El desafío del contexto largo: Estirando la historia

El mayor problema con estos sistemas es que suelen ser entrenados en historias cortas (como de 4,000 palabras). Cuando intentamos usarlos para documentos masivos (como de 128,000 palabras o más), los "relojes" o las "flechas giratorias" empiezan a girar en patrones que la IA nunca ha visto. Es como intentar conducir un coche diseñado para calles de la ciudad en una autopista; el motor puede funcionar, pero el manejo se siente mal.

El artículo analiza varias técnicas de "estiramiento" para solucionar esto:

  • Interpolación de Posición (PI): Esto comprime la historia larga de nuevo al espacio corto que la IA conoce. Es como comprimir una película de 10 horas en 2 horas. La IA puede verla, pero los detalles se vuelven borrosos y podría perderse las sutiles diferencias entre palabras que están cerca.
  • Escalado sensible a NTK (NTK-aware Scaling): Esto es más inteligente. Mantiene los "relojes rápidos" (que manejan los detalles cercanos) girando a su velocidad normal, pero ralentiza los "relojes lentos" para cubrir la larga distancia. Es un compromiso que mantiene los detalles locales nítidos mientras llega más lejos.
  • NTK Dinámico: Este método cambia el factor de estiramiento dependiendo de qué tan larga sea la historia actual. Si la historia es corta, no estira nada. Si es larga, estira. Sin embargo, el artículo advierte que esto puede ser difícil de gestionar en tiempo real porque podría confundir la memoria de la IA sobre las palabras pasadas.
  • LongRoPE y LongRoPE2: Estos son los métodos más avanzados. En lugar de usar una única regla para todos, buscan el factor de estiramiento perfecto para cada parte del cerebro de la IA. Incluso mezclan historias cortas y largas durante el entrenamiento para que la IA aprenda a manejar ambas. El autor sugiere que este es el camino más prometedor, pero requiere un ajuste cuidadoso y datos específicos.

La gran advertía: Que quepa, no significa que funcione

El hallazgo más importante de este artículo es un baño de realidad. El hecho de que un modelo de IA pueda aceptar una entrada de 100,000 palabras no significa que pueda entenderla. El autor argumenta que muchos modelos fallan en la prueba de "Aguja en un pajar" (encontrar un dato específico en un texto enorme) o tienen dificultades para razonar sobre distancias largas, incluso si tienen activados los sofisticados ajustes de "contexto largo".

Enfatizan que la longitud de contexto efectiva (cuánto usa realmente la IA) es a menudo mucho más corta que la longitud de contexto nominal (el número máximo de palabras que técnicamente puede contener). También señalan que simplemente cambiar las matemáticas para manejar números más grandes no es suficiente; la IA necesita ser reentrenada o ajustada con estos nuevos parámetros para aprender realmente a usarlos.

El veredicto

El artículo concluye que, si bien hemos hecho progresos increíbles desde los simples números de asiento hasta las complejas flechas giratorias, aún no hemos resuelto el problema de la comprensión de contexto largo. No existe una única "solución mágica". El mejor enfoque parece ser una mezcla de escalado inteligente (como LongRoPE), entrenamiento cuidadoso con ejemplos tanto cortos como largos, y pruebas rigurosas para ver si la IA realmente está prestando atención a toda la historia, no solo al principio y al final.

Para cualquiera que construya o utilice estos modelos de IA, la lección es clara: no confíen solo en los números de marketing. Si quieren que una IA lea una novela entera, necesitan comprobar si realmente puede encontrar los giros de la trama en el medio, no solo si puede tragarse el libro entero de un bocado. El viaje hacia una IA de contexto verdaderamente largo aún está en curso, y el camino por delante requiere más que números más grandes; requiere formas más inteligentes de mantener la atención de la IA enfocada.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →