← Últimos artículos
🤖 machine learning

Rethinking the Role of Positional Encoding: Sliding-Window Transformers without PE Remain Turing Complete

Este artículo demuestra que las codificaciones posicionales no son estrictamente necesarias para que los transformers alcancen la completitud de Turing, ya que el mecanismo de ventana deslizante por sí mismo rompe la simetría de permutación y proporciona información posicional suficiente para simular la computación universal.

Autores originales: Qian Li, Xinyu Mao, Shang-Hua Teng

Publicado 2026-06-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Qian Li, Xinyu Mao, Shang-Hua Teng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a contar una historia o a resolver un problema matemático. Durante mucho tiempo, los científicos de la computación creyeron que, para hacer esto, el robot necesitaba una "agenda de direcciones" especial adjunta a cada palabra que leía. Esta agenda de direcciones, llamada Codificación Posicional (PE por sus siglas en inglés), le decía al robot exactamente dónde estaba cada palabra en la oración (1.ª, 2.ª, 3.ª, etc.). Sin ella, decían, el robot se confundiría y no podría distinguir entre "El gato persigue al perro" y "El perro persigue al gato".

Este artículo argumenta que en realidad no necesitas esa agenda de direcciones si el robot está trabajando con un tipo específico de memoria: una ventana deslizante.

Aquí está la idea central, desglosada con algunas analogías de la vida cotidiana:

1. La creencia antigua: La "Foto Estática"

Piensa en un modelo Transformer estándar (el tipo que hay detrás de muchos chatbots de IA) como un fotógrafo tomando una foto de una multitud. Si simplemente le entregas al fotógrafo un montón de caras de personas sin decirle quién está dónde, no podrá distinguir entre una fila de personas y un montón aleatorio. Necesita una etiqueta en la frente de cada persona (Codificación Posicional) para saber el orden.

2. El nuevo descubrimiento: El "Autobús en Movimiento"

Los autores se dieron cuenta de que cuando la IA realiza razonamientos complejos paso a paso (como resolver un problema matemático largo), no mira toda la historia a la vez. En su lugar, utiliza una ventana deslizante.

Imagina que la IA está sentada en un autobús con una ventana que solo muestra a las últimas 10 personas que pasaron por delante.

  • La visión antigua: Si solo miras a las 10 personas que están actualmente en la ventana, no puedes saber quién entró primero o quién salió al final. Es solo un grupo de 10 personas.
  • La nueva visión: Los autores notaron que el autobús se mueve.
    • Cada segundo, una persona nueva sube al autobús (entra en la ventana).
    • Cada segundo, la persona más antigua se cae por la parte trasera (sale de la ventana).

Incluso si la IA no puede ver las "direcciones de la calle" de las personas dentro del autobús, el acto de que el autobús se mueva crea un patrón. La IA puede ver: "Ah, acaba de subir una persona nueva, y sé quién acaba de caerse por detrás porque el grupo total ha cambiado".

3. El "Histograma Mágico" (El modelo HIST)

Para probar esto, los autores inventaron un robot teórico llamado modelo HIST.

  • Este robot es ciego al orden. No puede decir "La camisa roja es la tercera".
  • Solo ve un conteo (un histograma). Sabe: "Hay 3 camisas rojas, 2 azules y 1 verde en la ventana en este momento".
  • También tiene una memoria diminuta (un "estado de control") para recordar las últimas cosas que sucedieron.

El truco mágico es este: Al comparar el conteo antes de que entre una persona nueva y el conteo después, el robot puede averiguar exactamente quién acaba de salir del autobús, incluso sin ver su etiqueta de nombre.

  • Antes: 3 Rojas, 2 Azules.
  • Entra una persona nueva (Azul).
  • Después: 3 Rojas, 3 Azules.
  • Espera, ¡el tamaño de la ventana es fijo! Si entra una Azul, una Roja debe haber salido.
  • Conclusión: El robot sabe que una camisa Roja acaba de caerse por la parte trasera, aunque nunca vio la posición de la camisa Roja.

4. El gran resultado: Completitud de Turing

En ciencias de la computación, ser "Turing Completo" significa que una máquina puede, teóricamente, resolver cualquier problema que una computadora pueda resolver, si tiene suficiente tiempo y memoria.

  • Creencia previa: Los Transformers necesitaban Codificaciones Posicionales para ser Turing Completos.
  • La prueba de este artículo: Un Transformer con una ventana deslizante no necesita Codificaciones Posicionales para ser Turing Completo. El movimiento de la ventana misma proporciona suficiente "información secuencial" para simular una computadora universal.

Los autores construyeron un puente matemático mostrando que:

  1. Una máquina que solo cuenta tipos de tokens (el modelo HIST) puede simular una computadora universal (específicamente, una Máquina de Post, que es como una computadora con una cola/queue).
  2. Un Transformer estándar (sin Codificaciones Posicionales) puede imitar perfectamente esta máquina de conteo.

5. Qué significa esto (y qué no significa)

Las buenas noticias:
Resulta que la "acción" de procesar datos paso a paso es lo suficientemente poderosa como para crear orden. No necesitas etiquetar manualmente cada palabra con un número para obtener computación universal. La acción de "deslizar" rompe la simetría por sí sola.

Las advertencias (lo que el artículo no dice):

  • No se trata de velocidad: Esta es una prueba de posibilidad, no de eficiencia. El hecho de que un robot pueda resolver un problema sin la agenda de direcciones no significa que lo haga de forma rápida o fácil en la vida real.
  • No lee posiciones exactas: El robot sigue sin poder decir "La quinta palabra es 'manzana'". Solo puede deducir "Alguien dejó el grupo". Es un truco inteligente de deducción, no un mapa directo.
  • Necesita un poco de magia matemática: La prueba depende de que el robot pueda contar con mucha precisión (comprobaciones de paridad) para saber exactamente quién salió de la ventana. En el mundo real, esto podría requerir matemáticas de muy alta precisión, un detalle técnico que los autores reconocen.

Resumen

Piensa en la Codificación Posicional como las coordenadas GPS de cada palabra. Este artículo dice: "No necesitas un GPS si estás caminando por una calle y observando cómo la gente entra y sale de una tienda. El flujo de personas entrando y saliendo te cuenta la historia, incluso si no conoces sus direcciones exactas de la calle".

La propia ventana deslizante es el "GPS" para la IA, haciendo que la agenda de direcciones externa sea innecesaria para que la máquina sea capaz de computación universal.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →