← Últimos artículos
🤖 machine learning

Barriers to Universal Reasoning With Transformers (And How to Overcome Them)

Este artículo demuestra que, aunque los Transformers estándar de Cadena de Pensamiento no logran generalizar a trazas de razonamiento más largas debido a limitaciones inherentes en la copia y la recuperación, pueden alcanzar una completitud de Turing generalizable en longitud mediante el uso de un vocabulario en crecimiento con tokens de hito únicos y codificaciones de cambio de valor para superar estas barreras.

Autores originales: Oliver Kraus, Yash Sarrof, Yuekun Yao, Alexander Koller, Michael Hahn

Publicado 2026-04-29
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Oliver Kraus, Yash Sarrof, Yuekun Yao, Alexander Koller, Michael Hahn

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Imagen: El "Estudiante Inteligente" que Olvida

Imagina a un estudiante muy inteligente (el Transformador) que está aprendiendo a resolver rompecabezas complejos. Para ayudarlos, los profesores les dan una "pizarra" donde pueden escribir sus pensamientos paso a paso. Esto se llama Cadena de Pensamiento (CoT).

Investigaciones anteriores mostraron que, con esta pizarra, el estudiante podría teóricamente resolver cualquier rompecabezas, sin importar cuán difícil fuera. Era como darle un superpoder.

Sin embargo, los autores de este artículo descubrieron un defecto mayor: El estudiante es excelente resolviendo rompecabezas en los que ha practicado, pero fracasa miserablemente cuando los rompecabezas se vuelven más largos. Si los entrenas en un rompecabezas de 10 pasos, no pueden resolver uno de 20 pasos, incluso si la lógica es la misma. Parecen alcanzar un "techo" donde su razonamiento se desmorona.

Este artículo pregunta: ¿Por qué sucede esto y podemos solucionarlo?


Los Dos Grandes Obstáculos

Los autores descubrieron que el cerebro del estudiante (el Transformador) tiene dos "fallos" específicos que le impiden generalizar a tareas más largas.

1. El Fallo del "Fotocopiadora" (Copiado Repetido)

Imagina que el estudiante necesita copiar una lista larga de instrucciones de un libro a su pizarra.

  • El Problema: Si la lista es corta, pueden copiarla fácilmente. Pero si la lista es larga, se confunden. No pueden encontrar de manera fiable la línea exacta que necesitan copiar desde el medio de una página larga sin perder el hilo.
  • La Afirmación del Artículo: Los Transformadores estándar luchan por "copiar" cadenas arbitrarias de información cuando cambia la longitud. Se pierden en medio del texto.

2. El Fallo del "Último Visto" (Recuperación)

Imagina que el estudiante está rastreando una variable, como "El valor de X".

  • El Problema: Si el estudiante escribe "X = 5", luego escribe "X = 7", y luego "X = 5" de nuevo, necesitan saber cuál es el valor actual. En una cadena larga de pensamientos, el estudiante a menudo olvida cuál "5" fue el más reciente. Podrían agarrar un "5" antiguo del principio de la página en lugar del nuevo.
  • La Afirmación del Artículo: El modelo lucha por encontrar la última actualización en un largo historial de cambios. Es como intentar encontrar la última vez que comiste una manzana en un diario que tiene 1.000 páginas de entradas.

La Solución: Una Nueva Forma de Escribir en la Pizarra

Los autores proponen dos trucos inteligentes para arreglar estos fallos. No cambian el cerebro del estudiante; solo cambian cómo se escriben las instrucciones en la pizarra.

Truco #1: Las "Etiquetas de Nombre" (Tokens Indicadores)

Para arreglar el Fallo de la Fotocopiadora, los autores sugieren dar a cada elemento del rompecabezas una tarjeta de identificación única o una "Etiqueta de Nombre".

  • Cómo funciona: En lugar de decir "Ve a la línea 50", la instrucción dice "Ve al elemento con la Etiqueta de Nombre #42".
  • Por qué ayuda: Incluso si la lista se hace más larga, el estudiante no tiene que contar para encontrar la línea 50. Solo buscan la Etiqueta de Nombre específica. Es como tener una biblioteca donde cada libro tiene un código de barras único, por lo que no tienes que escanear todo el estante para encontrar el que necesitas.

Truco #2: El "Registro de Cambios" (Codificación de Cambios de Valor)

Para arreglar el Fallo del Último Visto, los autores sugieren cambiar qué escribe el estudiante.

  • Antigua Forma: El estudiante escribe el estado actual completo cada vez (por ejemplo, "X es 5", luego "X es 7", luego "X es 5"). Esto crea mucho ruido y hace difícil saber cuál es el más reciente.
  • Nueva Forma: El estudiante solo escribe qué cambió.
    • En lugar de escribir "X es 7", escriben "X cambió de 5 a 7".
    • En lugar de escribir "X es 5" de nuevo, escriben "X cambió de 7 a 5".
  • Por qué ayuda: Para encontrar el valor actual, el estudiante solo cuenta los cambios. Si ven "5 a 7" y luego "7 a 5", saben que el valor actual es 5. Es como llevar un libro de contabilidad de transacciones en lugar de reescribir todo tu saldo bancario cada vez que gastas un dólar.

Los Resultados: Teoría vs. Realidad

El artículo prueba estas ideas de dos maneras:

  1. La Prueba Matemática (Teoría):

    • Mala Noticia: Si te atienes a un conjunto fijo de palabras (un alfabeto finito) y estilos de escritura estándar, el estudiante no puede aprender a resolver rompecabezas más largos que cierta complejidad (específicamente, no pueden ir más allá de una clase de problemas llamada TC0). Están matemáticamente atrapados.
    • Buena Noticia: Si permites que el estudiante use un suministro infinito de Etiquetas de Nombre únicas (Indicadores) y utiliza el método de "Registro de Cambios", puede teóricamente resolver cualquier rompecabezas, sin importar cuán largo sea.
  2. Los Experimentos (Realidad):

    • Los autores entrenaron modelos informáticos pequeños desde cero en tres tareas difíciles:
      • Paridad: Contar si una cadena de números tiene un número impar o par de 1s.
      • Evaluación Booleana: Resolver rompecabezas de lógica complejos (Verdadero/Falso).
      • Permutación S5: Rastrear el movimiento de 5 objetos que se intercambian entre sí.
    • El Resultado:
      • Los modelos entrenados con el método estándar fallaron cuando los rompecabezas se volvieron más largos.
      • Los modelos entrenados con Etiquetas de Nombre y Registros de Cambios fueron mucho mejores resolviendo rompecabezas más largos que nunca habían visto antes.
    • También probaron esto en modelos de IA gigantes preentrenados (como Llama y Mistral). Incluso sin volver a entrenarlos, simplemente solicitándoles que usen Etiquetas de Nombre y Registros de Cambios en sus respuestas, los hizo significativamente más inteligentes al resolver problemas largos y difíciles.

La Conclusión

El artículo concluye que la Cadena de Pensamiento no es magia. Solo decirle a una IA que "piense paso a paso" no es suficiente si la forma en que piensa es propensa a perderse en listas largas.

Para hacer que la IA sea verdaderamente fiable en el razonamiento a largo plazo, necesitamos dar formato a los "pensamientos" de una manera que evite las dos trampas principales:

  1. Darle a cada paso una Etiqueta de Nombre única para que nada se pierda.
  2. Solo registrar Cambios para que el modelo no se confunda con información antigua.

Al arreglar el formato del razonamiento, podemos ayudar a los modelos de IA a romper sus límites actuales y resolver problemas mucho más difíciles.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →