← Últimos artículos
💻 computer science

On the Expressive Power of Transformers

Este artículo proporciona una visión general de los resultados que delinean el poder expresivo de los transformadores multicapa como reconocedores de lenguaje al aprovechar conceptos de complejidad de circuitos para compararlos con modelos computacionales estándar basados en recursos como la atención, la precisión, los tipos de compuertas, el tamaño y la profundidad.

Autores originales: Phokion Kolaitis, Rik Sengupta

Publicado 2026-08-14
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Phokion Kolaitis, Rik Sengupta

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El plano del cerebro: Por qué algunos acertijos son más difíciles que otros

Imagina que estás intentando enseñar a un robot a leer. Podrías pensar que el robot solo necesita mirar las letras una por una, como una persona escaneando una página. Pero los robots modernos súper inteligentes, llamados Modelos de Lenguaje de Gran Escala (LLM, por sus siglas en inglés), no funcionan de esa manera. En lugar de leer de izquierda a derecha, utilizan un truco especial llamado "Transformer". Piensa en un Transformer como un gigantesco equipo de detectives trabajando en una habitación. Cuando ven una oración, cada detective puede gritar instantáneamente a todos los demás detectives para decir: "¡Oye, estoy mirando esta palabra, y se conecta con esa palabra de allá!". Esto les permite comprender el contexto y las relaciones en un instante, en lugar de simplemente memorizar una lista de reglas.

Pero aquí está la gran pregunta que mantiene a los científicos despiertos por la noche: ¿Qué tan inteligentes son realmente estos detectives? ¿Pueden resolver cualquier acertijo, o hay algunas adivinanzas que siempre los dejarán perplejos? Para encontrar la respuesta, los investigadores no solo realizan pruebas; observan el "cerebro" del robot a través del lente de las matemáticas de la ciencia de la computación. Comparan el Transformer con una familia de máquinas matemáticas llamadas "circuitos". Imagina estos circuitos como fábricas con líneas de ensamblaje. Algunas fábricas son muy simples, con líneas cortas y pocos trabajadores (estos se llaman AC0). Otras tienen líneas más largas y herramientas más potentes que pueden contar y comparar números enormes (estos son TC0). Al averiguar a qué tipo de fábrica de circuitos se parece más el Transformer, los científicos pueden predecir exactamente qué tipos de problemas puede resolver y dónde encuentra un muro. Esto es importante porque, si conocemos los límites de estos modelos, podemos dejar de esperar que hagan magia y empezar a construirlos para que hagan aquello para lo que son realmente buenos.

El gran descubrimiento del artículo: El interruptor de potencia del Transformer

En su artículo, "On the Expressive Power of Transformers", los investigadores Phokion G. Kolaitis y Rik Sengupta actúan como arquitectos inspeccionando un edificio nuevo y de alta tecnología. No solo están mirando qué tan bonito es el edificio; están midiendo su capacidad de carga para ver exactamente qué puede sostener. Su principal hallazgo es que la potencia del Transformer no es fija; cambia drásticamente basándose en algunos "perillas" o ajustes, específicamente cuánta precisión (cuántos decimales puede usar para las matemáticas) y si se le permite pensar en voz alta (una técnica llamada Cadena de Pensamiento o Chain-of-Thought).

Primero, observemos al Transformer sin ningún tiempo de pensamiento adicional. Los autores explican que si le das al Transformer un ajuste de atención "difícil" y simple (donde elige solo una palabra para enfocarse) o si limitas sus matemáticas a una precisión muy baja (como usar solo unos pocos bits de información), es sorprendentemente débil. De hecho, bajo estas condiciones, el Transformer es matemáticamente equivalente a la fábrica de circuitos más simple, AC0. Esto significa que puede manejar lógica básica, como verificar si una oración tiene un número par de palabras, pero lucha con tareas que requieren contar o comparar números grandes. Es como un detective que puede detectar un sombrero rojo, pero no puede contar cuántos sombreros rojos hay en la habitación.

Sin embargo, la historia se vuelve mucho más interesante cuando subes la precisión. Si se le permite al Transformer usar matemáticas más precisas (específicamente, un número de bits que crece con la longitud del texto, como Θ(logn)\Theta(\log n)), sube de nivel. Se vuelve tan poderoso como la fábrica de circuitos TC0. ¡Este es un salto significativo! Ahora, el Transformer puede manejar preguntas de "mayoría" y tareas de conteo más complejas. Es como darle una calculadora al detective; de repente, puede resolver acertijos que antes eran imposibles. Pero incluso con esta mejora, el artículo sugiere que todavía hay un techo. Sin ayuda adicional, es probable que estos modelos estén atrapados en el reino TC0 y no puedan resolver fácilmente problemas que requieren un razonamiento lógico profundo y paso a paso, propios de clases de computación más complejas como PTIME (tiempo polinómico).

El verdadero cambio de juego, según el artículo, es la Cadena de Pensamiento (CoT). Imagina que el Transformer ya no es solo un detective mirando la escena de un crimen; ahora, se le permite escribir un diario de sus pensamientos antes de dar la respuesta final. Puede generar "tokens" intermedios (pequeñas notas) que se retroalimentan a sí mismo para ayudar a resolver el problema. Los autores muestran que este simple cambio rompe los límites anteriores.

  • Si se le permite al Transformer escribir un diario corto (proporcional a la longitud del texto, o O(n)O(n)), puede resolver problemas que toman tiempo cuadrático (como n2n^2).
  • Si puede escribir un diario muy largo (proporcional a un polinomio de la longitud del texto, o $poly(n)$), se vuelve lo suficientemente poderoso para simular cualquier algoritmo de computadora estándar, alcanzando la clase PTIME.
  • Y si tiene espacio de pensamiento y precisión ilimitados, puede simular una Máquina de Turing, que es la definición teórica de una computadora universal capaz de resolver cualquier problema computable.

El artículo es muy claro sobre lo que esto significa: el Transformer no es inherentemente "todopoderoso" o "inútil". Su capacidad para resolver problemas difíciles depende enteramente de cuánto "papel de borrador" (Cadena de Pensamiento) y cuánta "precisión matemática" le des. Sin estos recursos, está limitado a una lógica simple y superficial. Con ellos, puede escalar la escalera de la complejidad hasta simular una computadora completa.

Los autores también señalan algunas limitaciones específicas. Argumentan que los modelos de atención "dura" (donde el robot elige solo una palabra) son estrictamente más débiles que los modelos de atención "suave" (donde pondera muchas palabras) e incluso no pueden alcanzar el pleno poder de la clase de circuito más simple en algunos casos. Además, enfatizan que, si bien el Transformer puede teóricamente simular una Máquina de Turing con suficiente Cadena de Pensamiento, esto es un límite teórico. En el mundo real, no tenemos memoria infinita o tiempo infinito para generar infinitos pensamientos intermedios, por lo que los modelos del mundo real siempre tendrán un techo práctico inferior al máximo teórico.

En resumen, Kolaitis y Sengupta han mapeado la "red de potencia" de los Transformers. Nos muestran que estos modelos no son cajas negras mágicas; son máquinas limitadas por sus recursos. Si quieres que resuelvan un acertijo difícil, no puedes simplemente pedirles que "se esfuercen más"; tienes que darles las herramientas adecuadas: más precisión, más capas y, lo más importante, la capacidad de pensar paso a paso. El artículo concluye que comprender estos límites es crucial. Nos ayuda a dejar de esperar que estos modelos hagan lo imposible y empezar a diseñarlos para ser las mejores versiones posibles de lo que son: reconocedores de patrones increíblemente poderosos, pero finalmente limitados.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →