← Últimos artículos
💬 NLP

The Changing Geometry of Grammar: Dimensionality and Neighborhood Reorganization across Transformer Layers

Este artículo investiga cómo las funciones gramaticales de los tokens moldean la geometría local de las representaciones de los transformers, revelando que la dimensionalidad intrínseca evoluciona de manera distinta para los elementos de clase abierta y cerrada a través de las capas debido a la reorganización de vecindad, con patrones distintos observados entre las arquitecturas de codificador y decodificador.

Autores originales: Samuele Vallisa, Federico Ravenda, Claudio Palominos, Rui He, Andrea Raballo, Antonietta Mira, Philipp Homan, Wolfram Hinzen

Publicado 2026-08-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Samuele Vallisa, Federico Ravenda, Claudio Palominos, Rui He, Andrea Raballo, Antonietta Mira, Philipp Homan, Wolfram Hinzen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Dentro de las mentes digitales de los modelos de lenguaje modernos, las palabras no se quedan quietas. Cuando una computadora lee una oración, transforma cada palabra en una larga lista de números, un punto que flota en un vasto espacio invisible con cientos de dimensiones. Estos puntos no están dispersos al azar; se agrupan, formando láminas delgadas y curvas dentro de ese vacío de alta dimensionalidad. Los científicos llaman a estas láminas variedades o manifolds, y el grosor de la lámina cuenta una historia sobre cuánta información está transportando la palabra. Si una palabra es libre de cambiar en muchas direcciones, la lámina es gruesa y compleja. Si la palabra está fuertemente constreñida por sus vecinas, la lámina se vuelve delgada y simple. Esta compresión de información es una forma fundamental en la que estos modelos entienden el mundo, pero hasta ahora, los investigadores han luchado por ver cómo la función específica que una palabra desempeña en una oración —ya sea un sustantivo pesado como "gato" o un conector ligero como "el"— moldea esta geometría.

Un equipo de investigadores se propuso mapear este paisaje oculto, preguntándose si el rol gramatical de una palabra dicta el camino que recorre a través de las capas de una red neuronal. Se centraron en la distinción entre las palabras de clase abierta, que portan un significado rico como los sustantivos y verbos, y las palabras de clase cerrada, que sirven a un propósito estructural como las preposiciones y los pronombres. Al alimentar miles de oraciones en cuatro tipos diferentes de modelos de lenguaje, rastrearon cómo la forma de los datos cambiaba capa por capa. Descubrieron que estos dos tipos de palabras no viajan por la misma ruta. Las palabras de clase cerrada se expanden hacia un espacio más amplio y complejo al principio del proceso, solo para colapsar de nuevo en una forma estrecha y simple mucho antes que sus contrapartes cargadas de contenido. Esto sugiere que el modelo primero estira estas palabras estructurales para comprender cómo se conectan con otras partes de la oración, y una vez que se establece esa conexión, las vuelve a plegar, habiendo extraído toda la información relacional necesaria.

Los investigadores descubrieron que este plegado geométrico no es solo una fluctuación aleatoria, sino una reorganización precisa del vecindario alrededor de cada palabra. A medida que una palabra se mueve más profundamente en la red, sus vecinos más cercanos en el espacio matemático cambian. Para las palabras estructurales, este cambio ocurre de manera rápida y decisiva. Una palabra como "el" puede comenzar su viaje rodeada de otros determinantes, pero a medida que la red procesa la oración, se desprende de ese grupo y se acerca al sustantivo específico que modifica. Este cambio de vecinos corresponde exactamente al momento en que la representación interna de la palabra se vuelve más simple y comprimida. En contraste, las palabras de contenido como "elefante" o "correr" mantienen una geometría más compleja y abierta durante más tiempo, reflejando la necesidad continua de integrar sus significados específicos con el contexto evolutivo de la oración.

El estudio también reveló que la arquitectura del modelo importa profundamente. Los modelos que leen oraciones en ambas direcciones a la vez, como los codificadores (encoders), resuelven estas conexiones estructurales temprano, causando que los cambios geométricos ocurran en las capas intermedias. Los modelos que leen estrictamente de izquierda a derecha, como los decodificadores (decoders), toman un camino diferente, con estos cambios geométricos ocurriendo más tarde, a medida que el contexto se acumula. A pesar de estas diferencias arquitectónicas, el hallazgo central se mantuvo firme: el camino que una palabra recorre a través de la red es un reflejo directo de su función gramatical. Los investigadores lo demostraron al mostrar que una computadora podía observar únicamente la forma de los puntos de datos —su grosor y cómo cambiaban sus vecinos— y adivinar correctamente si una palabra era una palabra funcional o una palabra de contenido, o incluso identificar su parte de la oración específica, sin haber visto nunca la palabra misma.

Este trabajo sugiere que la gramía de una oración no es solo un conjunto de reglas que el modelo sigue, sino una realidad física dentro de su estructura matemática. El modelo no simplemente almacena el significado de una palabra; reconfigura físicamente el espacio alrededor de esa palabra para resolver el rompecabezas de cómo encaja en la oración. En el momento en que una palabra estructural encuentra a su pareja en la oración, el modelo colapsa las dimensiones extra que necesitaba explorar, dejando atrás una representación compacta y eficiente. Es como si el modelo construyera un andamio temporal para sostener la oración y, una vez que la estructura es segura, retirara el andamio, dejando solo la forma esencial del significado. Esta danza geométrica de expansión y contracción proporciona una nueva ventana hacia cómo la inteligencia artificial comprende el delicado equilibrio entre las palabras que portan el significado y las palabras que lo sostienen todo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →