← Últimos artículos
💬 NLP

Divergent large language model predictions from convergent representations in ambiguous word pairs

Este estudio revela que los transformadores de solo decodificador resuelven la ambigüedad léxica al divergir inicialmente y luego reconverger parcialmente sus representaciones internas en las capas finales, creando una desconexión donde las distinciones semánticas persisten para impulsar predicciones distintas a pesar de volverse invisibles para las medidas estándar de similitud de incrustaciones.

Autores originales: K. Jack Scott, Narun Pat, Veronica Liesaputra

Publicado 2026-08-04
📖 7 min de lectura🧠 Análisis profundo

Autores originales: K. Jack Scott, Narun Pat, Veronica Liesaputra

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando comprender cómo un cerebro gigante y digital aprende a leer. Este cerebro se llama Modelo de Lenguaje Extenso (LLM, por sus siglas en inglés), que es la tecnología detrás de los chatbots y asistentes inteligentes que usamos todos los días. Para dar sentido al mundo, estos modelos no solo memorizan palabras; convierten cada palabra en una "huella digital" matemática llamada embedding. Piensa en esta huella digital como una coordenada en un mapa masivo y multidimensional. Si dos palabras significan cosas similares, sus coordenadas deberían estar cerca, como vecinos en una ciudad. Si significan cosas diferentes, deberían estar lejos.

Durante años, los científicos han confiado en este mapa. Creían que si observabas la huella digital final que un modelo creaba para una palabra, podrías saber exactamente qué pensaba ese modelo sobre esa palabra. Esta idea es la base de muchas herramientas que usamos hoy en día, como los motores de búsqueda que encuentran documentos o las aplicaciones que agrupan ideas similares. Pero hay un inconveniente: el lenguaje es complicado. Algunas palabras, como "banco", pueden significar un lugar donde guardar dinero o la orilla de un río. Estas se llaman palabras ambiguas. La gran pregunta que los investigadores se han estado haciendo es: ¿Muestra realmente el modelo la diferencia entre estos dos significados en su huella digital final, o el mapa se vuelve borroso y confuso justo al final?

Este artículo profundiza en ese misterio observando cómo tres modelos de IA diferentes —uno pequeño, uno mediano y uno muy grande— procesan palabras ambiguas capa por capa. Los investigadores descubrieron algo sorprendente y contraintuitivo. A medida que los modelos procesan una palabra como "banco", la distancia matemática entre el significado de "río" y el de "dinero" en realidad se ensancha en la parte media de la red, solo para volver a reducirse de nuevo en las capas finales. Es como si el mapa interno del modelo separara temporalmente los dos significos, y luego decidiera ponerlos de nuevo en el mismo vecindario justo antes de hablar.

Sin embargo, aquí está el giro: aunque las huellas digitales finales parecen muy similares (casi como si estuvieran de vuelta en el mismo vecindario), las predicciones del modelo son completamente diferentes. Cuando se le pide al modelo que adivine la siguiente palabra, sabe exactamente de qué "banco" se está hablando. El estudio muestra que la última capa contiene el secreto del significado, pero lo esconde de una manera que las herramientas de medición estándar (como las simples comprobaciones de distancia) no pueden ver. El modelo no está confundido; simplemente está usando un código secreto en su última capa que parece similitud, pero actúa como diferencia. Esto sugiere que confiar únicamente en la "huella digital" final para entender lo que un IA piensa puede ser engañoso, porque las distinciones más importantes están ocurriendo de una manera que parece haber desaparecido, aunque siguen impulsando el comportamiento del modelo.

La historia del mapa cambiante

Para entender cómo funciona esto, imagina que el modelo de IA es un equipo de 64 detectives (para el modelo más grande, Qwen2.5) pasando una nota secreta a lo largo de una larga fila. Cada detective representa una "capa" del modelo. Cuando la nota dice "banco", los primeros detectives solo están mirando la forma de la palabra. Aún no saben si es un río o un banco, por lo que sus notas se ven casi idénticas.

A medida que la nota pasa a los detectives del medio, sucede algo mágico. Estos detectives comienzan a prestar atención al contexto: las palabras antes y después de "banco". Un detective ve "río" cerca y marca la nota con un gran punto rojo. Otro ve "dinero" y la marca con una estrella azul. En esta etapa intermedia, las notas para los dos significados son tan diferentes como el día y la noche. Si midieras la distancia entre ellas aquí, estarían muy separadas.

Pero luego, la nota llega a los detectives finales. Aquí es donde la trama se complica. Los detectives finales toman esos puntos rojos y estrellas azules distintos y los vuelven a plegar en una nota de apariencia muy similar. Si midieras la distancia entre las notas finales para "orilla del río" y "banco de dinero", parecerían casi idénticas de nuevo. Es como si los detectives hubieran decidido: "Hagamos que nuestro informe final parezca el mismo para no confundir al jefe".

Sin embargo, el jefe (la salida del modelo) no se deja engañar. Aunque las notas finales parecen iguales, los detectives han codificado secretamente la diferencia de una manera que cambia la respuesta final. Cuando el modelo predice la siguiente palabra, no dice "río" para el contexto de dinero, a pesar de que la nota final parece pertenecer al río.

Los investigadores demostraron esto jugando al juego del "cambiazo". Tomaron la nota final del contexto de "río" y la intercambiaron en el contexto de "dinero". Cuando lo hicieron, el modelo cambió completamente de opinión y comenzó a predecir palabras relacionadas con el río. Esto demostró que la capa final contiene la diferencia, incluso si parece que los dos significados se han fusionado de nuevo. La diferencia sigue ahí, pero está oculta en las instrucciones para el siguiente paso, no en la forma de la nota en sí.

Por qué el mapa es engañoso

Este hallazgo es un poco como el truco de un mago. Si solo miras las manos del mago al final del truco, parecen vacías e idénticas. Pero si hubieras observado toda la actuación, habrías visto que el mago estuvo haciendo malabares con dos pelotas diferentes todo el tiempo. Los investigadores descubrieron que, para palabras ambiguas, los "malabares" ocurren en las capas intermedias, donde los significados están claramente separados. Pero para cuando el truco termina, las pelotas se han ocultado de nuevo y las manos parecen iguales.

El artículo probó esto en tres modelos diferentes: uno pequeño llamado GPT-2 (117 millones de parámetros), uno mediano llamado Llama-3.2 (3 mil millones de parámetros) y uno grande llamado Qwen2.5 (32 mil millones de parámetros). A pesar de sus diferentes tamaños y arquitecturas, todos hicieron lo mismo. Separaron los significados en el medio, luego los volvieron a unir al final, mientras seguían sabiendo exactamente qué significado usar.

Los investigadores también comprobaron si esto era solo una casualidad causada por la posición de las palabras en la frase. Cambiaron el orden de las palabras en las frases (como cambiar "El gato persiguió al ratón" por "El ratón persiguió al gato") y descubrieron que el comportamiento del modelo seguía estando impulsado por el significado, no solo por el orden de las palabras. Esto confirmó que el modelo realmente estaba comprendiendo la ambigüedad.

Lo que esto significa para el futuro

La gran conclusión es que podríamos haber estado mirando la parte equivoca del mapa. Durante mucho tiempo, la gente ha asumido que si dos cosas parecen similares en la capa final de una IA, significan lo mismo. Este artículo sugiere que eso no siempre es cierto. La capa final puede parecer una habitación abarrotada donde todos están parados cerca unos de otros, pero si escuchas lo que dicen (sus predicciones), te darás cuenta de que en realidad están discutiendo sobre temas completamente diferentes.

Esto no significa que la IA esté rota. Solo significa que la forma en que almacena la información es más compleja que un simple gráfico de distancias. Los investigadores sugieren que, si queremos construir mejores herramientas para buscar u organizar información, es posible que debamos mirar las capas intermedias donde los significados están claramente separados, o necesitamos escuchar lo que el modelo predice en lugar de simplemente medir qué tan cerca están sus huellas digitales.

El estudio no encontró una solución mágica ni una nueva forma de construir modelos, pero sí resolvió un rompecabezas sobre cómo piensan estos modelos. Demostró que la "magia" de la desambiguación no se pierde en la capa final; simplemente está escondida a plena vista, esperando a que miremos las pistas correctas. Los investigadores confían en estos resultados porque utilizaron múltiples modelos y diferentes tipos de palabras ambiguas, y el patrón se mantuvo cada vez. Es un recordatorio de que en el mundo de la IA, las cosas no siempre son lo que parecen, y a veces las diferencias más importantes son aquellas que no puedes ver con una regla.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →