← Últimos artículos
💬 NLP

Factual Retrieval in LLMs Is a Redundant, Distributed and Non-Contiguous Process

Este artículo revela que la recuperación de hechos en los grandes modelos de lenguaje depende de rutas computacionales redundantes, distribuidas y no contiguas a través de múltiples capas, lo que desafía el supuesto de un almacenamiento de conocimiento localizado y explica la discrepancia observada en la edición de conocimiento.

Autores originales: Hail Hochman, Natalie Shapira, Yoav Goldberg

Publicado 2026-06-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Hail Hochman, Natalie Shapira, Yoav Goldberg

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un Modelo de Lenguaje de Gran Escala (LLM) como una biblioteca masiva de varios pisos donde cada libro contiene una pequeña pieza del conocimiento del mundo. Durante mucho tiempo, los investigadores pensaron que si querías encontrar un dato específico —como "¿Cuál es la lengua materna de Angela Merkel?"— la respuesta estaba almacenada en una habitación específica (una capa específica del modelo) y se recuperaba en línea recta, piso por piso.

Este artículo sostiene que la realidad es mucho más caótica, flexible y redundante. Aquí está el desglose de sus hallazgos utilizando analogías sencillas:

1. El viaje en ascensor "no contiguo"

La idea antigua: Para obtener una respuesta, el "ascensor" interno del modelo (el procesamiento de datos) se detiene en cada uno de los pisos, verificando la información en cada paso, desde la planta baja hasta el último piso.

El descubrimiento del artículo: El ascensor no se detiene en todos los pisos. De hecho, a menudo se salta pisos enteros.

  • La analogía: Imagina que estás intentando entregar un paquete. No necesitas que el camión de reparto se detenga en cada una de las casas de la calle. A veces, el camión puede saltar del segundo piso directamente al octavo, ignorando los pisos intermedios, y aun así entregar el paquete en la puerta correcta.
  • El hallazgo: Los autores descubrieron que, para recuperar un dato, el modelo solo necesita un conjunto específico y disperso de capas. Puede "teletransportar" la información a través de la red, saltándose muchos pasos intermedios que resultan innecesarios para ese dato específico.

2. Las "rutas de respaldo redundantes"

La idea antigua: Existe un único camino "correcto" para encontrar un dato. Si bloqueas ese camino, el modelo falla.

El descubrimiento del artículo: El modelo tiene múltiples rutas de respaldo que funcionan igual de bien.

  • La analogía: Piensa en una ciudad con una autopista principal. Si bloqueas la autopía, el tráfico no se detiene; se redirige instantáneamente a una compleja red de caminos secundarios, calles laterales e incluso una autopista diferente que toma una ruta más larga y sinuosa. Ambas rutas te llevan al mismo destino, pero se ven completamente diferentes.
  • El hallazgo: Para casi todos los datos que probaron, los investigadores encontraron una "ruta primaria" (la ruta más corta y eficiente) y al menos una "ruta alternativa" (una ruta más larga y profunda). Si bloqueas la ruta primaria, el modelo aún puede encontrar la respuesta usando la ruta de respaldo. Esto significa que el conocimiento no se almacena en un solo lugar; está distribuido y es redundante.

3. El "equipo mínimo" frente a la orquesta completa

La idea antigua: Todo el modelo trabaja en conjunto para generar cada respuesta.

El descubrimiento del artículo: Solo necesitas un pequeño equipo específico de capas para hacer el trabajo.

  • La analogía: Imagina una orquesta sinfónica tocando una canción. Podrías asumir que todos los músicos son necesarios para cada nota. Pero los autores descubrieron que, para un dato específico, solo unos pocos músicos (capas) específicos están realmente tocando las notas. El resto de la orquesta está esencialmente en silencio o haciendo otra cosa.
  • El hallazgo: Identificaron una "ruta de computación de atributos mínima". Este es el grupo más pequeño de capas requerido para producir la respuesta correcta. Sorprendentemente, este grupo a menudo termina en la mitad del modelo. Una vez que la información es procesada por estas pocas capas, el resto del modelo no necesita realizar más esfuerzos pesados para conocer la respuesta.

4. El misterio del "desajuste de edición"

La idea antigua: Si quieres cambiar un dato en el modelo (por ejemplo, cambiar "la lengua de Merkel es el alemán" a "francés"), debes editar la capa específica donde se almacena ese dato.

El descubrimiento del artículo: Donde un dato se "almacena" y donde necesitas "editarlo" suelen ser lugares diferentes.

  • La analogía: Imagina una línea de ensamblaje de una fábrica. La parte que fabrica el producto puede estar al principio de la línea, pero la parte que corrige un error puede estar al final de la misma. Si intentas arreglar el producto al principio, podrías romper la máquina.
  • El hallazgo: Debido a que el modelo utiliza estos caminos dispersos y redundantes, el simple hecho de encontrar la capa donde los datos "parecen" la respuesta no es suficiente. Para editar con éxito un dato, a menudo tienes que intervenir en una etapa de "transformación" específica en la ruta, no necesariamente donde el conocimiento parece estar sentado.

Resumen de la "visión general"

Los autores concluyen que la forma en que los LLM almacenan y recuperan los datos no es como un archivador donde sacas un solo cajón. En cambio, es como una red neuronal altamente flexible y redundante donde:

  1. El conocimiento está distribuido: Está repartido en muchas capas, no encerrado en una sola.
  2. Los caminos son flexibles: El modelo puede tomar rutas cortas y directas o rutas de respaldo largas y sinuosas para encontrar la misma respuesta.
  3. Los saltos son normales: El modelo a menudo ignora las capas intermedias, saltando directamente a donde se necesita la información.

Esto explica por qué los modelos de IA son tan robustos (tienen respaldos) pero también por qué es tan difícil determinar exactamente "dónde" vive un dato o cómo cambiarlo de manera fiable. El proceso es una danza compleja, de múltiples pasos, que ocurre de una manera no lineal y dispersa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →