← Últimos artículos
💬 NLP

How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation

Este artículo emplea la interpretabilidad mecanicista en Llama-3.1-8B-Instruct para revelar que las decisiones de citación en los sistemas RAG surgen de un "ensamble atribucional" distribuido y multietapa de cabezales de atención y MLPs, demostrando que amplificar o atenuar selectivamente estos componentes específicos puede mejorar significamente la fidelidad de la citación sin comprometer la precisión de la respuesta.

Autores originales: Ian van Dort (University of Amsterdam), Maria Heuss (University of Amsterdam)

Publicado 2026-06-30
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ian van Dort (University of Amsterdam), Maria Heuss (University of Amsterdam)

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: El "Experto Falso"

Imagina que le haces una pregunta a un bibliotecario muy inteligente y bien leído (la IA). Para ser útil, el bibliotecario saca un libro del estante, lee un dato y lo escribe para ti. Crucialmente, también escribe una pequeña nota al pie que dice: "Encontré esto en el Libro A".

Esto se llama Generación Aumentada por Recuperación (RAG). La idea es que la nota (la cita) demuestra que el bibliotecario realmente consultó el libro, haciendo que la respuesta sea confiable.

El problema: ¿Qué pasa si el bibliotecario ya sabía la respuesta de memoria? Escribe la respuesta, pero luego, solo para parecer profesional, agarra el Libro A del estante, ve que ese libro también contiene ese dato, y le pega la cita de todos modos.

  • El resultado: La respuesta es correcta y la cita es "correcta" (el libro dice eso), pero la cita es infiel. El bibliotecario no usó realmente el libro para formar la respuesta; solo lo usó como un accesorio para que la respuesta pareciera verificada.

Los autores de este artículo querían averiguar: ¿Realmente lee la IA el libro antes de escribir la respuesta, o simplemente pega una cita al final para quedar bien?

La Investigación: Mirando dentro de la Máquina

Normalmente, tratamos a la IA como una "caja negra". Hacemos una pregunta, obtenemos una respuesta y comprobamos si es correcta. Pero para ver si la IA está mintiendo sobre sus fuentes, tienes que mirar dentro de la máquina mientras piensa.

Los autores utilizaron una técnica llamada Interpretabilidad Mecanicista. Piensa en el cerebro de la IA como una ciudad masiva con millones de trabajadores diminutos (neuronas) y carreteras (conexiones). Los autores utilizaron una herramienta llamada Parcheo de Activación (Activation Patching).

La analogía: Imagina que la IA es una fábrica que ensambla un coche.

  • La ejecución "Limpia": La fábrica construye un coche con el motor adecuado (el documento relevante).
  • La ejecución "Sucia": La fábrica construye un coche con el motor equivento (un documento aleatorio e irrelevante).
  • El Parche: Los investigadores tomaron los engranajes y pistones específicos de la ejecución "Limpia" y los intercambiaron en la ejecución "Sucia". Si el coche de repente empezó a funcionar correctamente, supieron que esos engranajes específicos eran los responsables de la decisión de la "cita".

Lo que Encontraron: El "Equipo de Citación"

Descubrieron que la IA no tiene un único "Cerebro de Citación" que decida citar. En su lugar, es un equipo distribuido de muchas partes pequeñas trabajando juntas, lo que llaman un "Ensamble Atribucional".

Así es como trabaja este equipo, paso a paso:

  1. El Buscador de Nombres (Capas Tempranas):
    Lo primero que hace la IA es buscar nombres coincidentes. Si la pregunta trata sobre "Uganda" y el documento menciona "Uganda", un conjunto específico de trabajadores se ilumina.

    • El fallo: Este es un truco superficial. La IA no está comprobando si el documento explica la respuesta; solo está comprobando si la palabra "Uganda" aparece en ambos lugares. Es como un estudiante que ve la palabra "fotosíntesis" tanto en el libro de texto como en el examen, por lo que asume que el libro de texto es la fuente, incluso si el libro de texto está hablando de algo totalmente distinto.
  2. Los Mandos Intermedios (Capas Medias):
    Una vez que los nombres coinciden, todo un equipo de trabajadores en la parte media del cerebro de la IA se involucra. Realizan muchas "comprobaciones conjuntas" (comprobaciones AND).

    • La analogía: Es como una puerta de seguridad. Necesitas una llave (la coincidencia de nombres), una identificación (el contexto del documento) y una contraseña (la estructura de la frase) todo al mismo tiempo. Si cualquiera de estas pequeñas comprobaciones falla, todo el proceso de citación colapsa. Esto hace que el sistema sea muy frágil.
  3. La Decisión Final (Capas Tardías):
    Al final, justo antes de que la IA escriba la respuesta, un grupo final de trabajadores decide: "Bien, los nombres coincidieron, las comprobaciones pasaron, escribamos [1]".

    • La sorpresa: Los investigadores descubrieron que el significado real de la respuesta no impulsaba esta decisión tanto como la coincidencia de nombres.

La Conclusión Principal: La "Ilusión de Confianza"

El artículo concluye que la decisión de la IA de citar suele estar impulsada por heurísticas superficiales (trucos simples como la coincidencia de nombres) en lugar de una comprensión profunda del contenido del documento.

  • La Ilusión: Cuando ves una respuesta con una cita, asumes que la IA leyó la fuente para construir la respuesta.
  • La Realidad: La IA podría simplemente haber recordado la respuesta de su entrenamiento, vio que el documento fuente mencionaba las mismas palabras clave y luego "pegó" la cita para parecer honesta.

Por qué esto importa

Los autores advierten que esto crea una falsa sensación de seguridad.

  • Si un médico o un abogado confía en una IA que da una respuesta correcta con una cita, podrían confiar ciegamente en ella.
  • Pero si la cita fue solo una "coincidencia de nombres" y no una verificación real, la IA podría estar difundiendo desinformación que parece perfectamente verificada.

Resumen en una frase

El artículo revela que los modelos de IA a menudo deciden añadir una cita no porque realmente hayan usado la fuente para construir su respuesta, sino porque encontraron una palabra coincidente en la fuente y ejecutaron una lista de verificación automatizada y simple para "sellar" la respuesta como verificada.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →