← Últimos artículos
💬 NLP

Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents

Este artículo presenta un nuevo marco de evaluación que utiliza un analizador sintáctico AST para evaluar informes de investigación generados por modelos de lenguaje grandes en cuanto a validez de enlaces, relevancia y precisión factual, revelando una desconexión crítica donde incluso los modelos de vanguardia mantienen una alta accesibilidad y relevancia de las citas pero luchan con la consistencia factual, un problema que se agrava a medida que aumenta la profundidad de recuperación.

Autores originales: Hailey Onweller, Elias Lumer, Austin Huber, Pia Ramchandani, Vamse Kumar Subbiah, Corey Feld

Publicado 2026-05-08
📖 4 min de lectura☕ Lectura para el café

Autores originales: Hailey Onweller, Elias Lumer, Austin Huber, Pia Ramchandani, Vamse Kumar Subbiah, Corey Feld

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que contratas a un equipo de asistentes de investigación súper inteligentes (modelos de IA) para escribir un informe sobre un tema complejo. Les dices: "Vayan a buscar la verdad en internet, escriban un informe y asegúrense de listar exactamente dónde encontraron cada hecho individual".

El artículo que compartiste es como un inspector de control de calidad que decidió revisar la tarea que estos asistentes de IA entregaron. En lugar de simplemente leer el informe y asentir, el inspector construyó un robot especial para verificar cada nota al pie que la IA escribió.

Esto es lo que encontraron, explicado de forma sencilla:

La inspección de tres pasos

Los investigadores construyeron un sistema para verificar las citas de la IA de tres maneras específicas, como un control de seguridad de tres partes:

  1. La verificación "¿Está abierta la puerta?" (El enlace funciona): ¿El enlace funciona realmente? Si haces clic, ¿te lleva a una página web o es un error 404 roto?
  2. La verificación "¿Se trata de lo mismo?" (Contenido relevante): Si el enlace funciona, ¿la página web habla realmente del tema que la IA afirmó que hablaba? (Por ejemplo: la IA dice "Este enlace prueba que los gatos son perros", pero el enlace es en realidad una receta de lasaña).
  3. La verificación "¿Es cierto?" (Verificación de hechos): Esta es la parte más difícil. ¿La página web contiene realmente los hechos, números o fechas específicos que la IA dijo que contenía?

La gran sorpresa: El problema del "envoltorio brillante"

El descubrimiento más impactante es que los asistentes de IA son excelentes en las dos primeras verificaciones, pero terribles en la tercera.

  • La analogía: Imagina a un estudiante que escribe un trabajo e incluye una bibliografía.
    • El 94% de las veces, los libros en la bibliografía realmente existen en los estantes de la biblioteca (El enlace funciona).
    • El 80% de las veces, esos libros tratan realmente sobre el tema sobre el que el estudiante está escribiendo (Contenido relevante).
    • Pero, cuando realmente abres el libro y lees la página específica que el estudiante citó, solo entre el 40% y el 77% de las veces el libro dice realmente lo que el estudiante afirmó que decía.

La conclusión: La IA es muy buena para encontrar un enlace que funcione a un sitio web relevante, pero a menudo miente sobre qué dice ese sitio web. Es como un guía turístico que siempre te lleva al museo correcto, pero luego te cuenta la historia equivocada sobre las exhibiciones dentro.

La paradoja de "más es menos"

Los investigadores también probaron qué sucede si le dicen a la IA que busque más a fondo y examine más sitios web. Podrías pensar: "Si le pido a la IA que lea 150 sitios web en lugar de solo 2, será más precisa, ¿verdad?".

Incorrecto.

  • La analogía: Imagina intentar resolver un rompecabezas. Si tienes 2 piezas del rompecabezas, puedes ver fácilmente la imagen. Si alguien vierte 150 piezas del rompecabezas frente a ti, te abrumas. Podrías empezar a forzar piezas que no encajan solo para terminar la imagen.
  • El resultado: A medida que la IA se vio obligada a examinar más y más fuentes (de 2 hasta 150), su capacidad para decir la verdad en realidad disminuyó aproximadamente un 42%. Los enlaces seguían funcionando y los temas seguían siendo relevantes, pero los hechos específicos se volvieron un caos. La IA sufrió una "sobrecarga de información" y comenzó a alucinar detalles.

¿Quién lo hizo bien? ¿Quién lo hizo mal?

  • Los modelos "de vanguardia" (las IAs de las grandes tecnológicas): Estos modelos (como los de OpenAI, Anthropic y Google) fueron muy buenos para generar informes que parecían perfectos. Casi siempre encontraron enlaces que funcionaban y temas relevantes. Sin embargo, incluso los más inteligentes solo acertaron los hechos entre el 39% y el 77% de las veces.
  • Los modelos de código abierto: Estos modelos tuvieron aún más dificultades. Muchos ni siquiera pudieron terminar la tarea de escribir un informe con citas. Cuando lo intentaron, fueron mucho peores para encontrar enlaces que funcionaran y para acertar los hechos.

La conclusión final

El artículo concluye que no podemos confiar en la investigación de la IA solo porque tenga una lista de enlaces al final. Una larga lista de enlaces que funcionan crea una "falsa sensación de confianza". Solo porque la puerta está abierta y la habitación es la correcta, no significa que la historia que la IA te cuenta sobre lo que hay dentro de la habitación sea cierta.

Los investigadores construyeron este "robot de inspección" para ayudarnos a ver esa brecha entre una cita que parece buena y una cita que es realmente verdadera.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →