← Últimos artículos
💬 NLP

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

Este artículo demuestra que reemplazar las salidas de cuadros delimitadores basados en coordenadas por una interfaz de "cita y recuperación" basada en texto reduce significativamente las alucinaciones de atribución y mejora la recuperación de evidencia en la comprensión de documentos visuales, al tiempo que permite un entrenamiento efectivo sin etiquetas costosas a nivel de región.

Autores originales: Zhuchenyang Liu, Yao Zhang, Yu Xiao

Publicado 2026-07-28
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Zhuchenyang Liu, Yao Zhang, Yu Xiao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective tratando de resolver un misterio, pero en lugar de una escena del crimen, estás ante una pila gigante y desordenada de documentos: recibos, gráficos y notas manuscritas. En el mundo de la inteligencia artificial, estos se llaman "documentos visuales". Para que una computadora sea un buen detective, no puede simplemente adivinar la respuesta; tiene que señalar exactamente dónde encontró la pista. Esto se llama "atribución".

Durante mucho tiempo, la forma estándar de hacer que una computadora señalara una pista era pedirle que dibujara un cuadro alrededor del texto y le diera las coordenadas GPS de ese cuadro (como "x=50, y=100"). Piensa en esto como pedirle a un niño que señale una palabra específica en una página gritando números. Es una forma torpe de jugar a "Veo, Veo". El documento que estás a punto de leer investiga por qué este "juego de coordenadas" está fallando tan estrepitosamente. Sugiere que el problema no es que la computadora sea demasiado tonta para encontrar la pista, sino que las reglas del juego (las coordenadas) son demasiado confusas. Los investigadores proponen una nueva regla: en lugar de gritar números, la computadora simplemente debería leer la pista en voz alta, palabra por palabra. Entonces, un ayudante inteligente (un sistema de recuperación) encuentra el lugar exacto en la página donde viven esas palabras.

El gran fallo del "señalamiento"

Los investigadores partieron de una observación frustrante. Cuando pedían a modelos de IA potentes que respondieran preguntas sobre documentos largos y demostraran su trabajo, los modelos eran excelentes obteniendo la respuesta correcta, pero terribles mostrando dónde la encontraron. Incluso cuando la respuesta era perfecta, la IA a menudo señalaba el párrafo equivocado o dibujaba un cuadro en medio de una página en blanco. El artículo llama a esto "Alucinación de Atribución". Es como un estudiante que resuelve bien el problema de matemáticas pero escribe la solución en la parte posterior del escritorio del profesor en lugar de en su cuaderno.

La gran pregunta era: ¿Es la IA realmente mala encontrando la ubicación, o es simplemente mala hablando el lenguaje de las "coordenadas"?

El experimento de "Leer en Voz Alta"

Para probar esto, el equipo realizó un experimento masivo utilizando seis modelos de IA diferentes. Mantuvieron todo igual —los documentos, las preguntas y los modelos— pero cambiaron las reglas del juego.

Juego A (La forma antigua): La IA tenía que producir un conjunto de números (coordenadas) para dibujar un cuadro alrededor de la evidencia.
Juego B (La forma nueva): Se le dijo a la IA que simplemente "leyera la evidencia en voz alta" citando el texto exacto del documento. Un programa de computadora separado tomaba esa cita y encontraba automáticamente la pieza correspondiente del documento.

Los resultados fueron como un truco de magia. Cuando se le permitió a la IA "leer en voz alta" en lugar de "gritar números", su capacidad para encontrar el lugar correcto se disparó.

  • La forma antigua: La IA encontraba la evidencia correcta menos del 8% de las veces.
  • La forma nueva: La IA encontraba la evidencia correcta entre el 26% y el 47% de las veces.

¡Ese es un salto enorme! La tasa de "alucinaciones" (señalar el lugar equivocado) se redujo aproximadamente a la mitad. ¿La parte más sorprendente? La calidad de las respuestas reales no cambió mucho. Los modelos eran igual de inteligentes; simplemente eran mucho mejores mostrando su trabajo cuando no tenían que luchar con las coordenadas.

Por qué las coordenadas son el problema

El artículo argumenta que el fallo no fue una falta de inteligencia. Fue un "artefacto de la interfaz". Piensa en esto como pedirle a un chef que describa una receta. Si lo obligas a describir los ingredientes usando solo un código secreto de números, podría obtener el plato correctamente pero fallar al enumerar los ingredientes. Pero si dejas que simplemente diga "dos tazas de harina", la lista se vuelve precisa.

Los investigadores descubrieron que los modelos de IA en realidad sabían dónde estaba la información; simplemente la describían con palabras (como "en la página 2, debajo de la mesa") cuando se les obligaba a usar coordenadas. Al cambiar al método de "citar", permitieron que la IA usara su fuerza natural: el lenguaje.

Enseñando a la IA a ser un mejor detective

Los investigadores no se detuvieron solo en cambiar las reglas; querían enseñar a la IA a ser aún mejor en este nuevo juego sin necesidad de que un humano calificara cada uno de los cuadros. Crearon un método de entrenamiento especial llamado GRPO (Optimización de Política Relativa de Grupo).

Imagina un juego donde la IA intenta responder una pregunta, y un "Juez" (otra IA) observa la respuesta y la evidencia. El Juez no necesita que un humano le diga dónde está la evidencia. En su lugar, el Juez simplemente verifica: "¿Es la respuesta correcta? ¿Las palabras citadas realmente respaldan la respuesta?". Si la IA cita las palabras correctas, recibe una recompación. Si inventa cosas, recibe un cero.

Usando este método, entrenaron a un modelo de IA más pequeño (un núcleo de 8 mil millones de parámetros) para que fuera mucho mejor encontrando evidencia.

  • Antes del entrenamiento: El modelo tenía una "Precisión de Atribución Estricta" del 22.4%.
  • Después del entrenamiento: Saltó al 33.8%.

Esto es algo importante porque significa que podemos enseñar a la IA a ser más confiable y verificable sin necesidad de etiquetas humanas costosas que dibujen cuadros en miles de páginas.

La conclusión

Este artículo sugiere un camino práctico hacia una IA más confiable. Muestra que la "interfaz de coordenadas" (dibujar cuadros con números) es un eslabón débil que causa que la IA alucine. Al cambiar a una "interfaz de lenguaje" (citar texto y dejar que un sistema encuentre la ubicación), podemos mejorar drásticamente qué tan bien la IA señala su evidencia.

Los hallazgos sugieren que el problema no es que la IA no pueda "ver" el documento; es que la forma en que le pedimos que señale está rota. Al dejar que la IA hable mediante citas y permitir que un sistema inteligente haga el señalamiento, obtenemos un detective mucho más confiable. El artículo sugiere que esta es una forma viable y rentable de construir una mejor IA para el derecho, la medicina y las finanzas, donde demostrar tu fuente es tan importante como obtener la respuesta correcta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →