← Últimos artículos
💻 computer science

HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering

HierDoc introduce un marco de enrutamiento de evidencia jerárquico y de dos etapas que optimiza secuencialmente la selección de páginas y la extracción de regiones mediante GRPO por etapas con recompensas de conjuntos estructurados, logrando un rendimiento de vanguardia en la respuesta a preguntas visuales sobre documentos largos al cerrar eficazmente la brecha entre la adquisición de páginas de grano grueso y la localización de regiones de grano fino.

Autores originales: Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li

Publicado 2026-08-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un misterio, pero en lugar de una sola pista, te entregan una pila de cien libros gruesos e ilustrados. La respuesta a tu pregunta está escondida en algún lugar de ahí, tal vez en un pequeño diagrama en la página 42, o en una oración específica en una tabla en la página 89. Este es el mundo del Document Visual Question Answering (Preguntas y Respuestas Visuales sobre Documentos). Es una rama de la inteligencia artificial donde las computadoras intentan leer y comprender documentos que están llenos de imágenes, gráficos y texto, todo mezclado. Durante mucho tiempo, estos "lectores" informáticos eran como estudiantes que solo podían mirar una página a la vez, o intentaban leer toda la pila de libros a la vez, abrumándose y perdiendo los detalles diminutos. El gran desafío es descubrir cómo encontrar la página exacta y luego hacer un acercamiento al lugar exacto sin perderse en el ruido.

Ahora, conoce a HierDoc, un nuevo método que actúa como un detective superinteligente de dos pasos para estas pilas de documentos masivos. Antes, la mayoría de los sistemas informáticos eran como una persona que simplemente agarraba un libro entero esperando que la respuesta estuviera dentro, o alguien a quien le entregaban una página específica y le pedían encontrar una aguja en un pajar. Rara vez hacían ambos pasos bien juntos. HierDoc cambia las reglas del juego al dividir el trabajo en dos tareas distintas y especializadas. Primero, una "Política de Página" actúa como un explorador, escaneando rápidamente todo el documento para seleccionar solo las páginas que probablemente contengan la respuesta. Es como un bibliotecario que sabe exactamente qué tres libros sacar del estante, ignorando los otros noventa y siete.

Una vez que se seleccionan las páginas correctas, una segunda "Política de Región" toma el control. Esta parte es como un detective con una lupa que mira esas páginas específicas y encuentra el párrafo, gráfico o celda de tabla exacto que contiene la pista. Ignora el resto de la página, concentrándose solo en la "región" relevante. El artículo muestra que, al tratar estos como dos pasos separados y optimizados, el sistema es mucho mejor encontrando respuestas. En pruebas de acertijos de documentos largos y difíciles, este enfoque de dos pasos mejoró la precisión por un margen significativo; específicamente, aumentó el rendimiento en un 16.87% en una prueba importante en comparación con los mejores sistemas abiertos anteriores. Incluso más interesante, los investigadores descubrieron que añadir esta búsqueda de región de grano fino por encima de solo elegir páginas hizo que el sistema fuera un 5.51% más preciso y un 4.82% mejor en encontrar las pistas correctas (medido por la puntuación F1).

La salsa secreta no es solo que mira más cosas; es cómo aprende a ignorar las cosas incorrectas. El sistema utiliza un método de entrenamiento llamado GRPO (Optimización de Política Relativa de Grupo), que es como un entrenador dando retroalimentación a un equipo. En lugar de solo decir "buen trabajo" o "mal trabajo", el entrenador compara diferentes intentos uno al lado del otro. Si el sistema elige demasiadas páginas, recibe una penalización. Si pierde la pista correcta, recibe una penalización. Aprende a equilibrar la minuciosidad con la precisión. El artículo argumenta explícitamente en contra de la idea de que necesitas alimentar a la computadora con todo el documento o que puedes simplemente confiar en un gran modelo para hacerlo todo a la vez. En su lugar, demuestran que desglosar el problema en "encontrar la página" y luego "encontrar el lugar" funciona mucho mejor.

Sin embargo, los autores tienen cuidado de señalar que esto no es una solución mágica que lo resuelve todo perfectamente. Debido a que el sistema trabaja en pasos, si el primer paso (la Política de Página) pasa por alto la página correcta por completo, el segundo paso no puede arreglarlo; la evidencia se pierde para siempre. Además, el sistema depende de un analizador (una herramienta llamada MinerU) para dividir las páginas en regiones, por lo que si ese analizador comete un error o el texto es desordenado, las opciones del sistema son limitadas. Pero por ahora, HierDoc muestra que organizar el proceso de búsqueda de una computadora en un camino jerárquico claro —desde la imagen general hasta el detalle minúsculo— es una forma poderosa de ayudar a las máquinas a leer documentos largos y complejos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →