← Derniers articles
💻 computer science

HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering

HierDoc introduit un cadre de routage d'évidence hiérarchique à deux étapes qui optimise séquentiellement la sélection de pages et l'extraction de régions en utilisant le GRPO par étapes avec des récompenses d'ensembles structurés, atteignant des performances de pointe dans le domaine du questionnement visuel sur documents longs en comblant efficacement l'écart entre l'acquisition grossière de pages et la localisation de régions à grain fin.

Auteurs originaux : Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li

Publié 2026-08-03
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de résoudre un mystère, mais qu'au lieu d'un indice unique, on vous remet une pile de cent livres épais et illustrés. La réponse à votre question est cachée quelque part là-dedans — peut-être un petit diagramme à la page 42, ou une phrase spécifique dans un tableau à la page 89. C'est le monde du Document Visual Question Answering (Réponse par Question sur Documents Visuels). Il s'agit d'une branche de l'intelligence artificielle où les ordinateurs tentent de lire et de comprendre des documents qui sont remplis d'images, de graphiques et de textes mélangés. Pendant longtemps, ces « lecteurs » informatiques étaient comme des étudiants qui ne pouvaient regarder qu'une seule page à la fois, ou bien ils essayaient de lire toute la pile de livres d'un coup, se laissant submerger et manquant les détails infimes. Le grand défi consiste à déterminer comment trouver la bonne page exacte, puis à zoomer sur l'endroit exact, sans se perdre dans le bruit.

Maintenant, faites la connaissance de HierDoc, une nouvelle méthode qui agit comme un détective super intelligent en deux étapes pour ces piles de documents massives. Auparavant, la plupart des systèmes informatiques étaient soit comme une personne qui saisissait un livre entier en espérant que la réponse s'y trouve, soit comme quelqu'un à qui l'on tend une page spécifique en lui demandant de trouver une aiguille dans une botte de foin. Ils ne réussissaient rarement ces deux étapes correctement ensemble. HierDoc change la donne en divisant le travail en deux tâches distinctes et spécialisées. D'abord, une « Page Policy » (Politique de Page) agit comme un éclaireur, parcourant rapidement tout le document pour sélectionner uniquement les pages susceptibles de contenir la réponse. C'est comme un bibliothécaire qui sait exactement quels trois livres retirer de l'étagère, ignorant les quatre-vingt-dix-sept autres.

Une fois les bonnes pages sélectionnées, une seconde « Region Policy » (Politique de Région) prend le relais. Cette partie est comme un détective muni d'une loupe qui examine ces pages spécifiques pour trouver le paragraphe, le graphique ou la cellule de tableau exact qui contient l'indice. Elle ignore le reste de la page, se concentrant uniquement sur la « région » pertinente. L'article montre qu'en traitant ces étapes comme deux processus séparés et optimisés, le système devient bien meilleur pour trouver des réponses. Lors de tests sur des énigmes de documents longs et difficiles, cette approche en deux étapes a amélioré la précision de manière significative — plus précisément, elle a augmenté les performances de 16,87 % sur un test majeur par rapport aux meilleurs systèmes ouverts précédents. Plus intéressant encore, les chercheurs ont découvert qu'en ajoutant cette recherche de région plus fine au simple choix de pages, le système devenait 5,51 % plus précis et 4,82 % meilleur pour trouver les bons indices (mesuré par le score F1).

La recette secrète n'est pas seulement qu'il regarde plus de choses ; c'est la façon dont il apprend à ignorer les mauvaises choses. Le système utilise une méthode d'entraînement appelée GRPO (Group Relative Policy Optimization), qui est comme un entraîneur donnant des commentaires à une équipe. Au lieu de simplement dire « bon travail » ou « mauvais travail », l'entraîneur compare différentes tentatives côte à côte. Si le système choisit trop de pages, il reçoit une pénalité. S'il manque le bon indice, il reçoit une pénalité. Il apprend à équilibrer l'exhaustivité et la précision. L'article soutient explicitement l'idée qu'il ne faut pas nourrir l'ordinateur avec l'intégralité du document ou compter sur un seul gros modèle pour tout faire à la fois. Au contraire, ils prouvent que décomposer le problème en « trouver la page » puis « trouver l'endroit » fonctionne beaucoup mieux.

Cependant, les auteurs prennent soin de préciser que ce n'est pas une solution miracle qui résout tout parfaitement. Parce que le système fonctionne par étapes, si la première étape (la Page Policy) manque entièrement la bonne page, la seconde étape ne peut pas la réparer ; la preuve est perdue à jamais. De plus, le système repose sur un parseur (un outil appelé MinerU) pour diviser les pages en régions, donc si ce parseur commet une erreur ou si le texte est mal structuré, les choix du système sont limités. Mais pour l'instant, HierDoc montre qu'organiser le processus de recherche d'un ordinateur en un chemin hiérarchique clair — de la vue d'ensemble jusqu'au détail infime — est un moyen puissant d'aider les machines à lire des documents longs et complexes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →