HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering
O HierDoc introduz um framework hierárquico de roteamento de evidências em dois estágios que otimiza sequencialmente a seleção de páginas e a extração de regiões usando GRPO por estágios com recompensas de conjuntos estruturados, alcançando o estado da arte em questionamento visual de documentos longos ao preencher efetivamente a lacuna entre a aquisição de páginas grosseiras e a localização de regiões de granularidade fina.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando resolver um mistério, mas em vez de uma única pista, recebe uma pilha de cem livros grossos e ilustrados. A resposta para a sua pergunta está escondida em algum lugar ali — talvez um pequeno diagrama na página 42, ou uma frase específica em uma tabela na página 89. Este é o mundo do Document Visual Question Answering (Perguntas e Respostas Visuais sobre Documentos). É um ramo da inteligência artificial onde computadores tentam ler e compreender documentos que são repletos de imagens, gráficos e textos todos misturados. Por muito tempo, esses "leitores" de computador eram como estudantes que só conseguiam olhar uma página de cada vez, ou tentavam ler a pilha inteira de livros de uma só vez, ficando sobrecarregados e perdendo os pequenos detalhes. O grande desafio é descobrir como encontrar a página exata e, depois, dar um zoom no lugar exato sem se perder no ruído.
Agora, conheça o HierDoc, um novo método que atua como um detetive superinteligente de dois passos para essas pilhas de documentos massivos. Antes, a maioria dos sistemas de computador era como uma pessoa que ou simplesmente pegava um livro inteiro esperando que a resposta estivesse dentro dele, ou alguém que recebia uma página específica e tinha que encontrar uma agulha em um palheiro. Eles raramente faziam ambos os passos bem juntos. O HierDoc muda o jogo ao dividir o trabalho em duas tarefas distintas e especializadas. Primeiro, uma "Page Policy" (Política de Página) atua como um batedor, escaneando rapidamente todo o documento para selecionar apenas as páginas que provavelmente contêm a resposta. É como um bibliotecário que sabe exatamente quais três livros retirar da prateleira, ignorando os outros noventa e sete.
Uma vez que as páginas corretas são selecionadas, uma segunda "Region Policy" (Política de Região) assume o controle. Esta parte é como um detetive com uma lupa que examina essas páginas específicas e encontra o parágrafo, gráfico ou célula de tabela exatos que contêm a pista. Ela ignora o resto da página, focando apenas na "região" relevante. O artigo mostra que, ao tratar esses como dois passos separados e otimizados, o sistema torna-se muito melhor em encontrar respostas. Em testes de quebra-cabeças de documentos longos e difíceis, essa abordagem de dois passos melhorou a precisão por uma margem significativa — especificamente, aumentou o desempenho em 16,87% em um dos principais testes em comparação com os melhores sistemas abertos anteriores. Ainda mais interessante, os pesquisadores descobriram que adicionar essa busca de região de grão fino sobre apenas a seleção de páginas tornou o sistema 5,51% mais preciso e 4,82% melhor em encontrar as pistas certas (medido pelo F1 score).
O ingrediente secreto não é apenas que ele olha para mais coisas; é como ele aprende a ignorar as coisas erradas. O sistema utiliza um método de treinamento chamado GRPO (Group Relative Policy Optimization), que é como um treinador dando feedback a uma equipe. Em vez de apenas dizer "bom trabalho" ou "mau trabalho", o treinador compara diferentes tentativas lado a lado. Se o sistema escolher páginas demais, recebe uma penalidade. Se perder a pista certa, recebe uma penalidade. Ele aprende a equilibrar ser minucioso com ser preciso. O artigo argumenta explicitamente contra a ideia de que você precisa fornecer o documento inteiro ao computador ou que pode apenas confiar em um grande modelo para fazer tudo de uma vez. Em vez disso, eles provam que decompor o problema em "encontrar a página" e depois "encontrar o lugar" funciona muito melhor.
No entanto, os autores fazem questão de apontar que isso não é uma solução mágica que resolve tudo perfeitamente. Como o sistema trabalha em etapas, se a primeira etapa (a Page Policy) perder a página correta por completo, a segunda etapa não poderá corrigi-la; a evidência é perdida para sempre. Além disso, o sistema depende de um parser (uma ferramenta chamada MinerU) para dividir as páginas em regiões, portanto, se esse parser cometer um erro ou se o texto estiver bagunçado, as escolhas do sistema ficam limitadas. Mas, por enquanto, o HierDoc mostra que organizar o processo de busca de um computador em um caminho hierárquico claro — da visão geral até o detalhe minúsculo — é uma forma poderosa de ajudar as máquinas a ler documentos longos e complexos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.