← Últimos artigos
💻 computer science

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

O MonkeyOCRv2 é um modelo de fundação visual-texto pré-treinado em um massivo corpus de documentos de 113 milhões de imagens usando uma estratégia dupla de geração de imagem para texto e reconstrução ao nível de pixel, o qual supera significativamente os codificadores existentes em tarefas de análise de documentos e possibilita um processamento e compreensão de documentos altamente eficientes e de estado da arte quando integrado em modelos de linguagem grandes multimodais.

Autores originais: Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

Publicado 2026-07-14
📖 1 min de leitura☕ Leitura rápida

Autores originais: Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: MonkeyOCRv2

Problema

Os modelos de fundação visual predominantes (ex: CLIP, DINO, SAM) são treinados primariamente em imagens naturais, focando em semântica de objetos de alto nível, alinhamento global e contexto de cena. Esses modelos exibem um descompasso de representação quando aplicados a imagens de documentos. Imagens de documentos são caracterizadas por texto denso, traços de caracteres de grão fino, layouts complexos e semânticas que dependem fortemente de detalhes visuais locais (ex: pontuação, sobrescritos, variações de traço). Os modelos existentes frequentemente descartam esses detalhes finos em favor da abstração semântica, tornando-os inadequados para tarefas de processamento, compreensão e tarefas relacionadas de documentos. Além disso, os conjuntos de dados de pré-treinamento orientados a documentos existentes são limitados em escala, diversidade linguística e granularidade de anotação, muitas vezes cobrindo apenas chinês e inglês ou carecendo de supervisão densa.

Metodologia

1. Mecanismo de Dados: MonkeyDoc v2

Para abordar a escassez de dados e o hiato de distribuição, os autores construíram o MonkeyDoc v2, o maior corpus conhecido de pré-treinamento visual-textual orientado a documentos.

  • Escala: 113 milhões de imagens.
  • Diversidade: Cobre 17 idiomas (incluindo Chinês Simplificado/Tradicional, Inglês, Árabe, Alemão, etc.) e diversos tipos de documentos (artigos científicos, faturas, notas manuscritas, textos antigos, fórmulas, tabelas).
  • Composição: 61M de amostras do mundo real e 52M de amostras sintéticas.
  • Pipeline de Anotação: Utiliza um pipeline de concordância de múltiplos especialistas onde múltiplos modelos de OCR complementares transcrevem elementos recortados; a previsão com a maior concordância pareada é retida para suprimir erros específicos do modelo. Amostras de baixa qualidade são filtradas usando verificação de layout e verificações de consistência lógica via modelos de linguagem de grande escala (LLMs).

2. Estratégia de Pré-treinamento: Geração e Reconstrução Conjuntas

O MonkeyOCRv2 emprega uma estratégia de pré-treinamento de objetivo duplo para aprender representações visuais nativas de documentos:

  • Geração de Imagem-para-Texto: Alinha representações visuais com conteúdo textual usando uma perda de entropia cruzada autorregressiva padrão (LtextL_{text}). Isso fornece supervisão densa para compreensão semântica.
  • Reconstrução de Documento ao Nível de Pixel: Incentiva o codificador a preservar detalhes visuais de grão fino (traços de caracteres, formas de glifos, estruturas de layout) que poderiam ser descartados sob uma supervisão puramente textual. Isso é alcançado via uma perda de Erro Quadrático Médio (MSE) (LpixL_{pix}) e, opcionalmente, uma perda consciente de estrutura (LstructL_{struct}) que combina mapas de bordas e distância até a borda.
  • Objetivo Combinado: Lpretrain=Ltext+λLrecL_{pretrain} = L_{text} + \lambda L_{rec}. O objetivo de reconstrução atua como um regularizador, garantindo que o codificador retenha evidências visuais mesmo quando o contexto linguístico é fraco ou inexistente.

3. Arquitetura

A família de modelos inclui três variantes de codificadores de visão treinadas do zero no MonkeyDoc v2:

  • MonkeyOCRv2-S: ViT-Small (28M de parâmetros).
  • MonkeyOCRv2-B: ViT-Base (113M de parâmetros).
  • MonkeyOCRv2-AS: ViTAEv2-Small (21M de parâmetros), otimizado para tarefas que se beneficiam de viés indutivo multiescala (ex: detecção, segmentação).

Principais Contribuições

  1. MonkeyOCRv2: Um modelo de fundação visual-textual treinado especificamente para IA de documentos, abordando o descompasso de representação entre codificadores de imagens naturais e imagens de documentos através de geração de texto conjunta e reconstrução ao nível de pixel.
  2. MonkeyDoc v2: Um corpus massivo de pré-treinamento multilíngue (17 idiomas), multi-tipo (113M de imagens) que excede significativamente a escala e diversidade dos conjuntos de dados de documentos existentes.
  3. Pré-treinamento de Objetivo Duplo: Demonstra que o acoplamento de geração de imagem-para-texto com reconstrução ao nível de pixel melhora a robustez, particularmente quando o contexto linguístico é removido ou degradado.

Resultados Experimentais

Desempenho em Tarefas de Avaliação (Downstream)

Substituir os codificadores originais pelo MonkeyOCRv2 resultou em melhorias consistentes em cinco tarefas representativas de análise de documentos:

  • Reconhecimento de Texto: Melhorou a precisão do CRNN de 58,7% para 67,3% em benchmarks desafiadores. O PARSeq com MonkeyOCRv2 alcançou desempenho de estado da arte (SOTA) nos benchmarks Union14M e chinês.
  • Reconhecimento de Fórmulas: Um modelo de 110M de parâmetros (UniMERNet-T + MonkeyOCRv2) superou o UniMERNet-B de 325M, demonstrando que um codificador mais forte orientado a documentos pode compensar a redução na capacidade do modelo.
  • Detecção de Texto: Ganhos consistentes de F-measure nos benchmarks ICDAR2015, ArT, Total-Text e CTW1500, superando tanto codificadores pré-treinados no ImageNet quanto o oCLIP (um codificador específico para texto).
  • Detecção de Adulteração de Documentos: Alcançou F1-scores SOTA no DocTamper-Test, DocTamper-FCD e DocTamper-SCD, mostrando forte generalização através de mudanças de domínio.
  • Segmentação de Texto Sobreposto: Melhorou o mIoU em 4,3% a 6,3% no dataset MOT.

Processamento e Compreensão de Documentos

  • Processamento de Documentos (MDPBench): O MonkeyOCRv2-B-Parsing (0,7B de parâmetros totais, 0,1B de codificador de visão) alcançou 83,3% no MDPBench, superando o SOTA anterior de código aberto (dots.mocr, 3B de parâmetros) em 2,8% absoluto, apesar de usar um codificador de visão aproximadamente 11× menor. Também superou VLMs de propósito geral maiores como Qwen3-VL-235B e GPT-5.2 no OmniDocBench.
  • Compreensão de Documentos: Em um cenário controlado (codificadores congelados pareados com o mesmo LLM Qwen3-1.7B), o MonkeyOCRv2-B alcançou uma pontuação média de 57,2 em oito benchmarks, superando significativamente o CLIP, DINO, SAM e outros codificadores orientados a documentos.

Análise de Robustez

  • Dependência de Contexto Linguístico: Um estudo controlado usando texto embaralhado mostrou que o MonkeyOCRv2 é mais robusto à degradação de resolução e remoção de contexto linguístico. O objetivo de reconstrução de pixel estreitou a lacuna de precisão entre o texto semanticamente coerente e o embaralhado, indicando uma dependência mais forte de evidências visuais em vez de prioridades linguísticas.
  • Alucinação: No CHAOS-Bench, o MonkeyOCRv2-Parsing alcançou o maior recall médio de página para palavras perturbadas, demonstrando fidelidade superior às evidências visuais em comparação com modelos como HunyuanOCR-1.5 e PaddleOCR-VL-1.6.

Significância e Alegações

O artigo postula que o pré-treinamento visual orientado a documentos pode servir como uma fundação para a inteligência de documentos por si só, em vez de depender de codificadores construídos para cenas naturais.

  • Mudança Fundamental: O trabalho desafia o paradigma de adaptar modelos de visão de propósito geral para documentos, argumentando que as estatísticas visuais únicas dos documentos (texto denso, traços finos) exigem objetivos de pré-treinamento dedicados.
  • Eficiência: Demonstra que um codificador compacto e nativo de documentos (0,1B) pode superar massivos VLMs de propósito geral (centenas de bilhões de parâmetros) em tarefas específicas de documentos quando a representação visual é otimizada para o domínio.
  • Preservação de Evidência Visual: O estudo valida que os objetivos de reconstrução ao nível de pixel são críticos para preservar detalhes finos, melhorando a robustez em cenários onde o contexto linguístico é ambíguo ou ausente.

Os autores concluem que o MonkeyOCRv2 e o MonkeyDoc v2 fornecem fundações reutilizáveis para OCR multilíngue, compreensão de documentos e sistemas mais amplos de inteligência de documentos, estabelecendo o texto como uma "modalidade visual de primeira classe".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →