Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
O artigo apresenta o Qianfan-OCR, um modelo unificado de visão e linguagem com 4 bilhões de parâmetros que converte imagens diretamente em Markdown e realiza diversas tarefas de inteligência documental, introduzindo a abordagem "Layout-as-Thought" para recuperar a análise de layout e alcançando desempenho superior em benchmarks públicos.
`). Ele desenha mentalmente caixas ao redor de cada parte do documento, rotula o que é (ex: "isso é um gráfico", "isso é um rodapé") e decide a ordem de leitura. Só depois desse "rascunho mental" é que ele gera a resposta final.
A analogia: Imagine que você precisa organizar uma sala cheia de móveis bagunçados.
Sem pensar: Você tenta arrumar a sala correndo de um lado para o outro e acaba derrubando coisas.
Com pensar: Você primeiro olha para a sala, diz mentalmente: "O sofá vai ali, a mesa aqui, o tapete no meio", e só então começa a mover os móveis. O resultado é muito mais organizado.
Esse modo de "pensar" é opcional. Se o documento for simples, o modelo não gasta energia pensando. Se for complexo, ele usa esse raciocínio extra para não errar.
3. Por que isso é revolucionário?
O papel mostra que o Qianfan-OCR é o melhor do mundo entre os modelos que fazem tudo de uma vez (end-to-end).
Precisão: Ele supera outros modelos gigantes (como o Gemini ou o Qwen) em tarefas de documentos, especialmente em tabelas e gráficos.
Velocidade: Como ele não precisa esperar um sistema de detecção de layout terminar antes de começar a ler, ele é muito eficiente em servidores modernos.
Entendimento: Ele não apenas "lê" o texto; ele entende o contexto. Se você perguntar "Qual é o valor total na tabela?", ele sabe olhar para a estrutura da tabela, somar os números e responder, algo que modelos antigos não conseguiam fazer bem.
Resumo da Ópera
O Qianfan-OCR é como um assistente pessoal superinteligente que pega qualquer documento bagunçado, entende a estrutura visual dele (como se fosse um humano olhando para a página), organiza tudo mentalmente e entrega o resultado pronto, sem precisar de várias ferramentas diferentes trabalhando juntas.
Eles provaram que, para documentos complexos, é melhor ter um único especialista que vê o "quadro geral" do que uma equipe de especialistas que só vê pedaços do problema. E o melhor: você pode pedir para ele "pensar" antes de responder se o documento for muito difícil!
`.
Funcionamento: Antes de gerar a saída final (ex: Markdown), o modelo gera uma representação estruturada do layout dentro de tags <layout>...</layout>. Isso inclui coordenadas de bounding boxes, tipos de elementos e ordem de leitura.
Benefícios:
Funcional: Permite que o usuário obtenha resultados de localização espacial e classificação de elementos diretamente do modelo E2E.
Melhoria de Precisão: O raciocínio estrutural explícito ajuda a resolver ambiguidades em documentos com layouts complexos, elementos desordenados ou múltiplas colunas.
Tokenização Especial: As coordenadas são representadas por tokens especiais <COORD_0> a <COORD_999>, reduzindo o comprimento da saída de raciocínio em ~50% em comparação com sequências numéricas.
3. Contribuições Principais
Modelo Unificado E2E: Um único modelo de 4B parâmetros que realiza parsing de documentos, análise de layout, reconhecimento de texto e compreensão semântica, eliminando a propagação de erros de pipelines multi-estágio.
Mecanismo Layout-as-Thought: Uma abordagem inovadora que recupera a capacidade de análise de layout explícita dentro de uma arquitetura E2E, servindo tanto como ferramenta de extração quanto como mecanismo de raciocínio para melhorar a precisão.
Desempenho Superior em Benchmarks: O modelo alcançou o primeiro lugar entre todos os modelos end-to-end em benchmarks específicos de documentos, superando sistemas de pipeline em várias métricas.
Validação Arquitetural: Evidência empírica de que pipelines de "OCR + LLM" (dois estágios) degradam severamente em tarefas que exigem raciocínio espacial e visual (como interpretação de gráficos), onde o contexto visual é essencial.
4. Resultados Experimentais
O Qianfan-OCR foi avaliado em diversos benchmarks, superando tanto modelos especializados quanto VLMs gerais:
Benchmarks Específicos de OCR:
OmniDocBench v1.5: Pontuação de 93.12, ficando em 1º lugar entre todos os modelos end-to-end e superando sistemas de pipeline como MinerU2.5 e MonkeyOCR.
OlmOCR Bench: Pontuação de 79.8, também o melhor entre modelos end-to-end.
Benchmarks Gerais de OCR:
OCRBench: Pontuação de 880 (1º lugar entre todos os modelos testados).
CCOCR: Liderança em reconhecimento multilíngue e geral.
Compreensão de Documentos e Raciocínio:
Desempenho superior em tarefas de QA em gráficos (ChartQA, ChartBench) e documentos acadêmicos (CharXiv).
Falha Crítica de Pipelines: Em tarefas como CharXiv, os sistemas de dois estágios (OCR + LLM) obtiveram 0.0 de precisão, pois a extração de texto puro descarta a estrutura do gráfico necessária para responder às perguntas. O Qianfan-OCR manteve alta precisão ao preservar o contexto visual.
Extração de Informações Chave (KIE):
Alcançou a maior pontuação média (87.9) em cinco benchmarks públicos de KIE, superando modelos comerciais massivos (como Gemini-3.1-Pro) e modelos open-source maiores (Qwen3-235B).
Eficiência de Inferência:
Com quantização W8A8, atingiu 1.024 páginas por segundo (PPS) em uma GPU A100, comparável a pipelines complexos (PaddleOCR-VL: 1.224 PPS), mas com arquitetura muito mais simples e sem gargalos de CPU.
5. Significado e Conclusão
O Qianfan-OCR demonstra que arquiteturas end-to-end podem não apenas competir, mas superar sistemas de pipeline tradicionais em precisão de reconhecimento e compreensão de documentos, desde que o contexto visual seja preservado.
A introdução do Layout-as-Thought resolve a lacuna histórica dos modelos E2E de não fornecerem análise de layout explícita, permitindo que o modelo "pense" na estrutura antes de gerar a resposta. Isso é particularmente eficaz para documentos complexos, enquanto o modo padrão (sem pensamento) mantém baixa latência para documentos simples.
O trabalho valida que, para tarefas de inteligência de documentos que exigem entendimento visual e textual conjunto, a preservação do contexto visual ao longo de todo o pipeline é superior à representação intermediária baseada apenas em texto. O modelo está disponível publicamente através da plataforma Baidu AI Cloud Qianfan.