← Últimos artigos
💻 computer science

PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing

O artigo apresenta o PaddleOCR-VL-1.5, um modelo de linguagem visual ultra-compacto de 0,9B parâmetros que alcança o estado da arte em reconhecimento de documentos complexos, introduzindo novos benchmarks para avaliar robustez contra distorções físicas e expandindo suas capacidades para tarefas como reconhecimento de selos e localização de texto.

Autores originais: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

Publicado 2026-04-07
📖 4 min de leitura☕ Leitura rápida

Autores originais: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma pilha gigante de documentos: alguns são digitais e perfeitos, outros são fotos tiradas com o celular em um dia de sol forte, alguns estão dobrados, outros têm manchas de café ou foram escaneados de forma torto. Ler e entender tudo isso para um computador é como tentar montar um quebra-cabeça enquanto ele está caindo, girando e com a luz piscando.

O PaddleOCR-VL-1.5 é como um super-herói da leitura que acaba de receber um upgrade de poder. Ele foi criado pela equipe do PaddlePaddle (da Baidu) e é projetado especificamente para ser um "mestre" em entender documentos do mundo real, não apenas os perfeitos de laboratório.

Aqui está a explicação do que ele faz, usando analogias simples:

1. O Problema: O Mundo Real é Bagunçado

Antes, os computadores eram ótimos lendo documentos digitais (como um PDF limpo), mas travavam quando viam uma foto de um contrato tirada no carro, com o papel amassado ou inclinado. Era como se o computador só soubesse ler livros de biblioteca, mas não conseguisse entender uma nota de mercado rasgada.

2. A Solução: O "Detetive" de 0,9 Bilhão de Parâmetros

Este novo modelo é chamado de PaddleOCR-VL-1.5.

  • O Tamanho: Ele é incrivelmente pequeno (0,9 bilhão de parâmetros). Pense nele como um especialista em um único assunto (documentos) que é tão inteligente que supera gigantes de 200 ou 300 bilhões de parâmetros que tentam fazer tudo (como conversar, ver imagens e escrever poemas). É como ter um detetive particular muito ágil em vez de um exército inteiro de investigadores lentos.
  • O Nome: "VL" significa que ele é um "Visão-Linguagem", ou seja, ele vê a imagem e entende o texto ao mesmo tempo.

3. As Três Grandes Melhorias (O "Kit de Ferramentas")

A. O Olho de Águia (Layout Analysis)

Imagine que você precisa organizar uma sala cheia de móveis, mas a sala está torta e os móveis estão virados.

  • O Antigo: Tentava desenhar caixas retangulares ao redor dos móveis. Se o móvel estivesse torto, a caixa cobria muita coisa que não era o móvel.
  • O Novo (PP-DocLayoutV3): Ele usa um "laser" de precisão. Em vez de caixas retas, ele desenha formas exatas (como quadriláteros) que se ajustam perfeitamente ao papel dobrado ou inclinado. Ele também sabe a ordem correta de leitura (o que vem primeiro, o que vem depois) mesmo que o texto esteja em colunas tortas. É como se ele pudesse "endireitar" o papel na sua mente antes de ler.

B. O Mago das Coisas Especiais (Novas Habilidades)

Além de ler texto comum, ele ganhou dois superpoderes novos:

  1. Reconhecimento de Carimbos (Seal Recognition): Carimbos oficiais são difíceis porque têm texto curvo, cores vermelhas sobre o texto e fundos bagunçados. O modelo aprendeu a "ver" através da tinta vermelha e ler o texto escondido, como se tivesse um raio-X.
  2. Caça-Texto (Text Spotting): Em vez de apenas ler um documento, ele pode encontrar texto em qualquer lugar: em um pôster de rua, em uma placa de trânsito ou em um cartão de visita. Ele não só lê, mas aponta exatamente onde o texto está no mundo real.

C. O Treinamento Extremo (Real5-OmniDocBench)

Para treinar esse modelo, os criadores não usaram apenas documentos perfeitos. Eles criaram um "campo de treinamento" chamado Real5-OmniDocBench.
Imagine que eles pegaram documentos e:

  • Derrubaram água neles (iluminação ruim).
  • Tiraram fotos de telas de computador (padrões de moiré).
  • Dobra-ram e amassaram (distorção).
  • Inclinaram tudo (skew).
    O modelo foi treinado para ler mesmo nessas condições de "guerra". O resultado? Ele acertou 94,5% das tarefas, superando todos os outros modelos, mesmo os gigantes.

4. Por que isso importa? (A Analogia Final)

Imagine que você quer construir uma biblioteca digital gigante para uma Inteligência Artificial (IA) ler.

  • Sem este modelo: A IA só consegue ler os livros que estão na prateleira, perfeitamente alinhados. Se você jogar um livro no chão, ela não consegue ler.
  • Com este modelo: A IA pode pegar qualquer livro, mesmo que esteja molhado, rasgado, escrito à mão ou em um papel amassado no bolso, e transformá-lo em texto digital perfeito.

Isso é crucial para sistemas de RAG (que usam IA para responder perguntas baseadas em documentos). Com o PaddleOCR-VL-1.5, a IA não vai mais "alucinar" ou errar porque o documento estava torto; ela vai entender a realidade com precisão cirúrgica.

Resumo em uma frase:
O PaddleOCR-VL-1.5 é um especialista pequeno, rápido e superpoderoso que consegue ler qualquer documento do mundo real, não importa o quanto ele esteja torto, sujo ou bagunçado, superando gigantes muito maiores e mais lentos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →