← Nieuwste papers
💻 computer science

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

MonkeyOCRv2 is een visueel-tekstueel fundamenteel model dat vooraf is getraind op een enorme corpus van 113 miljoen documentafbeeldingen met behulp van een dubbele strategie van beeld-naar-tekstgeneratie en pixelniveau-reconstructie, wat bestaande encoders in documentanalyse-taken aanzienlijk overtreft en zeer efficiënte, geavanceerde documentparsing en -begrip mogelijk maakt wanneer het wordt geïntegreerd in multimodale grote taalmodellen.

Oorspronkelijke auteurs: Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

Gepubliceerd 2026-07-14
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: MonkeyOCRv2

Probleemstelling

Mainstream visuele fundamentmodellen (bijv. CLIP, DINO, SAM) zijn primair voorgetraind op natuurlijke afbeeldingen en richten zich op hoogwaardige objectsemantiek, globale uitlijning en scènecontext. Deze modellen vertonen een representatie-mismatch wanneer ze worden toegepast op documentafbeeldingen. Documentafbeeldingen worden gekenmerkt door dichte tekst, fijnmazige karakterstreken, complexe lay-outs en semantiek die sterk leunt op lokale visuele details (bijv. interpunctie, superscript, variaties in streken). Bestaande modellen geven deze fijnmazige details vaak op ten gunste van semantische abstractie, waardoor ze ongeschikt zijn voor documentparsing, begrip en gerelateerde taken. Bovendien zijn bestaande documentgeoriënteerde pretraining-datasets beperkt in schaal, taaldiversiteit en annotatiegranulariteit, waarbij ze vaak slechts Chinees en Engels dekken of een gebrek hebben aan dichte supervisie.

Methodologie

1. Data Engine: MonkeyDoc v2

Om de schaarste aan data en de distributiekloof aan te pakken, hebben de auteurs MonkeyDoc v2 geconstrueerd, de grootste bekende documentgeoriënteerde visueel-tekstuele pretraining-corpus.

  • Schaal: 113 miljoen afbeeldingen.
  • Diversiteit: Beslaat 17 talen (inclusief Vereenvoudigd/Traditioneel Chinees, Engels, Arabisch, Duits, etc.) en diverse documenttypen (wetenschappelijke artikelen, facturen, handgeschreven aantekeningen, oude teksten, formules, tabellen).
  • Samenstelling: 61M real-world monsters en 52M synthetische monsters.
  • Annotatie-pipeline: Maakt gebruik van een multi-expert overeenstemming-pipeline waarbij meerdere complementaire OCR-modellen uitgesneden elementen transcriberen; de voorspelling met de hoogste paargewijze overeenstemming wordt behouden om model-specifieke fouten te onderdrukken. Samples van lage kwaliteit worden gefilterd met behulp van layout-verificatie en logische consistentiecontroles via large language models.

2. Pretraining Strategie: Gezamenlijke Generatie en Reconstructie

MonkeyOCRv2 hanteert een dubbele doelstelling-pretrainingstrategie om document-native visuele representaties te leren:

  • Image-to-Text Generatie: Stemt visuele representaties af met tekstuele inhoud met behulp van standaard autoregressieve cross-entropy verlies (LtextL_{text}). Dit biedt dichte supervisie voor semantisch begrip.
  • Pixel-niveau Document Reconstructie: Moedigt de encoder aan om fijnmazige visuele details te behouden (karakterstreken, glyphvormen, lay-outstructuren) die onder louter tekstuele supervisie mogelijk verloren zouden gaan. Dit wordt bereikt via een Mean Squared Error (MSE) verlies (LpixL_{pix}) en, optioneel, een structuurbewust verlies (LstructL_{struct}) dat randen en afstand-tot-rand kaarten afstemt.
  • Gecombineerde Doelstelling: Lpretrain=Ltext+λLrecL_{pretrain} = L_{text} + \lambda L_{rec}. De reconstructiedoelstelling fungeert als een regularisator, die ervoor zorgt dat de encoder visueel bewijs behoudt, zelfs wanneer de linguïstische context zwak of afwezig is.

3. Architectuur

De modelfamilie omvat drie visuele encoder-varianten die vanaf nul zijn getraind op MonkeyDoc v2:

  • MonkeyOCRv2-S: ViT-Small (28M parameters).
  • MonkeyOCRv2-B: ViT-Base (113M parameters).
  • MonkeyOCRv2-AS: ViTAEv2-Small (21M parameters), geoptimaliseerd voor taken die profiteren van multi-schaal inductieve bias (bijv. detectie, segmentatie).

Belangrijkste Bijdragen

  1. MonkeyOCRv2: Een visueel-tekstueel fundamentmodel specifiek voorgetraind voor Document AI, dat de representatie-mismatch tussen natuurlijke beeld-encoders en documentafbeeldingen aanpakt door middel van gezamenlijke tekstgeneratie en pixel-niveau reconstructie.
  2. MonkeyDoc v2: Een massieve, meertalige (17 talen), multi-type (113M afbeeldingen) pretraining-corpus die de schaal en diversiteit van bestaande documentdatasets aanzienlijk overtreft.
  3. Dual-Objective Pretraining: Demonstreert dat het koppelen van image-to-text generatie aan pixel-niveau reconstructie de robuustheid verbetert, met name wanneer de linguïstische context wordt verwijderd of gedegradeerd.

Experimentele Resultaten

Prestaties bij Downstream Taken

Het vervangen van de originele encoders door MonkeyOCRv2 leverde consistente verbeteringen op over vijf representatieve documentanalyse-taken:

  • Tekstherkenning: Verbeterde CRNN-nauwkeurigheid van 58,7% naar 67,3% op uitdagende benchmarks. PARSeq met MonkeyOCRv2 behaalde state-of-the-art (SOTA) prestaties op Union14M en Chinese benchmarks.
  • Formuleherkenning: Een 110M parameter model (UniMERNet-T + MonkeyOCRv2) presteerde beter dan de 325M UniMERNet-B, wat aantoont dat een sterkere documentgeoriënteerde encoder een verminderde modelcapaciteit kan compenseren.
  • Tekstdetectie: Consistente F-measure winsten over ICDAR2015, ArT, Total-Text en CTW1500, waarbij het zowel ImageNet-voorgetrainde encoders als oCLIP (een tekst-specifieke encoder) verslaat.
  • Document Manipulatie Detectie: Behaalde SOTA F1-scores op DocTamper-Test, DocTamper-FCD en DocTamper-SCD, wat een sterke generalisatie toont over domeinverschuivingen.
  • Overlappende Tekst Segmentatie: Verbeterde mIoU met 4,3% tot 6,3% op de MOT-dataset.

Document Parsing en Begrip

  • Document Parsing (MDPBench): MonkeyOCRv2-B-Parsing (0,7B totale parameters, 0,1B visuele encoder) behaalde 83,3% op MDPBench, waarmee het de vorige open-source SOTA (dots.mocr, 3B parameters) met 2,8% absoluut versloeg, ondanks het gebruik van een visuele encoder die ongeveer 11× kleiner is. Het overtrof ook grotere algemene purpose VLMs zoals Qwen3-VL-235B en GPT-5.2 op OmniDocBench.
  • Document Begrip: In een gecontroleerde setting (bevroren encoders gekoppeld aan dezelfde Qwen3-1.7B LLM), behaalde MonkeyOCRv2-B een gemiddelde score van 57,2 over acht benchmarks, waarmee het CLIP, DINO, SAM en andere documentgeoriënteerde encoders significant versloeg.

Robuustheidsanalyse

  • Afhankelijkheid van Linguïstische Context: Een gecontroleerde studie met gescrambelde tekst toonde aan dat MonkeyOCRv2 robuuster is tegen resolutiedegradatie en het verwijderen van linguïstische context. De pixel-reconstructiedoelstelling verkleinde het nauwkeurigheidsverschil tussen semantisch coherente en gescrambelde tekst, wat wijst op een sterkere afhankelijkheid van visueel bewijs in plaats van taal-priors.
  • Hallucinatie: Op CHAOS-Bench behaalde MonkeyOCRv2-Parsing de hoogste pagina-gemiddelde recall voor geperturbeerde woorden, wat een superieure trouw aan visueel bewijs demonstreert vergeleken met modellen zoals HunyuanOCR-1.5 en PaddleOCR-VL-1.6.

Betekenis en Claims

Het artikel stelt dat documentgeoriënteerde visuele pretraining kan dienen als een fundament voor documentintelligentie op zichzelf, in plaats van te vertrouieren op encoders die gebouwd zijn voor natuurlijke scènes.

  • Fundamentele Verschuiving: Dit werk daagt het paradigma uit om algemene visuele modellen aan te passen aan documenten, door te stellen dat de unieke visuele statistieken van documenten (dichte tekst, fijnmazige streken) specifieke pretraining-doelstellingen vereisen.
  • Efficiëntie: Het demonstreert dat een compacte, document-native encoder (0,1B) superieur kan zijn aan massieve algemene purpose VLMs (honderden miljarden parameters) op document-specifieke taken wanneer de visuele representatie geoptimaliseerd is voor het domein.
  • Behoud van Visueel Bewijs: De studie valideert dat pixel-niveau reconstructiedoelstellingen cruciaal zijn voor het behoud van fijnmazige details, wat de robuustheid verbetert in scenario's waar de linguïstische context ambigu of afwezig is.

De auteurs concluderen dat MonkeyOCRv2 en MonkeyDoc v2 herbruikbare fundamenten bieden voor meertalige OCR, documentbegrip en bredere document-intelligentiesystemen, waarbij tekst wordt gevestigd als een "first-class visuele modaliteit".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →