← Nieuwste papers
🤖 AI

OvisOCR2 Technical Report

OvisOCR2 is een 0,8B end-to-end document parseringsmodel dat een nieuwe data-engine en een meerfasig trainingsrecept met behulp van reinforcement learning en distillatie benut om state-of-the-art prestaties op benchmark-datasets te behalen door direct Markdown-representaties van documentpagina's te genereren.

Oorspronkelijke auteurs: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo

Gepubliceerd 2026-07-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een fysiek boek, een handgeschreven brief of een complexe bon vasthoudt. Voor een mens is dit gemakkelijk te lezen: je weet in welke kolom je moet beginnen, hoe je over een afbeelding heen springt om terug te keren naar de tekst, en hoe je kunt zien dat een kronkelige lijn een wiskundige vergelijking is en niet zomaar een krabbel. Maar voor een computer is diezelfde pagina slechts een plat raster van gekleurde pixels. De computer ziet een chaos van vormen zonder te begrijpen dat een tabel een rooster is, een formule een berekening is, of dat de tekst onderaan de pagina bij de bovenkant van de volgende kolom hoort. Dit is de wereld van "document parsing" (documentverwerking). Het is de tovertruc van het veranderen van een afbeelding van een pagina in een digitaal bestand dat een computer daadwerkelijk kan lezen, doorzoeken en gebruiken. Lange tijd probeerden computers dit te doen door de taak op te splitsen in kleine, afzonderlijke stappen — eerst de lijnen vinden, dan de woorden lezen, en dan raden waar de tabellen zich bevinden. Maar deze "lopende band"-aanpak is log en onhandig; als de eerste stap een tabelgrens mist, stikt de rest van de machine erin. De grote vraag in dit vakgebied is geweest: Kunnen we één enkel, slim brein bouwen dat naar het hele plaatje kijkt en het verhaal in één keer schrijft, precies zoals een mens dat doet?

Maak kennis met OvisOCR2, een nieuwe digitale "lezer" ontwikkeld door onderzoekers van Alibaba. Denk aan OvisOCR2 niet als een gigantische, logge supercomputer, maar als een wendbaar, "zakformaat" genie met 0,8 miljard parameters. Terwijl andere modellen die dit probleem proberen op te lossen vaak enorm groot zijn en enorme datacentra vereisen, is OvisOCR2 ontworpen om klein en snel te zijn, maar toch ongelooflijk krachtig. De onderzoekers hebben dit model gebouwd met behulp van een slimme strategie bestaande uit twee delen. Eerst voedden ze het met een enorme bibliotheek van realistische documenten — gescande papers, bonnetjes en rapporten — maar ze waren voorzichtig met het opschonen van de "antwoorden", zodat het model leerde van perfecte voorbeelden en niet van slordige fouten. Vervolgens creëerden ze een "synthetische" trainingsomgeving. Stel je een videogame voor waarin ze oneindige pagina's aan documenten kunnen genereren met perfecte, bekende antwoorden, specifiek ontworpen om lastig te zijn (zoals pagina's met slordig handschrift of tabellen waarbij cellen op vreemde manieren samensmelten). Dit stelde het model in staat om te oefenen op de moeilijkste puzzels zonder ze eerst in de echte wereld te hoeven vinden.

Het trainingsproces was als een intensief sportkamp. Het model begon met het leren van de basis (Supervised Fine-Tuning), en ging daarna over naar een fase van "Reinforcement Learning" waarbij het een spel speelde: het probeerde een pagina te lezen, en als het de tabellen of wiskundige formules goed had, kreeg het een hoge score; als het de volgorde verpestte of een regel miste, kreeg het een lage score. Om ervoor te zorgen dat het kleine 0.8B-model kon leren van de beste, gebruikten de onderzoekers een "leraar-leerling"-aanpak. Eerst trainden ze een groter "leraar"-model van 4 miljard parameters om een meester te worden in deze taken, en vervolgens leerden ze het kleinere "leerling"-model (OvisOCR2) door het de beste zetten van de leraar te laten nabootsen. Hierdoor kon het kleine model veel meer presteren dan men op basis van zijn omvang zou verwachten.

De resultaten zijn een gamechanger. Bij tests op standaard benchmarks zoals OmniDocBench v1.6, wat de "Olympische Spelen" van het documentlezen is, scoorde OvisOCR2 een indrukwekkende 96,58. Dit is een grote prestatie omdat het betekent dat dit kleine, end-to-end model daadwerkelijk heeft gewonnen van de grootste, meest complexe "lopende band"-systemen die het veld tot nu toe domineerden. Het won niet alleen het totaaloverzicht; het was het beste in het lezen van tekst, het begrijpen van wiskundige formules en het reconstrueren van complexe tabellen. Het scoorde ook het hoogst op PureDocBench met een score van 75,06. Zelfs op een door de auteurs gemaakte, moeilijke test die lastig handschrift en rommelige tabellen bevatte, kwam OvisOCR2 als winnaar uit de bus, wat bewijst dat het niet alleen werkt op schone, perfecte pagina's, maar ook de rommelige realiteit van de echte wereld aankan.

De onderzoekers zijn echter eerlijk over de beperkingen. Hoewel OvisOCR2 een enorme sprong voorwaarts is, heeft het nog steeds wat moeite met afbeeldingen die erg wazig, beschadigd of met een telefoon in slecht licht genomen zijn, vergeleken met sommige van de gigantische, algemene AI-modellen. Het is geen toverstaf die alles oplost, maar het is een zeer sterk, efficiënt hulpmiddel dat bewijst dat je geen miljarden kostende computer nodig hebt om een document perfect te lezen. Het artikel suggereert dat we met deze aanpak eindelijk kunnen bewegen van logge, meerstapsmachines naar elegante, single-model oplossingen die klaar zijn voor gebruik in alledaagse apps, waardoor de digitale wereld veel toegankelijker wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →