PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing
PaddleOCR-VL-1.5 is een geüpgrade, ultracompacte 0,9B VLM die nieuwe state-of-the-art resultaten bereikt voor robuuste documentparsing in ongestructureerde omgevingen, inclusief nieuwe taken zoals zegelherkenning en tekstspotting.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme berg oude, beschadigde documenten krijgt. Sommige zijn gekreukt, andere zijn schuin gefotografeerd, weer anderen hebben vlekken of zijn op een scherm gefotografeerd. Je wilt al die informatie eruit halen en in een nette, leesbare vorm zetten. Dat is precies wat PaddleOCR-VL-1.5 doet, maar dan als een super-slimme digitale assistent.
Hier is een uitleg in gewone taal, met een paar leuke vergelijkingen:
1. De "Mini-Genie" (Klein maar Krachtig)
Deze nieuwe versie is een 0.9 miljard parameters groot model. Dat klinkt misschien als een groot getal, maar in de wereld van AI is dit eigenlijk een dwarfling vergeleken met de reuzen (die soms 200+ miljard parameters hebben).
- De Analogie: Stel je voor dat de grote AI-modellen (zoals Qwen3 of Gemini) gigantische vrachtwagens zijn. Ze kunnen enorm veel meenemen, maar ze zijn traag, duur in brandstof en hebben een groot laadperron nodig. PaddleOCR-VL-1.5 is daarentegen een sportieve elektrische scooter. Hij is klein, wendbaar, snel en kan met weinig energie precies hetzelfde werk doen, maar dan veel efficiënter. Hij is speciaal gebouwd voor documenten, niet voor alles en iedereen.
2. De "Reparatie-Expert" voor Vuile Documenten
Vroeger konden AI-modellen alleen goed lezen als het document perfect was: plat op een scanner gelegd, goed verlicht en recht. Als je een foto maakte van een krant die op een kromme tafel lag, of een foto van een scherm met een rare reflectie, gaf de AI het vaak op.
- De Analogie: PaddleOCR-VL-1.5 is als een meester-restaurateur die niet bang is voor vuil.
- Scheef (Skew): Het kan een scheef gefotografeerde pagina "rechtstrekken" in zijn hoofd.
- Gekreukt (Warping): Het kan een pagina die eruitziet alsof hij in een wasmachine heeft gezeten, nog steeds perfect lezen.
- Slecht Licht (Illumination): Het ziet de tekst door donkere schaduwen of felle flitsen heen.
- Schermfoto's (Screen Photography): Het kan de rare patronen (moiré) van een foto van een computermonitor wegfilteren.
De auteurs hebben zelfs een nieuwe test gemaakt, genaamd Real5-OmniDocBench, die precies deze "slechte" situaties simuleert. En daar scoort dit model recordhoogtes.
3. De "Nieuwe Vaardigheden"
Naast het gewoon lezen van tekst, heeft deze assistent twee nieuwe superkrachten gekregen:
- Het Zegel-Expert (Seal Recognition): In veel Aziatische landen (en ook in Nederland bij officiële stukken) worden documenten afgezegd met een stempel. Vaak zit de tekst eronder of eromheen, en is het moeilijk te lezen. Dit model kan die stempels herkennen en de tekst eruit halen alsof het een magische lens is.
- Het "Zoek-en-Vind" Meester (Text Spotting): Normaal gesproken zegt een AI: "Hier staat de tekst: 'DREAM'". Maar dit model zegt: "Hier staat 'DREAM' en ik kan je precies vertellen waar het op de foto staat, zelfs als het schuin staat of in een hoekje." Het tekent een onzichtbare lijn om het woord heen.
4. Hoe werkt het? (De Twee-Stappen Dans)
Het model werkt in twee stappen, net als een slimme secretaresse:
- De Architect (PP-DocLayoutV3): Eerst kijkt deze "architect" naar het hele document. Hij ziet niet alleen waar de tekst staat, maar hij begrijpt ook de structuur. Hij weet: "Dit is een kopje, dit is een tabel, en dit is een foto." Hij kan zelfs zien welke tekst eerst gelezen moet worden, zelfs als de pagina scheef is. Hij gebruikt geen simpele rechthoekjes, maar tekent precieze vormen (zoals een vierkantje dat je kunt draaien) om de tekst te omvatten.
- De Vertaler (PaddleOCR-VL-1.5-0.9B): Zodra de architect de stukjes heeft ingedeeld, neemt de "vertaler" het over. Deze leest de tekst, de formules, de tabellen en de stempels. Omdat hij weet waar hij moet kijken (dankzij de architect), maakt hij veel minder fouten.
5. Waarom is dit belangrijk?
Vroeger moesten bedrijven enorme, dure computers gebruiken om documenten te verwerken, en dat ging vaak mis bij "echte" documenten (zoals een versleten factuur of een foto van een whiteboard).
Met PaddleOCR-VL-1.5 kunnen bedrijven:
- Sneller werken: Het is zo snel dat het op gewone servers draait, zonder supercomputers.
- Betrouwbaarder zijn: Het werkt ook als de kwaliteit van de foto slecht is.
- Slimmer worden: Omdat het documenten perfect kan omzetten in digitale tekst, kunnen andere AI's (zoals die voor klantenservice of onderzoek) die informatie beter gebruiken.
Kortom: PaddleOCR-VL-1.5 is de slimme, snelle en veerkrachtige assistent die elke rommelige stapel papieren in een perfecte, digitale bibliotheek verandert, zonder dat je daar een heel team aan experts voor nodig hebt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.