Can OCR-VLMs Read Devanagari? A Stress-Test Benchmark and Post-Correction Study
Dit artikel benchmarkt tien OCR-systemen op Devanagari-tekst, waarbij wordt onthuld dat synthetische evaluaties de prestaties overschatten, gespecialiseerde OCR-VLM's vatbaar zijn voor catastrofale fouten bij degradatie, en sterke Engelse OCR-capaciteiten geen succes garanderen met Indiase schriften, terwijl het ook een post-correctiebenadering voorstelt die specifieke engines verbetert zonder algemeen toepasbaar te zijn op andere engines.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een team hebt van tien verschillende "leesrobots". Sommigen zijn beroemde, dure supercomputers (zoals die van Google, OpenAI en Anthropic), sommige zijn open-source projecten die iedereen kan downloaden, en sommige zijn gespecialiseerde machines die puur gebouwd zijn om documenten te lezen.
De onderzoekers wilden weten: Kunnen deze robots daadwerkelijk Hindi lezen (geschreven in het Devanagari-schrift), of doen ze alsof ze slim zijn?
Hier is het verhaal van wat ze ontdekten, eenvoudig uitgelegd:
1. De "Perfecte Klas"-valstrik
Eerst gaven de onderzoekers alle tien de robots een test met perfect schone, door de computer gegenereerde tekst. Het was alsof ze een boek lazen dat gedrukt was op een smetteloos wit vel papier zonder vlekken.
Het resultaat: Iedereen slaagde voor de test met vlag en wimpel. Alle tien de robots scoorden tussen de 91% en 98% nauwkeurigheid. Ze zagen er allemaal even briljant uit.
De les: Dit was een valstrik. Alleen omdat een robot perfecte tekst kan lezen, betekent niet dat hij de echte wereld aan kan. Het is alsof je zegt dat een racewagen de beste bestuurder is omdat hij won op een gladde, lege baan, zonder ooit te testen op een hobbelige, regenachtige weg.
2. De "Bumpy Road"-test (Degradatie)
Vervolgens maakten de onderzoekers de afbeeldingen een puinhoop. Ze voegden onscherpte toe, ruis (zoals statische elektriciteit op een oude tv) en maakten de tekst er laag-resolutie. Dit simuleert een foto van een gekreukeld, stoffig of slecht gedrukt document.
Het resultaat: Hier werd het een rommeltje.
- De Klassiekers & Open Modellen: Sommige robots (zoals EasyOCR en de Qwen-modellen) bleven stabiel. Ze struikelden een beetje, maar bleven wel lezen.
- De "Gespecialiseerde" Robots: De machines die specifiek voor OCR gebouwd zijn (DeepSeek-OCR en Unlimited-OCR) stortten in elkaar.
- De Glitch: Een van hen, DeepSeek-OCR, had een angstaanjagende gewoonte. Wanneer het in de war raakte, stopte het niet alleen; het begon zichzelf te herhalen. Stel je voor dat een robot een zin leest en dan diezelfde zin 70 keer achter elkaar schreeuwt. Deze "repetition loop" verpestte het gemiddelde cijfer, ook al was het eigenlijk de beste in het lezen van de normale zinnen.
- De Les: Als je alleen naar het "gemiddelde" cijfer kijkt, word je misleid. Je moet naar het "worst-case scenario" kijken om te zien of een robot veilig te gebruiken is.
3. De "Real World" Schok
Ten slotte testten de onderzoekers de robots op 300 echte foto's van werkelijke gedrukte Hindi-pagina's (gescand van oude boeken). Dit was de ultieme stresstest.
Het resultaat: De perfecte scores uit de eerste test verdwenen. De ranglijsten draaiden volledig om.
- De "Supersterren" van het Engels: De robots die beroemd zijn om het lezen van Engelse documenten (zoals GPT-5.5 en olmOCR-7B) deden het vreselijk op Hindi. GPT-5.5 zakte van een top-tier lezer naar een niveau dat nauwelijks beter was dan de basis, ouderwetse robot (EasyOCR).
- De Verrassende Winnaars:
- De Grote Gesloten Modellen: De robots van Google (Gemini) en Anthropic (Claude) bleven de kampioenen; zij gingen gemakkelijk om met de rommelige, echte foto's.
- De Open Held: Een kleinere, open-source robot genaamd Qwen3-VL-8B (die op een enkele standaardcomputer kan draaien) versloeg zelfs de dure GPT-5.5 en kwam dicht in de buurt van de reuzen.
- De Grote Les: Goed zijn in het lezen van Engels betekent niet dat je goed bent in het lezen van Hindi. De vaardigheden zijn niet overdraagbaar.
4. Wat voor Soorten Fouten Maakten Ze?
De onderzoekers categoriseerden de fouten zoals een arts een diagnose stelt bij een patiënt:
- Ouderwetse Robots (EasyOCR): Zij maakten vooral fouten in de "oppervlakte". Ze verwarten Hindi-cijfers met Engelse cijfers of kregen leestekens verkeerd.
- Slimme AI-Robots (VLMs): Zij maakten fouten in de "structuur". Hindi heeft complexe letters die op elkaar gestapeld zijn of kleine tekens (stippen) die eraan vastzitten. De AI-robots kregen deze vormen vaak fout, waarbij ze één letter verwarden met een andere die er vergelijkbaar uitziet (zoals het mixen van een 'b' en een 'v').
5. Het "Post-Editor" Experiment
De onderzoekers probeerden de fouten van de goedkoopste robot (EasyOCR) te herstellen door een klein "corrector"-programma toe te voegen.
- Werkte het? Ja, maar alleen voor die specifieke robot. Het verbeterde de scores van EasyOCR lichtelijk.
- Werkte het voor anderen? Nee. Als je diezelfde corrector op de andere robots probeerde te gebruiken, maakte het de zaken slechter of deed het niets.
- De Les: Je kunt geen "one-size-fits-all" oplossing gebruiken. De corrector moet specifiek getraind worden op het type fouten dat die specifieke robot maakt.
Het Eindoordeel
Het paper concludeert met een sterke waarschuwing: Vertrouw niet op benchmarks die alleen gebruikmaken van perfecte, door de computer gegenereerde tekst. Ze verbergen de gebreken.
- Als je rommelige, echte Hindi-documenten moet lezen, zijn de "gespecialiseerde" OCR-robots die hiervoor gebouwd zijn eigenlijk de risicovolste keuze, omdat ze crashen of zichzelf herhalen.
- De beste huidige opties zijn de grote gesloten modellen (Gemini, Claude) of de verrassend sterke open-source modellen (Qwen3-VL-8B).
- Cruciaal: Een robot die de beste is in het lezen van Engels, is niet noodzakelijkerwijs de beste in het lezen van Hindi. Je moet ze testen op de specifieke taal die je nodig hebt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.