← Nieuwste papers
💻 computer science

AtlasOCR: Building the First Open-Source Darija OCR Model with Vision Language Models

Deze paper introduceert AtlasOCR, het eerste open-source OCR-model voor het Marokkaanse dialect Darija, dat door middel van efficiënte fine-tuning van een 3B-parameter Vision Language Model en een uniek dataset een state-of-the-art prestatie levert.

Oorspronkelijke auteurs: Imane Momayiz, Soufiane Ait Elaouad, Abdeljalil Elmajjodi, Haitame Bouanane

Gepubliceerd 2026-04-10
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Imane Momayiz, Soufiane Ait Elaouad, Abdeljalil Elmajjodi, Haitame Bouanane

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek hebt vol met boeken, kranten en foto's in het Darija (de Marokkaanse Arabische taal die mensen in het dagelijks leven spreken). Maar er is een groot probleem: niemand kan deze boeken digitaal lezen of doorzoeken. De bestaande "digitale ogen" (OCR-software) zijn getraind op het formele, standaard Arabisch en kijken erdoorheen alsof het een vreemde taal is. Ze zien de krullen, de dialectwoorden en de informele schrijfwijze niet.

De onderzoekers van AtlasIA hebben nu een oplossing bedacht: AtlasOCR.

Hier is wat ze hebben gedaan, vertaald naar een simpel verhaal:

1. Het probleem: De "Blinde" Digitale Oog

Stel je voor dat je een robot hebt die alleen kan lezen als je perfect, formeel Nederlands schrijft. Als je nu een sms-berichtje stuurt vol met straattaal, afkortingen en spelfouten, begrijpt de robot niets. Dat is precies wat er gebeurt met Darija. Er was geen enkel gratis, openbaar programma dat deze taal kon "lezen" van foto's.

2. De Oplossing: Een slimme, kleine robot

In plaats van een gigantische, dure supercomputer te bouwen, hebben ze gekozen voor een slimme, compacte robot (een model van 3 miljard parameters). Ze hebben een bestaande, zeer slimme "oog- en hersen-combinatie" (een Vision Language Model genaamd Qwen2.5-VL) genomen en deze speciaal getraind op Darija.

Het is alsof je een algemene vertaler neemt en hem een jaar lang laat wonen in een Marokkaans café, zodat hij de lokale dialecten en de manier waarop mensen praten, perfect leert begrijpen.

3. De "Voeding": Hoe leer je een robot?

Een robot heeft veel voorbeelden nodig om te leren. Maar er waren niet genoeg echte foto's van Darija-tekst beschikbaar. Dus hebben ze een slimme truc gebruikt:

  • De Kunstmatige Bibliotheek (Synthetische Data): Ze hebben een eigen tool gemaakt, OCRSmith. Dit is als een 3D-printer voor tekst. Ze hebben duizenden nep-teksten gegenereerd met verschillende lettertypes, achtergronden en vervormingen, alsof ze uit een echte Marokkaanse winkel of krant komen. Dit vormt 86% van de "voeding" voor de robot.
  • De Echte Wereld (Real-world Data): Voor de rest (14%) hebben ze echte foto's verzameld: oude boeken, posters van LinkedIn, rijbewijs-examens en zelfs recepten uit Marokkaanse kookboeken. Dit zorgt ervoor dat de robot ook de "ruis" en de echte chaos van de wereld kan lezen.

4. De Training: Slim leren zonder veel energie

Normaal gesproken kost het trainen van zo'n slimme robot enorm veel stroom en dure computers. De onderzoekers hebben echter een efficiënte trainingsmethode gebruikt (QLoRA en Unsloth).

  • De Analogie: Stel je voor dat je een chef-kok wilt trainen. In plaats van hem een hele nieuwe keuken te geven met alle ingrediënten, geef je hem een bestaande keuken en leer je hem alleen specifieke nieuwe recepten. Je verandert niet de hele keuken, maar alleen de handelingen van de kok.
  • Hierdoor konden ze de robot trainen op gewone computers (consumer-grade GPUs), wat het project veel goedkoper en toegankelijker maakt.

5. De Test: De "Darija-Olympiade"

Om te bewijzen dat het werkt, hebben ze een eigen test gemaakt, de AtlasOCRBench. Ze hebben de robot laten strijden tegen andere bekende modellen.

  • Resultaat: AtlasOCR was de winnaar. Hij las Darija-teksten veel beter dan de grote, dure modellen.
  • Bonus: Omdat hij zo slim is getraind, kon hij ook nog steeds goed lezen in het standaard Arabisch, zelfs al was hij vooral getraind op de dialect-versie.

Waarom is dit belangrijk?

Dit is als het openen van een nieuwe deur voor de Marokkaanse cultuur:

  • Geschiedenis bewaren: Oude documenten en handschriften kunnen eindelijk digitaal worden doorzocht.
  • Toegankelijkheid: Mensen met een visuele beperking kunnen nu "horen" wat er op foto's van Marokkaanse straten of sociale media staat.
  • Onderzoek: Wetenschappers kunnen nu grote hoeveelheden Marokkaanse tekst analyseren om te begrijpen hoe de mensen denken en praten.

Kortom: AtlasOCR is de eerste gratis, open-source "digitale bril" die specifiek is ontworpen om de rijke, levendige wereld van het Marokkaanse Darija te lezen, zonder dat je daarvoor een supercomputer nodig hebt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →