← Nieuwste papers
💬 NLP

Unlimited OCR Works

Dit artikel introduceert Unlimited OCR, een model dat de standaard decoder-attention vervangt door een nieuw Reference Sliding Window Attention (R-SWA) mechanisme om een constante KV-cache te behouden, waardoor efficiënte, single-pass transcriptie van tientallen pagina's mogelijk wordt zonder de geheugen- en snelheidssvermindering die typisch wordt veroorzaakt door lange outputsequenties in op LLM gebaseerde OCR-systemen.

Oorspronkelijke auteurs: Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Geheugenoverbelasting" van Huidige AI

Stel je voor dat je probeert een boek van 100 pagina's met de hand over te schrijven.

  • Hoe Mensen Dit Doen: Je kijkt naar het boek, schrijft een zin, werpt een blik terug op de laatste paar woorden die je net hebt geschreven om te controleren of je nog op schema ligt, en gaat dan verder. Je hoeft niet elk enkel woord te onthouden dat je sinds pagina één hebt geschreven; je moet alleen weten waar je nú bent. Je brein laat het verre verleden vanzelf "vervagen" terwijl het de directe context scherp houdt.
  • Hoe Huidige AI Dit Doet: Huidige AI-modellen gedragen zich als een student die weigert iets te vergeten. Elke keer dat ze een nieuw woord schrijven, proberen ze het hele boek vanaf pagina één tot de huidige pagina opnieuw te lezen om te beslissen wat ze nu moeten schrijven.
    • Het Resultaat: Naarmate het boek langer wordt, wordt de student steeds langzamer omdat ze een enorme mentale belasting met zich meedragen. Uiteindelijk raken ze hun geheugen (RAM) kwijt en moeten ze stoppen, resetten en opnieuw beginnen op een nieuwe pagina. Dit is waarom huidige AI moeite heeft met het verwerken van een heel boek in één keer; het moet het pagina voor pagina doen, als een robot die vastzit in een loop.

De Oplossing: "Unlimited OCR" en het "Schuivende Venster"

De onderzoekers bij Baidu stellen een nieuw model voor genaamd Unlimited OCR. Ze wilden een AI bous die meer denkt als een menselijke kopiist. Hiervoor hebben ze een nieuw aandachtmechanisme uitgevonden genaamd Reference Sliding Window Attention (R-SWA).

Zo werkt het, met behulp van enkele analogieën:

1. Het "Referentieboek" versus het "Schuivende Venster"

Stel je voor dat de AI aan een bureau zit met twee dingen:

  • Het Referentieboek (De Afbeelding): Dit is het document dat gescand wordt. De AI houdt dit de hele tijd open op het bureau. Het vergeet de originele afbeelding nooit.
  • Het Schuivende Venster (Het Recente Verleden): In plaats van de hele geschiedenis van wat het geschreven heeft te onthouden, houdt de AI alleen een klein "plaknotitie" bij van de laatste 128 woorden die het heeft gegenereerd. Terwijl het een nieuw woord schrijft, valt het oudste woord op de plaknotitie eraf en wordt het nieuwe woord toegevoegd.

De Magie: De AI kijkt naar het Referentieboek (om te weten wat er gekopieerd moet worden) en naar het Schuivende Venster (om te weten waar het in het proces is). Het negeert de rest van de geschiedenis. Dit houdt de "mentale belasting" (geheugengebruik) constant, ongeacht of het 1 pagina of 100 pagina's kopieert.

2. De "Diepe Squeeze" (High-Compression Encoder)

Voordat de AI zelfs maar begint met schrijven, moet het naar de afbeelding kijken.

  • De Oude Manier: Als je een foto met een hoge resolutie van een boek hebt, is het alsof je elke pixel probeert te beschrijven. Dat neemt een enorme hoeveelheid ruimte in beslag.
  • De Unlimited OCR-Manier: Ze gebruiken een "Deep Squeeze" (DeepEncoder). Stel je voor dat je een foto met een hoge resolutie comprimeert tot een kleine, efficiënte samenvatting zonder de belangrijke details te verliezen. Dit betekent dat het "Referentieboek" heel weinig ruimte inneemt op het bureau, waardoor er genoeg ruimte overblijft voor de AI om te werken.

Wat Hebben Ze Bereikt?

Door de "Deep Squeeze" te combineren met het "Schuivende Venster", hebben de onderzoekers drie belangrijke zaken bereikt:

  1. One-Shot Long-Horizon Parsing: Het model kan tientallen pagina's van een document in één keer verwerken. Het hoeft niet te stoppen en te resetten. Het kan een heel boek van begin tot eind in één continue stroom lezen.
  2. Constante Snelheid: Omdat de AI niet probeert de hele geschiedenis te onthouden, wordt het niet langzamer naarmate het document langer wordt. Of het nu op pagina 1 of pagina 50 is, het schrijft met dezelfde snelheid.
  3. Betere Nauwkeurigheid: Verrassend genoeg, door zich alleen te concentreren op de relevante recente context en de originele afbeelding, maakte de AI juist minder fouten dan de vorige beste modellen. Het raakte niet in de war door zijn eigen lange geschiedenis.

De "Real-World" Test

De onderzoekers hebben dit getest op een benchmark genaamd OmniDocBench.

  • Het Resultaat: Unlimited OCR scoorde hoger dan bijna alle andere modellen, inclusief het model waarop het gebouwd is (DeepSeek OCR).
  • De Long-Form Test: Ze voerden het boeken met 40+ pagina's. Het model hield de nauwkeurigheid hoog, wat bewees dat het niet "de weg kwijtraakte" in het midden van het boek.

Wat Betekent Dit voor de Toekomst?

Het paper suggereert dat dit niet alleen bedoeld is voor het lezen van boeken. Omdat de "Schuivende Venster"-logica zo efficiënt is, zou dit toegepast kunnen worden op andere taken waarbij je langdurig moet luisteren of vertalen zonder moe of traag te worden, zoals:

  • ASR (Automatic Speech Recognition): Het transcriberen van uren aan audio zonder dat het systeem trager wordt.
  • Vertaling: Het vertalen van lange documenten in één passage.

Samenvatting

Beschouw Unlimited OCR als een upgrade van een AI van een "fotografisch geheugen" dat overweldigd raakt door lange taken, naar een "slimme kopiist" die precies weet wat hij moet onthouden (de originele afbeelding en de laatste paar woorden) en wat hij veilig kan vergeten. Dit stelt het in staat om sneller te werken, minder geheugen te gebruiken en enorme documenten aan te pakken die voorheen onmogelijk voor AI waren om in één keer te verwerken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →