← Nieuwste papers
📄 other

MRT: A Mamba-based Framework with Reusable Transformer for Scene Text Recognition

Het artikel stelt MRT voor, een framework voor scène-tekstherkenning dat Neighborhood Attention-enhanced Mamba combineert voor efficiënte lokale ruimtelijke aggregatie met een gewichtsgedeelde Reusable Transformer voor bidirectionele globale context, waarmee een superieure nauwkeurigheid-efficiëntie-afweging wordt bereikt over meerdere benchmarks.

Oorspronkelijke auteurs: Yingnan Zhao, Dewen Zhang, Zuguo Yang, Jielin Jang

Gepubliceerd 2026-07-24
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yingnan Zhao, Dewen Zhang, Zuguo Yang, Jielin Jang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren om een slordig, handgeschreven briefje te lezen dat op een regenachtige straat is gevonden. Het briefje kan gekreukt zijn, de letters kunnen uitgerekt zijn, of de achtergrond kan een chaotische waas van neonreclames zijn. Dit is de wereld van Scene Text Recognition (STR). Het is een specifieke tak van de informatica waarbij machines leren om afbeeldingen van tekst om te zetten in digitale woorden. Om dit te doen, heeft de robot twee superkrachten nodig: hij moet inzoomen om de kleine, fijne details van elke letter te zien (zoals de bocht van een 'S' of de stip op een 'i'), en hij moet uitzoomen om de hele zin te begrijpen, door context te gebruiken om een wazig woord te raden.

Lama tijd gebruikten robots twee belangrijke hulpmiddelen voor deze taak. Het eerste was als een paar vergrootglazen (genoemd Convolutional Neural Networks of CNN's). Ze waren geweldig in het zien van lokale details, maar hadden moeite met het verbinden van de punten over een lange zin heen. Het tweede hulpmiddel was als een supergeorganiseerde bibliothecaris (genoemd Transformers). Deze bibliothecaris kon het hele boek in één keer lezen om de context te begrijpen, maar was zo traag en geheugenverslindend dat hij vaak crashte wanneer het "boek" (de afbeelding) te lang werd. Onlangs arriveerde een nieuw hulpmiddel genaamd Mamba. Het is als een supersnelle, efficiënte lezer die een lang boek in lineaire tijd kan scannen, maar het heeft een eigenaardigheid: het leest strikt van links naar rechts, één woord tegelijk, en is niet erg goed in het zien van de 2D-vorm van letters op een pagina.

Dit artikel introduceert een nieuw framework genaamd MRT (Mamba-gebaseerd framework met Reusable Transformer) om de eigenaardigheden van Mamba op te lossen. De auteurs, van de Nanjing University of Information Science and Technology, realiseerden zich dat hoewel Mamba snel is, de "alleen van links naar rechts"-leesstijl en het gebrek aan 2D-ruimtelijk bewustzijn het onhandig maken bij het herkennen van vervormde of onregelmatige tekst. Ze hebben Mamba niet alleen bijgetweakt; ze hebben het een make-over gegeven. Eerst voegden ze een "buurtwacht"-systeem toe (Neighborhood Attention) waarmee het model naar de directe omgeving van een letter in alle richtingen kan kijken, niet alleen naar het verleden. Ten tweede introduceerden ze een "Reusable Transformer", een slim module die fungeert als een tweede mening en het werk van het model op verschillende stadia controleert. Het slimme deel? Ze gebruiken dezelfde Transformer-module twee keer, waarbij ze de hersenkracht ervan delen om ruimte te besparen.

De resultaten zijn indrukwekkend. Het team heeft hun nieuwe MRT-modellen getest op zes standaard tekstherkenningsdatasets en een enorme, uitdagende benchmark genaamd Union-14M. Ze ontdekten dat hun "Base"-model (MRT-B) een gemiddelde nauwkeurigheid van 96,96% bereikte, waarmee het grotere, oudere modellen versloeg of evenaarde. Nog opmerkelijker is hun "Tiny"-model (MRT-T). Met slechts 4,72 miljoen parameters (een zeer kleine omvang voor een AI) behaalde het nog steeds een gemiddelde nauwkeurigheid van 95,06%. Het artikel suggereert dat door de snelheid van Mamba te combineren met deze specifieke ruimtelijke en herbruikbare upgrades, we tekstherkenningssystemen kunnen bouwen die zowel uiterst nauwkeurig als ongelooflijk efficiënt zijn, waardoor de noodzaak voor enorme, energieverslindende computers wordt vermeden. De auteurs suggereren dat deze aanpak een sterke balans biedt tussen snelheid en intelligentie, en bewijst dat je geen gigantisch brein nodig hebt om een slordig straatnaambord te lezen als je de juiste hulpmiddelen hebt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →