← Derniers articles
📄 other

MRT: A Mamba-based Framework with Reusable Transformer for Scene Text Recognition

L'article propose MRT, un cadre de reconnaissance de texte dans les scènes qui combine un Mamba amélioré par l'Attention de Voisinage pour une agrégation spatiale locale efficace avec un Transformer Réutilisable à partage de poids pour un contexte global bidirectionnel, atteignant des compromis précision-efficacité supérieurs sur de multiples bancs d'essai.

Auteurs originaux : Yingnan Zhao, Dewen Zhang, Zuguo Yang, Jielin Jang

Publié 2026-07-24
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Yingnan Zhao, Dewen Zhang, Zuguo Yang, Jielin Jang

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un robot à lire une note manuscrite et désordonnée trouvée dans une rue sous la pluie. La note pourrait être froissée, les lettres pourraient être étirées, ou l'arrière-plan pourrait être un flou chaotique de néons. C'est le monde de la Reconnaissance de Texte en Scène (STR). Il s'agit d'une branche spécifique de l'informatique où les machines apprennent à transformer des images de texte en mots numériques. Pour y parvenir, le robot doit posséder deux superpouvoirs : il doit zoomer pour voir les détails infimes de chaque lettre (comme la courbe d'un « S » ou le point sur un « i »), et il doit dézoomer pour comprendre la phrase entière, en utilisant le contexte pour deviner un mot flou.

Pendant longtemps, les robots ont utilisé deux outils principaux pour cette tâche. Le premier était comme une paire de loupes (appelées Réseaux de Neurones Convolutifs ou CNN). Ils étaient excellents pour voir les détails locaux mais peinaient à relier les points sur une longue phrase. Le second outil était comme un bibliothécaire super organisé (appelé Transformer). Ce bibliothécaire pouvait lire tout le livre d'un coup pour comprendre le contexte, mais il était si lent et gourmand en mémoire qu'il plantait souvent lorsque le « livre » (l'image) devenait trop long. Récemment, un nouvel outil nommé Mamba est arrivé. C'est comme un lecteur super rapide et efficace qui peut parcourir un long livre en un temps linéaire, mais il a une particularité : il lit strictement de gauche à droite, un mot à la fois, et n'est pas très doué pour percevoir la forme 2D des lettres sur une page.

Ce document présente un nouveau cadre appelé MRT (cadre basé sur Mamba avec un Transformer réutilisable) pour corriger les défauts de Mamba. Les auteurs, de l'Université de l'Information et des Sciences et Technologies de Nanjing, ont réalisé que si Mamba est rapide, son style de lecture « uniquement de gauche à droite » et son manque de conscience spatiale 2D le rendent maladroit pour reconnaître du texte déformé ou irrégulier. Ils n'ont pas seulement peaufiné Mamba ; ils lui ont offert une cure de rajeunissement. D'abord, ils ont ajouté un système de « surveillance de quartier » (Attention de Voisinage) qui permet au modèle de regarder les environs immédiats d'une lettre dans toutes les directions, pas seulement vers le passé. Deuxièmement, ils ont introduit un « Transformer Réutilisable », un module intelligent qui agit comme un second avis, vérifiant le travail du modèle à différentes étapes. L'aspect ingénieux ? Ils utilisent le même module Transformer deux fois, partageant sa puissance cérébrale pour économiser de l'espace.

Les résultats sont impressionnants. L'équipe a testé ses nouveaux modèles MRT sur six ensembles de données de reconnaissance de texte standards et sur un benchmark massif et exigeant appelé Union-14M. Ils ont constaté que leur modèle « Base » (MRT-B) a atteint une précision moyenne de 96,96 %, battant ou égalant des modèles beaucoup plus grands et plus anciens. Plus frappant encore est leur modèle « Tiny » (MRT-T). Avec seulement 4,72 millions de paramètres (une taille très petite pour une IA), il a tout de même atteint une précision moyenne de 95,06 %. Le papier suggère qu'en combinant la vitesse de Mamba avec ces améliorations spatiales et réutilisables spécifiques, nous pouvons construire des systèmes de reconnaissance de texte qui soient à la fois hautement précis et incroyablement efficaces, évitant ainsi le besoin d'ordinateurs massifs et énergivores. Les auteurs suggèrent que cette approche offre un équilibre solide entre vitesse et intelligence, prouvant qu'on n'a pas besoin d'un cerveau géant pour lire un panneau de signalisation désordonné si l'on possède les bons outils.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →