← Últimos artículos
📄 other

MRT: A Mamba-based Framework with Reusable Transformer for Scene Text Recognition

El artículo propone MRT, un marco de reconocimiento de texto en escenas que combina Mamba mejorado con Atención de Vecindad para una agregación espacial local eficiente con un Transformer Reutilizable de pesos compartidos para un contexto global bidireccional, logrando compensaciones de precisión-eficiencia superiores en múltiples evaluaciones de referencia.

Autores originales: Yingnan Zhao, Dewen Zhang, Zuguo Yang, Jielin Jang

Publicado 2026-07-24
📖 3 min de lectura☕ Lectura para el café

Autores originales: Yingnan Zhao, Dewen Zhang, Zuguo Yang, Jielin Jang

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a leer una nota manuscrita y desordenada encontrada en una calle lluviosa. La nota podría estar arrugada, las letras podrían estar estiradas, o el fondo podría ser un caos borroso de letreros de neón. Este es el mundo del Reconocimiento de Texto en Escenas (STR). Es una rama específica de la informática donde las máquinas aprenden a convertir imágenes de texto en palabras digitales. Para hacer esto, el robot necesita dos superpoderes: debe acercarse para ver los detalles diminutos y finos de cada letra (como la curva de una 'S' o el punto de una 'i'), y debe alejarse para entender la oración completa, usando el contexto para adivinar una palabra borrosa.

Durante mucho tiempo, los robots usaron dos herramientas principales para este trabajo. La primera era como un par de lupas (llamadas Redes Neuronales Convolucionales o CNN), que eran excelentes para ver detalles locales pero tenían dificultades para conectar los puntos a lo largo de una oración larga. La segunda herramienta era como un bibliotecario súper organizado (llamado Transformer). Este bibliotecario podía leer todo el libro a la vez para entender el contexto, pero era tan lento y consumía tanta memoria que a menudo fallaba cuando el "libro" (la imagen) se volvía demasiado largo. Recientemente, llegó una nueva herramienta llamada Mamba. Es como un lector súper rápido y eficiente que puede escanear un libro largo en tiempo lineal, pero tiene un defecto: lee estrictamente de izquierda a derecha, palabra por palabra, y no es muy bueno viendo la forma 2D de las letras en una página.

Este artículo presenta un nuevo marco llamado MRT (marco basado en Mamba con Transformer Reutilizable) para solucionar los defectos de Mamba. Los autores, de la Universidad de Información de Ciencia y Tecnología de Nanjing, se dieron cuenta de que, aunque Mamba es rápido, su estilo de lectura de "solo de izquierda a derecha" y su falta de conciencia espacial 2D lo hacen torpe al reconocer texto distorsionado o irregular. No solo hicieron un pequeño ajuste a Mamba; le dieron un cambio de imagen. Primero, añadieron un sistema de "vigilancia vecinal" (Atención de Vecindad) que permite al modelo mirar los alrededores inmediatos de una letra en todas las direcciones, no solo hacia el pasado. Segundo, introdujeron un "Transformer Reutilizable", un módulo inteligente que actúa como una segunda opinión, revisando el trabajo del modelo en diferentes etapas. ¿La parte ingeniosa? Utilizan el mismo módulo Transformer dos veces, compartiendo su capacidad cerebral para ahorrar espacio.

Los resultados son impresionantes. El equipo probó sus nuevos modelos MRT en seis conjuntos de datos estándar de reconocimiento de texto y en un benchmark masivo y desafiante llamado Union-14M. Encontraron que su modelo "Base" (MRT-B) logró una precisión promedio del 96.96%, superando o igualando a modelos mucho más grandes y antiguos. Aún más sorprendente es su modelo "Tiny" (MRT-T). Con solo 4.72 millones de parámetros (un tamaño muy pequeño para una IA), aun así alcanzó un 95.06% de precisión promedio. El artículo sugiere que, al combinar la velocidad de Mamba con estas mejoras espaciales y reutilizables específicas, podemos construir sistemas de reconocimiento de texto que sean tanto altamente precisos como increíblemente eficientes, evitando la necesidad de computadoras masivas que consumen mucha energía. Los autores sugieren que este enfoque ofrece un fuerte equilibrio entre velocidad e inteligencia, demostrando que no necesitas un cerebro gigante para leer un letrero de calle desordenado si tienes las herramientas adecuadas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →