MRT: A Mamba-based Framework with Reusable Transformer for Scene Text Recognition
Il documento propone MRT, un framework di riconoscimento del testo nelle scene che combina una Mamba potenziata da Neighborhood Attention per un'efficiente aggregazione spaziale locale con un Reusable Transformer a condivisione di pesi per il contesto globale bidirezionale, ottenendo un rapporto accuratezza-efficienza superiore attraverso molteplici benchmark.