MRT: A Mamba-based Framework with Reusable Transformer for Scene Text Recognition
Het artikel stelt MRT voor, een framework voor scène-tekstherkenning dat Neighborhood Attention-enhanced Mamba combineert voor efficiënte lokale ruimtelijke aggregatie met een gewichtsgedeelde Reusable Transformer voor bidirectionele globale context, waarmee een superieure nauwkeurigheid-efficiëntie-afweging wordt bereikt over meerdere benchmarks.