← 最新の論文
📄 other

MRT: A Mamba-based Framework with Reusable Transformer for Scene Text Recognition

本論文は、効率的な局所的空間集約のためのNeighborhood Attention強化型Mambaと、双方向のグローバルコンテキストのための重み共有型Reusable Transformerを組み合わせることで、複数のベンチマークにおいて優れた精度と効率性のトレードオフを実現するシーンテキスト認識フレームワークであるMRTを提案している。

原著者: Yingnan Zhao, Dewen Zhang, Zuguo Yang, Jielin Jang

公開日 2026-07-24
📖 1 分で読めます☕ さくっと読める

原著者: Yingnan Zhao, Dewen Zhang, Zuguo Yang, Jielin Jang

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、雨の降る街角で見つけた、ぐちゃぐチャな手書きのメモを読み取るようロボットに教えているところだと想像してください。そのメモは、くしゃくしゃになっていたり、文字が引き伸ばされていたり、背景がネオンサインで混沌としたボケ状態だったりするかもしれません。これが**シーンテキスト認識(STR)**の世界です。これは、機械が画像のテキストをデジタルな単語へと変換する方法を学習する、コンピュータサイエンスの特定の分野です。これを行うために、ロボットには2つのスーパーパワーが必要です。一つは、各文字の細かなディテール(「S」の曲線や「i」の点など)を見るためにズームインすること。もう一つは、文全体を理解するためにズームアウトし、コンテキスト(文脈)を使ってぼやけた単語を推測することです。

長い間、ロボットはこの仕事のために主に2つの道具を使用してきました。1つ目は、虫眼鏡(畳み込みニューラルネットワーク、またはCNNと呼ばれるもの)のようなものです。これらは局所的な詳細を見るのには優れていましたが、長い文章にわたって点と点を結びつけるのが苦手でした。2つ目の道具は、超整理整頓された司書(Transformerと呼ばれるもの)のようなものです。この司書は、文脈を理解するために本全体を一度に読むことができますが、非常に動作が重くメモリを大量に消費するため、「本」(画像)が長すぎると頻繁にクラッシュしてしまいました。最近、Mambaと呼ばれる新しい道具が登場しました。それは、長い本を線形時間でスキャンできる超高速で効率的な読者のようなものですが、ある癖があります。それは、左から右へと厳格に、一単語ずつ読んでいくことであり、ページ上の文字の2次元的な形状を見るのが苦手だということです。

この論文は、Mambaの癖を修正するための新しいフレームワークであるMRT(Reusable Transformerを備えたMambaベースのフレームワーク)を紹介しています。南京情報科学技術大学の研究者たちは、Mambaは高速ではあるものの、その「左から右へのみ」という読み方スタイルと2次元的な空間認識の欠如が、歪んだり不規則なテキストを認識する際に不器用になることを突き止めました。彼らは単にMambaを微調整しただけではありません。彼らはそれに「模様替え」を施しました。まず、モデルが過去だけでなく全方向の周囲を見ることができるように、「近所監視システム」(Neighborhood Attention)を追加しました。次に、モデルの作業を異なる段階でチェックする「セカンドオピニオン」として機能するスマートなモジュールである「Reusable Transformer」を導入しました。巧妙な点は、彼らが全く同じTransformerモジュールを2回使用し、その脳の力を共有することでスペースを節約していることです。

結果は素晴らしいものです。チームは、6つの標準的なテキスト認識データセットと、Union-14Mと呼ばれる大規模で挑戦的なベンチマークで新しいMRTモデルをテストしました。彼らは、彼らの「Base」モデル(MRT-B)が平均精度96.96%を達成し、より大規模で古いモデルを打ち負かすか、あるいは並んだことを発見しました。さらに驚くべきは、彼らの「Tiny」モデル(MRT-T)です。わずか472万個のパラメータ(AIとしては非常に小さなサイズ)でありながら、平均精度**95.06%**に達しました。この論文は、Mambaのスピードにこれらの特定の空間的および再利用可能なアップグレードを組み合わせることで、高度に正確かつ非常に効率的なテキスト認識システムを構築でき、巨大でエネルギーを大量に消費するコンピュータを必要としないことを示唆しています。著者たちは、このアプローチがスピードと賢さの間の強力なバランスを提供していることを示唆しており、正しい道具さえあれば、乱れた街の標識を読むために巨大な脳は必要ないということを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →