← 最新の論文
💻 computer science

AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach

本論文は、新たなバイリンガル・ベンチマークによって検証され、複数のASRフロントエンドにおいて優れた性能を示した、発話者の最終的な意図を保持しつつ、フィラーの除去や言い直し(セルフコレクション)の解決のために逐次的に書き換えを行うことでリアルタイム音声認識を洗練させるエージェンティックなフレームワークであるAgenticASRを提案する。

原著者: Zixuan Jiang, Binghao Qiang, Jiaying Chi, Yanqiao Zhu, Kai Yu, Xie Chen

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Zixuan Jiang, Binghao Qiang, Jiaying Chi, Yanqiao Zhu, Kai Yu, Xie Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは友人の話を書き留めようとしていますが、その友人は人間と全く同じように話します。言葉に詰まったり、「えーと」や「あのー」と言ったり、文章を書き始めては間違いに気づき、途中で言い直したりします。もし、その人が発したすべての音をそのまま書き留めると、言い淀みや繰り返しだらけの、乱雑で混乱した書き起こしになってしまいます。これが、従来の音声文字起こし技術が陥っている状況です。それは、メッセージの「意図」ではなく、話し方の「音」を忠実に記録する、非常にリテラルな書記官なのです。一方で、新しいツールの中にはテキストを綺麗にしようとするものもありますが、それらの多くは、人が話し終えるまで待ってから編集を開始します。これでは問題が生じます。例えば、友人が「メアリーの家に……あ、いや、マリーの家に会おう」と言った場合、最後まで待つツールはすでに「メアリー」と書き込んでしまっており、最初からやり直さない限り、修正することができません。この研究の目的は、リアルタイムで耳を傾け、間違いが発生した瞬間にそれを察知し、話し手がまだ次の言葉を発している間に、テキストを即座に修正して、清潔で読みやすいものへと書き換える、超高速で注意深いエディターのようなシステムを構築することです。

この論文は、AgenticASR(エージェンティック音声認識)と呼ばれる新しいアプローチを紹介しています。これは、生放送における二人一組のチームのようなものです。一人目は「書記官」(ASRフロントエンド)で、言い淀みや「えーと」も含めて、聞こえた通りに素早くタイピングします。二人目は「リファイナー(洗練者)」(エージェンティックな部分)で、賢いエディターです。彼は、書記官が打ち込んだ最新の数文を常に注視しています。書記官がテキストの塊(チャンク)を打ち込むとすぐに、リファイナーはその内容を確認し、乱れた部分を修正し、乱れたバージョンを綺麗なものへと入れ替えます。

ここにあるのが魔法のトリックです。リファイナーは現在の文章を見るだけではありません。彼は、直前の数個のテキストの塊を保持する小さな「ウィンドウ(窓)」を頭の中に持っています。もし書記官が「メアリーに会おう」と打ち込み、次のチャンクが「待って、マリー」として入ってきた場合、リファイナーは即座にその繋がりを理解します。彼は最初のチャンクが間違いであったことを見抜き、「メアリー」を削除し、話し手が次の思考を終える前に、文章全体を「マリーに会おう」へと更新します。これにより、システムは音声が停止するのを待つのではなく、自己修正や説明を即座に処理できるのです。

これが実際に機能するかどうかをテストするために、著者らはAASR-Benchという特別な遊び場を作りました。カジュアルな会話、カスタマーサービスへの電話、テクニカルなコーディングセッション、音声検索など、917もの異なるシナリオを含む巨大な障害物コースを想像してください。彼らは、結果を採点するための6,637個の微細で具体的な質問(ルーブリック)を作成しました。これらは、「『えーと』などのフィラーを除去したか?」「名前の綴りを修正したか?」「最終的な意味を正しく保持しているか?」といった項目をチェックするものです。彼らは単にどれだけの単語が合っていたかを見たのではなく、テキストがいかに読みやすく、有用であるかを見ました。

結果は、この「エージェンティック」なアプローチが大きな前進であることを示唆しています。AgenticASRを他のシステムと比較したところ、このシステムは一貫してより綺麗で正確なテキストを生成しました。例えば、特定のセットアップ(Qwen3-ASR-1.7Bと彼らのリファイナーを使用)を用いた場合、システムは彼らの総合ベンチマークで79.95を記録し、次点の優れた手法を余裕を持って上回りました。研究によると、システムは一度に約3つの音声チャンクを見る「ウィンドウ」を持つときに最も効果的であることが分かりました。このウィンドウサイズは、数秒前に起きた修正(「メアリー」から「マリー」への切り替えなど)を捉えるのに十分な大きさであり、かつシステムを高速に保つのに十分な小ささであるという、絶妙なバランス(スイートスポット)でした。

著者らはまた、リファイナーのサイズが重要であることも発見しました。より大きく賢いエディター(40億パラメータのモデル)は、複雑な文章の修正においてわずかに優れた仕事を行いましたが、考えるのに少し時間がかかりました。しかし、たとえ小規模で高速なモデルであっても、最後まで待ってから編集するシステムよりはるかに優れていました。論文は、このシステムが完璧ではないことも強調しています。もし最初の書記官が単語自体を完全に見落とした場合、リファイナーがそれを魔法のように作り出すことはできません。しかし、私たちが実際に話す、フィラーや言い淀み、文章の途中での修正といった「現実世界の乱雑なもの」に対して、AgenticASRは、混沌とした人間の音声の流れを、進行中のまま洗練された物語へと変える、実用的な方法を提示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →