← 最新の論文
💻 computer science

Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ Languages

本論文は、70億パラメータの自己教師あり学習アーキテクチャと大規模かつ多様な訓練コーパスを活用することで、500以上の未対応言語を含む1,660以上の言語をサポートし、コミュニティが最小限のデータで新しい言語にシステムを容易に適応させることを可能にする、スケーラブルでオープンソースの音声認識モデルファミリーであるOmnilingual ASRを紹介するものである。

原著者: Marta Costa-jussa, Omnilingual Team, Gil Keren, Artyom kozhevnikov, Yen Meng, Christophe Ropers, Matthew Setzler, Skyler Wang, Ife Adebara, Michael Auli, Can Balioglu, Kevin Chan, Chierh Cheng, Joe Ch
公開日 2026-07-30
📖 1 分で読めます☕ さくっと読める

原著者: Marta Costa-jussa, Omnilingual Team, Gil Keren, Artyom kozhevnikov, Yen Meng, Christophe Ropers, Matthew Setzler, Skyler Wang, Ife Adebara, Michael Auli, Can Balioglu, Kevin Chan, Chierh Cheng, Joe Chuang, Caley Droof, Mark Duppenthaler, Paul-Ambroise Duquenne, Alexander Erben, Cynthia Gao, Gabriel Mejia Gonzalez, Kehan Lyu, Sagar Miglan, Vineel Pratap, Kaushik Ram Sadagopan, Safiyyah Saleem, Arina Turkatenko, Albert Ventayol-Boada, Zheng Xin Yong, Yu-An Chung, Jean Maillard, Rashel Moritz, Alexandre Mourachko, Mary Williamson, Shireen Yates

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、どんな言語を話す人であっても、その言葉を即座に理解し書き留めることができる魔法の翻訳機を持っています。長い間、この魔法は英語やスペイン語、マンダリン語のような最もポピュラーな言語にしか機能しませんでした。もしあなたがより小さく、あまり一般的ではない言語を話すと、翻訳機はただぼんやりと見つめるか、あるいはデタラメに推測するだけでした。これが、音声認識(ASR)と呼ばれる技術の世界です。これは、会話を聞いてそれをテキストとして打ち出す、超高速の書記官のようなものだと考えてください。大きな課題は、世界には7,000以上の言語があるにもかかわらず、ほとんどのこれらの書記官は、そのごくわずかな一部しか知らないということです。新しい言語を学ぶには、通常、膨大な量の録音された会話のライブラリと、コンピュータに教えるための専門家チームが必要であり、それはコストがかかり、時間がかかります。しかし、もしすべての言語がどのように機能するかという「パターン」を学習できる書記官を作ることができたら、どうでしょう。そうすれば、わずか数文を聞くだけで、新しい言語をほぼ瞬時に習得できるはずです。これこそが、この論文が取り組んでいる大きな問いです。つまり、いかにして、一部の「大きな」言語を話す人々だけでなく、すべての人にとって公平でアクセシブルな音声技術を作るか、という問いです。

ここで、Metaによる新しいオープンソースプロジェクトである「Omnilingual ASR」が登場します。これは、1,600以上の言語を話すように設計された、超強力なポリグロット(多言語話者)の書記官のようなものです。チームは単にコンピュータにより多くの単語を教えようとしたのではありません。彼らは、AIによってこれまで一度も聞き届けられたことのないコミュニティからの録音を含む、膨大な音声データから学習した、巨大で多様な「脳」を構築したのです。彼らは、強力なコンピュータ用の巨大で超高精度なバージョン(70億パラメータ)と、シンプルなスマートフォンでも動作する、小さくて軽量なバージョン(3億パラメータ)という、異なるサイズのシステムを作成しました。最もエキサイティングな部分は、コンピュータが一度も見たことがない言語をどのように扱うかという点です。新しい言語を学ぶためにデータという名の図書室全体を必要とする代わりに、このシステムは、誰かが話し、書いているわずか「10個の短い例」から学ぶことができます。それは、マスターシェフに新しい果物の写真と、その果物を使った料理のレシピを見せるようなものです。すると突然、彼らはその果物を千回も味わう必要なく、その料理を作ることができるようになるのです。

研究者たちは、この新しいシステムが、特にデータの極めて少ない言語において、ゲームチェンジャーであることを発見しました。テストを行った際、このモデルは1,200以上の言語に対して、10%未満の「文字エラー率」(どれだけ多くの文字を間違えたかを測定するスコア)を達成しました。実際、500以上の言語において、これは音声システムがそれらを書き起こすことができた初めてのケースです。この論文は、彼らの新しいモデルが、WhisperやUSMといった従来のチャンピオン、特にそれらの希少な「ロングテール」の言語において、いかに優れているかを示しています。古いシステムはこれらの言語で混乱して失敗してしまいますが、Omnilingual ASRは冷静さを保ちました。彼らはまた、もし特定の非常に小さな言語に対してシステムをさらに良くしたいのであれば、非常に少ない計算能力とわずか数時間のデータを用いて、巨大なモデルに匹敵する結果を得るために、それらをファインチューニングできることも発見しました。

しかし、論文は、これがすべてを完璧に解決する魔法の杖ではないことにも注意深く言及しています。システムはまだ学習段階にあり、未知の言語をわずかな例だけで扱うことはできますが(「ゼロショット」能力)、膨大なデータを用いてその言語のために特別に訓練されたシステムほどには性能を発揮できません。著者らは、医療や法律の書き起こしのような最も重要な用途においては、人間が依然として作業をダブルチェックすべきであると示唆しています。彼らはまた、このテクノロジーはコミュニティが自らの言語を保存し、独自のアーカイブを構築するためのツールであり、人間の話し手を置き換えたり、画一的な解決策を強制したりするためのものではないことを強調しています。彼らは、すべてのコードとデータを無料で公開することで、世界中の研究者やコミュニティがこのパーティーに参加することを呼びかけ、あらゆる言語がデジタル世界において声を上げられる未来を築きやすくしたいと考えています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →