← 最新の論文
💬 NLP

One Form to Transfer Them All: Pretraining Multilingual Language Models Beyond Native Orthography

本論文は、多言語言語モデルの事前学習において、ネイティブの正書法やIPAではなく、ローマ字表記を用いたテキストを用いることが、多様な表記体系間におけるクロスリンガルな知識転移を大幅に向上させることを示しており、ローマ字化が事後的な適応策ではなく、事前学習における中核的な設計上の選択肢とされるべきであることを示唆している。

原著者: Muge Zhang, Aaron Jencks, Krishna Badikela, Yulia Tsvetkov, Sachin Kumar

公開日 2026-08-27
📖 1 分で読めます☕ さくっと読める

原著者: Muge Zhang, Aaron Jencks, Krishna Badikela, Yulia Tsvetkov, Sachin Kumar

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

単一のコンピュータプログラムが、地球上のあらゆる言語を等しく流暢に読み、書き、理解できる世界を想像してみてください。これは、近年驚異的な進歩を遂げている分野である、多言語人工知能(AI)が約束する未来です。これらのプログラムは、膨大な量のテキストを読み込み、文法と意味のパターンを吸収することで学習します。その仕組みの鍵となるのは、単語の断片、すなわち「サブワード」の共有辞書であり、これにより異なる言語間の類似性を認識できるようになります。英語とスペイン語のように、二つの言語が同じアルファベットを使用している場合、それらは自然に多くの断片を共有するため、コンピュータが一方から他方へと知識を転移させることは容易です。しかし、世界はロシア語のキリル文字、ヒンディー語のデーヴァナーガリー文字、あるいはウルドゥー語のアラビア文字のように、全く異なる表記体系を用いる言語に満ちています。これらのスクリプト(文字体系)が重なり合わないとき、コンピュータの共有辞書は崩壊し、ある言語から別の言語を助けるための学習能力は消失してしまいます。この障壁は、真に普遍的な言語モデルを構築する上での長年の障害となってきました。

この問題を解決するために、研究者たちは異なる表記体系を共通の形へと強制的に変換しようと試みてきました。一つのアプローチは、テキストを人間の音声を表す普遍的な記号のセットである国際音声記号(IPA)に変換することです。もう一つのアプローチは、テキストを英語などで使われるラテン文字(ローマ字)へと翻字すること、つまり、あらゆる言語を単一の共有されたスクリプトへと書き換えることです。これらの手法は小規模な実験では有望な結果を示してきましたが、ゼロから大規模で強力なモデルを構築する際に、どちらのアプローチが真に優れているのか、あるいはモデルの学習後に単にテキストを変換するだけで十分なのかどうかは、依然として不明なままでした。オハイオ州立大学とワシントン大学の研究チームは、4つの言語家族にまたがる8つの異なる言語を扱うように設計された一連の言語モデルを構築・テストすることで、これらの問いに答えようとしました。

研究者たちは、英語とスペイン語、ロシア語とポーランド語、ヒンディー語とウルドゥー語、そしてタミル語とマラヤーラム語という、8つの言語を用いた制御された実験を構築しました。これらのペアは、言語間の関係性が混在するように選ばれました。つまり、スクリプトを共有しているものもあれば、音は似ているが表記体系が完全に異なるものもあります。彼らは、約4億6700万から10億以上のパラメータに及ぶ3つの異なるサイズについて、それぞれバージョンの言語モデルを構築しました。各サイズにおいて、一つは元のネイティブスクリプトで、二つ目は国際音声記号に変換されたテキストで、そして三つ目はラテン文字に変換されたテキストで学習させたモデルを作成しました。決定的なのは、データ量、コンピュータのアーキテクチャ、および学習時間をすべて同一に保ったことです。これにより、表記体系そのものがモデルの学習能力や知識転移能力に与える影響を分離して検証することができました。

結果は衝撃的かつ明快でした。ラテン文字に変換されたテキスト(ローマ字化されたもの)で学習したモデルが、あらゆるテストにおいて他のモデルを一貫して上回りました。質問に答える、文章の意味を理解する、あるいはニュース記事を要約するといったタスクのいずれにおいても、ローマ字化モデルは一つの言語から別の言語への知識転移において最も強い能力を示しました。この優位性は、モデルが大きくなるにつれて拡大しました。音声記号で学習したモデルも、ほとんどの場合において元のスクリプトで学習したモデルよりは優れた性能を示しましたが、一般的にはローマ字化モデルには及びませんでした。唯一の例外はヒンディー語とウルドゥー語のペアでした。これら二つの言語は音の面ではほぼ同一ですが、表記体系が全く異なるため、音声的なアプローチが非常にうまく機能し、ローマ字化モデルの性能に匹意しました。しかし、モデルが一度も見たことのない言語に対してテストを行った際、ローマ字化のアプローチが最も堅牢であることを示しました。

おそらく最も驚くべき発見は、この分野でよく用いられる戦略に関するものでした。それは、ネイティブスクリプトで学習済みのモデルを取り出し、後からローマ字化されたデータで微調整(ファインチューニング)するという手法です。多くの研究者は、これが効率的な近道であり、モデル全体を再学習させるコストをかけずにローマ字化の恩恵を得られると考えていました。しかし、研究の結果、事実はその逆であることが判明しました。このショートカットをモデルに適用すると、そのモデルがすでに知っている言語に対する性能が大幅に低下したのです。この介入が効果を発揮したのは、モデルが事前に接したことのない言語を扱う場合のみであり、それでも、最初からローマ字化されたテキストでモデルを学習させた場合と比較すると、その改善はわずかなものでした。このことは、ローマ字化の利点が単に出力の形式に関するものではなく、初期の学習フェーズにおける言語の根本的な構造の学習方法に関わっていることを示唆しています。

研究チームはまた、これら異なる表記体系の効率性についても調査しました。タミル語やマラヤーラム語のような複雑なスクリプトを使用する言語は、ラテン文字を使用する言語と比較して、同じ量のテキストを表現するために、はるかに多くのコンピュータ・トークンを必要としました。これは、元のスクリプトでの学習が、言語間の学習において困難であるだけでなく、コストも高く、速度も遅いことを意味していました。音声的なアプローチとローマ字化のアプローチの両方がこのテキストを圧縮し、これらの言語のコストと速度を他の言語と同等のレベルに引き上げました。この圧縮効果と、異なるスクリプト間での知識共有能力の向上を組み合わせることで、ローマ字化のアプローチが、多様な表記体系にまたがる多言語モデルを構築するための最も効果的な設計選択となりました。

結局のところ、この研究は、人工知能が世界の多くの言語間の隔たりを真に埋めるためには、テキストをどのように表現するかという選択が、些細な技術的詳細ではなく、根本的な設計上の決定事項であることを示しています。証拠が示唆しているのは、多様なスクリプトを共通のラテン形式に変換してからモデルを学習させることが最良の結果をもたらし、システムが言語の境界を越えて機能する統一された構造を内面化することを可能にするということです。テキストを音声記号に変換することは、音が似ていて見た目が異なる言語に対していくらかの利点を提供しますが、統一されたスクリプトの利点に取って代わるものではありません。今回の知見は、構築されたモデルを後から調整するだけでは不十分であるという考えに異を唱え、代わりに、デジタルな知性が世界を読み取る方法について、事前の、意図的な戦略が必要であることを指し示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →