← 最新の論文
💬 NLP

Language Chain in Alignment: Cross-Lingual Ranking Preference Optimization

本論文は、英語の選好知識と階層的なランキング構造を活用することで、大規模言語モデルの多言語におけるアライメント、指示追従、および知識活用能力を大幅に向上させる新しいフレームワークである、Cross-Lingual Ranking Preference Optimization (CRPO) を提案する。

原著者: Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデルは、物語を書き、問題を解決し、人間のような会話を模倣する方法で質問に答えることができる、現代の人工知能のエンジンです。これらのシステムが真に役立つものとなるためには、単に人が何を求めているかを理解するだけでなく、人間の価値観や期待に沿った形で応答しなければなりません。このプロセスは「アライメント(調整)」と呼ばれ、通常、モデルに対して、良い回答と悪い回答の何千もの例を示すことで、モデルが良い方の回答を好むように学習させます。しかし、重大な問題が生じています。これらのモデルは英語においてはこれらのルールに従うことに非常に長けている一方で、他の言語で同じことを求められると、しばしばつまずいてしまうのです。ユーザーが韓国語、インドネシア語、あるいはスワヒリ語で質問をしたとき、モデルは英語で返答したり、文法的には正しいものの意味不明であったり役に立たなかったりする回答を生成したりすることがあります。この格差により、数十億の人々がこれらのツールの持つ潜在能力のすべてにアクセスできず、高品質なAIによる支援が高品質な英語話者に主に限定された特権となっている世界を生み出しています。

高麗大学校の研究者たちは、この格差を埋めるための新しい手法を開発しました。これにより、モデルが英語における強みから学び、その知恵を他の言語に応用できるようになります。「Cross-Lingual Ranking Preference Optimization(交差言語ランキング選好最適化)」と呼ばれる彼らのアプローチは、言語学習を孤立した一連のレッスンとしてではなく、一つのつながった鎖として扱います。モデルに対し、ある言語で最良の回答を選ばせ、また別の言語でも同様に選ばせるという、別々に教えるのではなく、この手法はそれらを結びつける構造化された階層を作成します。例えば、ある生徒が英語では数学が得意だがフランス語では苦戦していることを知っている教師を想像してください。その教師は、二つの科目をゼロから教え直すのではなく、生徒の優れた英語の数学スキルをガイドとして使い、フランス語の概念を理解させる助けにします。同様に、CRPOは、何が良い回答であるかという英語における強固な理解を利用して、他の言語における振る舞いを導き、使用される言語に関わらず回答の質が高い状態を維持するようにします。

核心となる革新は、モデルが回答を比較するように訓練される方法にあります。従来の方法は、多くの場合、一度にわずか二つの選択肢、つまり「良い回答」と「悪い回答」だけを見てきました。この二値的なアプローチは英語にはうまく機能しますが、複数の言語が関与する場合に必要な複雑さを捉えるには不十分です。新しい手法は、四つの選択肢を同時に見ることで、この視野を広げます。それは、「対象言語における良い回答」、「対象言語における悪い回答」、「英語における良い回答」、そして「英語における悪い回答」です。研究者たちは、モデルが対象言語における良い回答を最も価値あるものとし、次に英語における良い回答、次に対象言語における悪い回答、最後に英語における悪い回答という順序で評価することを教える、特定のランキングシステムを設計しました。この構造により、モデルは「正しい言語で話すことも重要だが、コンテンツの質こそがさらに重要である」ということを認識させられます。モデルは、英語での高品質な回答は、対象言語での低品質な回答よりも優れているが、究極の目標は対象言語での高品質な回答を生み出すことである、と学習するのです。

このアイデアを検証するため、研究者たちはこの手法を3つの異なる大規模言語モデルに適用し、利用可能なデータ量が異なる5つの言語(中国語、インドネシア語、韓国語、スワヒリ語、ベンガル語)で訓練を行いました。彼らは、多言語性能を向上させるために以前使われていた標準的な手法と、この新しい手法を比較しました。その結果、新しいアプローチが明確かつ一貫した優位性を示しました。ほとんどすべてのテストにおいて、この手法で訓練されたモデルは、対象言語における指示に従い、有用な情報を提供する能力において優れていました。例えば、データが乏しくモデルが通常苦戦するスワヒリ語やベンガル語で質問に答えるよう求められた際、新しい手法は古い手法よりも大幅に優れた結果を出しました。いくつかのケースでは、その改善は劇的であり、例えばLlama-3モデルを用いたスワヒリ語の設定では、モデルが標準的なベースラインに対して60%を超える勝率を達成しましたが、古い手法はしばそ平準にさえ達しないことがよくありました。

研究では、なぜこの手法がこれほど上手くいったのかについても深く掘り下げました。モデルの内部計算を調査することで、研究者たちは、この新しいアプローチが単に悪い回答を抑制するだけでなく、良い回答の生成を積極的に促進していることを発見しました。言語の問題を修正しようとする従来の試みの多くでは、モデルは間違いを避けることは学習しますが、必ずしも高品質なコンテンツを生み出す方法までは学習していませんでした。しかし、この新しい手法は、正しい言語に対する強い選好を維持しながら、モデルが最善の回答を選択する可能性を高めました。これにより、モデルがどのような言語においても自信を持って役立つコンテンツを生成できる、より安定し信頼性の高いシステムが構築されました。研究者たちはまた、他の言語でモデルを教えることが英語でのパフォーマンスを損なわないことも確認しました。彼らは、モデルが英語においても実際にわずかに性能が向上していることを見出し、この手法が単に焦点を移動させたのではなく、モデルの全体的な理解を強化したことを示唆しました。

この研究は、人工知能を真にグローバルなものにするための重要な一歩となります。モデルの知識が、ある言語から別の言語へと効果的に転移され、パフォーマンスを向上させられることを示すことで、研究者たちは、より包括的なAIシステムを構築するための設計図を提供しました。今回の知見は、高品質な多言語AIへの障壁はデータの不足ではなく、適切なトレーニング戦略の欠如であることを示唆しています。この新しいアプローチによって、英語を話すユーザーとそれ以外の世界との間の格差が埋まり始め、使用する言語に関わらず、高度なAIによる支援がすべての人に提供される未来が開かれます。中国語のような広く話されている言語からスワヒリ語のようなリソースの少ない言語に至るまで、多様な言語におけるこの手法の成功は、解決策が堅牢で拡張可能であることを示しており、あらゆる言語において英語と同じくらい有能な次世代の言語モデルへの道を切り拓いています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →