← 最新の論文
💻 computer science

How Far Can a Single Vector Carry a Language? Mechanistic Limits of Inference-Time Steering for Low-Resource Devanagari Languages

本論文は、大規模多言語モデルにおけるヒンディー語の表現を用いて低リソースのデーヴァナーガリー文字言語(マイティリー語、ネパール語、およびボージュプリー語)を生成するための、推論時ステアリングのメカニズム的限界を調査しており、単一のベクトルシフトによって対象言語への準拠を誘導できる一方で、それが必然的に流暢性の崩壊を引き起こすことを明らかにし、ステアラビリティ(制御可能性)がモデルの能力や語彙の重複ではなく、線形分離可能性によって制約されていることを示している。

原著者: Sumit Yadav, Santosh Giri, Ganesh Gautam

公開日 2026-09-10
📖 1 分で読めます☕ さくっと読める

原著者: Sumit Yadav, Santosh Giri, Ganesh Gautam

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデルは、数十の人間言語で執筆、翻訳、対話を行う多くの現代的なツールの背後にあるエンジンです。これらのシステムは膨大な量のテキストを用いて学習し、単語がどのように組み合わさるかというパターンを認識することで、文中の次の単語を予測することを学びます。これらは非常に強力ですが、公式にサポートされている言語のリストが組み込まれています。ある言語がそのリストに載っていない場合、たとえ同じアルファベットや多くの単語を共有していても、モデルはその言語を未知のものとして扱うことがよくあります。研究者たちは、モデルをゼロから再学習させることなく、これらのモデルにサポートされていない言語を話させるよう促すことができるのではないかと、長い間考えてきました。モデルに新しい事実を教える代わりに、彼らは異なるアプローチを試みました。それは、モデルの内部数学の中に、欠落している言語へと向かう特定の「方向」を見つけ出すという方法です。このアイデアは、モデルの異なる言語に対する理解が、そのデジタルな脳の中にある明確な形状や経路として存在しており、おそらく一度の「押し(プッシュ)」によって、出力を一つの経路から別の経路へとシフトさせることができるという概念に基づいています。

ある研究チームは、南アジア全域で使用されている表記体系であるデバナガリ文字を共有する4つの言語を用いて、このアイデアの限界をテストすることに乗り出しました。ヒンディー語はほとんどの大型モデルでサポートされている主要な言語ですが、マイティリー語、ネパール語、ボージュプリー語は、数百万人に話されているにもかかわらず、公式のリストから漏れがちな、密接に関連した「姉妹」言語です。研究者たちは、シンプルかつ深い問いを立てました。「もし、モデルのヒンディー語に対する内部的な理解を取り出し、それを一つの数学的な押しによって、サポートされていないこれらの姉妹言語の一つへと押し出すことができたら、どこまで到達できるだろうか?」と。彼らはモデルの重みを変更したり、新しいデータを投入したりはしませんでした。代わりに、彼らはテキストを処理する際のモデルの挙動を分析し、ヒンディー語を表現する方法の平均的な「中心」を特定し、それを対象言語の中心と比較しました。これら二つの中心の差が、モデルの内部空間における固定された方向である「ベクトル」を生み出しました。テキストを生成する過程において、彼らはこの方向をモデルの情報流に加えることで、出力をヒンディー語から遠ざけ、対象言語へと導こうとしました。

研究者たちは、モデルの内部構造が「砂時計」のような形をしていることを発見しました。処理の開始時において、異なる言語の表現はそれぞれ明確に分かれています。情報がネットワークの深部へと進むにつれて、これらの経路は共通のコアへと融合し、言語間の区別がつかなくなります。終盤、モデルが最終的な単語を出力する直前になると、経路は再び分離します。驚くべきことに、研究者たちは、言語がまだ融合している最中である「中間セクション」の期間にのみ、モデルを対象言語へと上手く誘導できることを見出しました。一度経路が再び分離して出力に近づくと、この「押し」は効果を失いました。これは、言語が最も明確に異なっている地点こそが、言語を切り替えるのに最も容易な場所であると予想されるため、直感に反する結果でした。実際には、言語が最も混ざり合っている時に、モデルは「押し」に対して最も反応的だったのです。

このステアリング(操舵)技術を適用したところ、結果は成功と失敗が入り混じったものでした。モデルは、ネパール語のような対象言語の正しい語彙や文法マーカーを使用するように押し出すことができました。ある特定のテストでは、モデルは対象言語を話すための高いスコアを獲得し、人間の判定者がそれをほぼネパール語であると認識できるレベルに達しました。しかし、この成功には大きな代償が伴いました。モデルを新しい言語を話すように強く押し進めるほど、流暢に話す能力が失われました。テキストは同じ単語やフレーズを繰り返すループ状態に陥り、文章は崩れたものになりました。研究者たちは、モデルが対象言語を流暢かつ正確に同時に話せる設定は存在しないことを発見しました。「押し」は言語の表面的なアイデンティティを変え、それをネパール語のように見せることはできましたが、流暢な話し手の自然な流れや一貫性を回復させることはできなかったのです。

これが特定のモデルによる偶然の産物やトリックではないことを確実にするため、チームは、対象言語の例をモデルに示してから書かせる「フューショット・プロンプティング(few-shot prompting)」と呼ばれる異なる手法と比較を行いました。この代替手法を用いると、モデルは対象言語で流暢で自然な響きのテキストを生成することができたため、モデルが実際にそれらの言語を話す能力を備えていることが証明されました。これにより、ステアリング手法の失敗は、モデルに知識が欠けているためではなく、複雑な言語状態の間を移動するための、単一の直線的な「押し」を用いることの限界によるものであることが確認されました。また、研究は、開始言語の選択が極めて重要であることも明らかにしました。英語はモデルの学習において支配的な言語であるにもかかわらず、ヒンディー語を起点とする方が英語を使用する場合よりもはるかに上手くいきました。これは、ヒンディー語が対象言語と言語学的に近く、より多くの語彙や構造を共有しているため、両者の間の経路がより短く、ナビゲートしやすかったからです。

本研究は、単一の数学的な方向がモデルの出力を変化させて新しい言語を模倣させることはできるものの、その言語の流暢さを完全に解き放つことはできないと結論付けています。この技術は、言語のアイデンティティがモデルの内部構造のどこで柔軟であるかを明らかにする「プローブ(探針)」としての役割を果たしており、実用的な展開のためのツールではありません。それは、モデルがこれらの言語を話す能力を持っていることを示しましたが、それにアクセスするには単純な「押し」以上のもの、つまりフューショット・プロンプティングが提供するようなコンテキストや例が必要であることを示しました。研究者たちはまた、この手法の有効性は、開始言語が対象言語といかに密接に関連しているかに大きく依存することも指摘しており、ヒンディー語が英語よりもはるかに優れた架け橋となることを明らかにしました。最終的に、この研究は推論時のステアリングにおける可能性の境界をマッピングしており、モデルを新しい言語へと「促す」ことはできても、より実質的な変更やコンテキストなしに、その言語において流暢になるよう強制することはできないことを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →