✨ 要約🔬 技術概要
あなたが、数学の問題を解くのが得意だが、非常に硬直した天才的な司書(大規模言語モデル)を持っていると想像してください。彼らは常に同じ道筋で答えにたどり着こうとしますが、その道が行き止まりに終わると、すぐに諦めてしまいます。
長らく研究者たちは、この問題を「特別な、カスタム作成されたメモ(ソフトプロンプトと呼ばれるもの)」で司書を「訓練」し、より良い解決策へと導くことで解決しようと試みました。彼らは、そのメモの「内容」に魔法があると信じていました。
しかし、この論文は異なる問いを投げかけます:もし魔法がメモそのものにあるのではなく、司書が作業を始める前に、単に新しいランダムな紙を渡すという行為そのものにあるとしたらどうでしょうか?
以下は、日常の比喩を用いた彼らの発見「ランダム・ソフト・プロンプト(RSP)」の解説です。
1. 「ランダムノイズ」実験
研究者たちは、特別なメモを訓練する代わりに、完全にランダムで無意味な落書き(ランダムな数値)をいくつか掴み取り、数学問題の先頭または末尾に付け加えました。
驚き: これらの落書きには有用な情報が一切含まれていないにもかかわらず、司書は突然、問題をより良く解き始めるようになりました。場合によっては、慎重に訓練された完璧なメモを与えられた場合と同等のパフォーマンスを発揮しました。
教訓: 改善は何か新しいことを「学習」した結果ではなく、何らかのものを混合する「行為」そのものから生じたのです。
2. 仕組み:「分岐する道」の比喩
司書の思考プロセスを、多くの扉がある廊下を歩くことに例えてみましょう。
ランダムな紙がない場合: 司書はメインの廊下を真っ直ぐ歩き、目にする最初の扉を開けて、その道を進み続けます。もしその道が行き止まりであれば、失敗します。
ランダムな紙がある場合: ランダムな落書きは、廊下の入り口で突然吹く混乱を招く突風のような役割を果たします。
初期段階(分岐): この「風」のおかげで、司書は立ち止まり、普段とは異なる扉に目を向けます。彼らは以前は検討したこともない扉を開けるかもしれません。これにより思考に「分岐」が生まれ、解決策に至る全く異なるルートが生まれます。
後期段階(安定化): 司書がこの新しい道を進むにつれて、「風」(ランダムな紙)は廊下が長くなり、司書の開始時の記憶が薄れるにつれて消えていきます。彼らはこの新しい道で自信に満ちた歩幅で安定します。
3. 「サイコロを振る」効果(Pass@N)
この論文は、同じ問題を 10 回解くよう司書に依頼し、毎回異なるランダムな落書きを与える場合、10 通りの異なるルートが得られることを発見しました。
結果: その 10 のルートのうち 9 つが間違っていたとしても、司書に 10 通りの異なる「出発点」を試させたという事実により、その中から正しいルートを見つける可能性が大幅に高まります。
注意点: もし 10 回の試行すべてで同じランダムな落書きを使用した場合、彼らはすべて同じ間違った道を進んでしまいます。魔法が機能するのは、「風」が毎回変わる場合に限られます。
4. なぜこれが重要なのか
無料です: 何週間もモデルを訓練したり、新しい事実を教えたりする必要はありません。単にランダムなノイズを追加するだけです。
構造的です: この論文は、これらの高度な AI 技術の「魔法」は、トークンの特定の「内容」ではなく、追加トークンを加える「構造」から来ていることを証明しています。パズルのピースが入った箱を振ることで、たとえ振る行為自体がパズルを解くわけではありませんが、正しい隅のピースをより早く見つけるのに役立つのと同じようなものです。
訓練を助けます: 彼らはまた、モデルの訓練(学習)段階でこのランダムな「風」を使用することで、モデルがより速く、より良く学習できることを示しました。これは、コーチが選手が退屈したり、ルーチンに陥ったりしないよう、練習メニューを変化させるのと同様です。
まとめ
この論文は、「ランダム性」が強力なツールであると主張しています。AI の入力にランダムで無意味なベクトルを注入することで、初期段階において答えに至る異なる「道」を探求するように強制します。一度道を選べば、その道を進み続けますが、異なる道から出発したため、いつものルートに固執する場合よりも、目的地に到達する頻度が高くなる可能性があります。実は、何かを「教える」ことと同じくらい、物事を「揺さぶる」ことも効果的であることが判明しました。
技術的サマリー:ノイズから多様性へ:LLM 推論におけるランダム埋め込み注入
問題提起
大規模言語モデル(LLM)の推論に関する最近の研究は、モデルの入力に学習可能な連続的な埋め込みベクトルを挿入して動作を誘導する「ソフトプロンプト」に焦点を当てています。これらの手法(Prefix-Tuning、SoftCoT、LTPO など)は性能向上を示していますが、重要な曖昧さが残っています:その改善は、最適化されたベクトルの「学習された内容」によって引き起こされるのか、それとも「注入という構造的行為」そのものによるものなのでしょうか?先行研究は向上を学習された表現に帰因していますが、理論的制約は、ソフトプロンプトがコンテンツトークン間の相対的注意パターンを変化させることなく、固定された方向に注意をバイアスするに過ぎないことを示唆しています。さらに、既存の手法はドメイン固有のトレーニングを必要とし、ハイパーパラメータに敏感であり、その有効性に対する統一的な理論的説明を欠いています。
手法:ランダムソフトプロンプト(RSP)
学習された内容と注入行為の寄与を分離するために、著者は「ランダムソフトプロンプト(RSP)」を提案します。RSP は、学習不要な介入であり、入力にランダムな埋め込みベクトルのシーケンスを付加するものです。
構築 :RSP ベクトルは、事前学習済みトークン埋め込みテーブルの要素ごとの平均(μ E \mu_E μ E )と分散(σ E \sigma_E σ E )に適合した等方性ガウス分布から独立にサンプリングされます。h j ∼ N ( μ E 1 d , σ E 2 I d ) h_j \sim \mathcal{N}(\mu_E \mathbf{1}_d, \sigma_E^2 \mathbf{I}_d) h j ∼ N ( μ E 1 d , σ E 2 I d )
メカニズム :この手法は、2 つの理論的フェーズに依存します:
探索(初期デコーディング) :キー・バリュー(KV)キャッシュが短い場合、ランダムトークンに割り当てられる注意質量(w w w )は有意です。RSP は等方的であるため、隠れ状態をすべての方向に攪乱し、トップ-K トークン予測をシフトさせ、ベースラインとは異なる多様な推論軌道を開く可能性があります。
焼きなまし(後続のデコーディング) :自己回帰生成が進むにつれて、KV キャッシュは成長します。理論的解析(定理 1)は、固定長 RSP シーケンスに割り当てられる注意質量の上限が、実トークンの数(n n n )の増加とともに単調に減少することを示しています。その結果、RSP の影響は自然に希釈され、モデルが単一の完了経路にコミットすることを可能にします。
実装 :RSP は、デフォルトとして「サフィックス」、プレフィックス、またはインフィックスとして注入されます。重要なのは、これらが推論ロールアウトまたはトレーニング軌道のそれぞれに対して「新たに再サンプリング」され、独立性が保証されることです。
主な貢献
注入効果の分離 :RSP は、ソフトプロンプト注入の構造的効果を研究するための統一的なレンズを提供します。トレーニングステップを完全に排除することで、著者は、最適化されたソフトプロンプトと同等の精度を、ランダムベクトルの注入行為単独で誘起し得ることを実証しています。
理論的および経験的検証 :本論文は、KV キャッシュの成長に伴う注意質量の減衰(定理 1)と、等方的なカバレッジが多様な分岐状態への到達性を保証する方法を示す理論的枠組みを確立しています。経験的には、RSP は学習パラメータなしで、最適化された手法(LTPO、SoftCoT、TTSV)の初期デコーディングエントロピーの署名を再現します。
トレーニングへの拡張 :著者は、RSP を推論から「DAPO」(強化学習トレーニングアルゴリズム)へ拡張し、ロールアウト中の独立した RSP 再サンプリングが、損失レベルの多様性保持と組み合わさってさらなる性能向上をもたらすことを実証しました。
実験結果
著者は、Qwen2.5-Math や LLaMA-3.1 などのモデルを使用して、数学的推論ベンチマーク(MATH-500、GSM8K、AIME24)上で RSP を評価しました。
精度の向上 :RSP はトレーニングなしで、最適化されたソフトプロンプト(TTSV、SoftCoT、LTPO)と同等かそれ以上の精度を達成します。特に、ChatML テンプレートをそれ用にトレーニングされていないベースモデルに適用する「フォーマット不整合」シナリオにおいて、RSP は有意な精度回復を実現しました(例:MATH-500 における Qwen2.5-Math-1.5B で +29.0 パーセントポイント)。
多様性と Pass@N :
トークンレベル :RSP は最初のトークン分布に明確なシフトをもたらします(温度スケーリングの 1.0 に対し、スピアマンの ρ = 0.709 \rho = 0.709 ρ = 0.709 )、ベースラインのトップ 10 トークンを超えたサポートを拡大します。
軌道レベル :RSP は、グループ内の整合性を維持しながら、意味的に多様な推論経路(より高いクラスター間距離)を生成します。
結果レベル :Pass@N (N N N 回の試行で少なくとも 1 つの正解が得られる確率)は、独立した再サンプリング とともに大幅にスケーリングします。サンプル間で単一の RSP を共有しても向上は見られず、多様性が固定された攪乱ではなく、確率的注入に由来することを確認しました。
トレーニング統合 :DAPO トレーニングにおいて、ロールアウトに RSP を追加した結果、ピーク平均精度が向上し(DAPO 単独の 53.20% に対し 54.36%)、性能低下が遅延しました。これは、探索と利用のダイナミクスが改善されたことを示唆しています。
意義と主張
本論文は、「学習された」ソフトプロンプトに帰せられる成功の相当部分は、実際には「注入メカニズムそのものの構造的副産物」であると主張しています。入力層でランダムな等方性攪乱を導入する行為は:
初期段階のトークン多様性を引き上げ 、標準的な温度スケーリング(ランク順序を保持する)ではアクセスできない推論軌道の探索をモデルに可能にします。
生成が進むにつれて自動的に減衰 し、ランダムノイズが最終的な回答を不安定化することを防ぎます。
学習された内容が推論改善の主要な駆動力であるという先行研究の仮定の限界を明らかにする対照実験 として機能します。
著者は、RSP が、フォーマット整合性が悪い場合や、RL ベースのトレーニングにおいて独立した軌道探索が重要な場合に、推論の多様性と精度を高めるためのシンプルで学習不要な代替手段を提供すると結論付けています。彼らは、層ごとの減衰の理論的説明や非数学的タスクへの適用性に関する限界を指摘し、この作業を配備されたソリューションというよりも、注入ダイナミクスに関する基礎的分析として位置付けています。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×