Verifier-Induced Support Reshaping in On-Policy Optimization
本論文は、検証可能な報酬を伴うオンポリシー強化学習(RLVR)が、即時的なタスク性能を向上させる一方で、意図せず「検証器によるサポートの再形成(verifier-induced support reshaping)」を引き起こし、それによって方策が出力分布を狭め、将来の目的のための成功した軌跡がサンプリングするには稀すぎる状態に陥ることで、長期的な学習能力および共同能力を損なうことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、非常に賢いロボットに、役に立つアシスタントになるよう教えていると想像してください。単に事実を知っているだけでなく、ルールに従い、難解な数学問題を解き、コードを書けるようにしたいと考えています。これを行うために、科学者たちは「強化学習」と呼ばれる手法を使います。これは、ロボットがさまざまな答えを試し、「検証器(厳格な審判)」からスコアを受け取り、高得点の動きを繰り返すように学習するというゲームのようなものです。大きな期待は、数学、次に文章作成、次にコーディングといった具合に、一つのスキルを一つずつ教えることができる(つまり、古いことを忘れたり混乱したりすることなく)ことです。これが「継続学習」の夢であり、ステップバイステップで、より優れたものへと進化していくロボットを構築することです。しかし、もし一つのことに完璧になるようロボットを教える行為そのものが、図らずも次のことを学ぶための扉を閉ざしてしまうとしたらどうでしょう? もし、ロボットが指示に従うことに習熟しすぎた結果、ステップバイステップで考える方法を忘れてしまったり、あるいはその逆が起きたりしたらどうなるでしょうか?
この論文は、「検証器によるサポートの再形成(verifier-induced support reshaping)」と呼ばれる巧妙な問題について調査しています。研究者たちは、厳格な審判を用いて特定のタスクに優れたAIを訓練すると、AIは単にそのタスクに上手くなるだけでなく、後の他のタスクを学ぶことを非常に困難にするような形で、実はその「性格」を変えてしまうことを発見しました。それは、犬に「座れ」と言った時にだけ座るように訓練した結果、誤って「座れ」という言葉だけが重要であると教えてしまったようなものです。後で「待て」を教えようとしても、脳が他のすべてを無視するように作り替えられてしまったため、犬は混乱してしまうかもしれません。この論文は、これが単にロボットが古い技を忘れる(「破滅的忘却」と呼ばれる既知の問題)ことではなく、正しい種類の答えを非常に稀なものにしてしまい、訓練プロセスがそれを見つけられなくなる問題であることを示しています。たとえロボットが数学問題を解く能力を依然として持っていたとしても、異なる回答スタイルに慣れてしまったために、正しい方法で問題を解こうとするのをやめてしまう可能性があるのです。
研究者たちは、二種類の異なるタスク(数学問題の解決と、厳格な執筆指示への追従、例えば「正確に50語で書く」や「箇条書きを使用する」など)を用いて、二種類のAIモデルを訓練することでこれをテストしました。彼らは、あるグループを数学の達人に、別のグループを指示追従のプロに訓練しました。そして、審判を入れ替えて何が起こるかを確認しました。
以下に、彼らの発見を記します:
数学から指示への罠
AIをまず数学の天才として訓練した場合、平均的には指示に従う能力は向上しました。しかし、奇妙なことが起こりました。AIが非常に「極端(偏極)」になったのです。指示を完璧に正しく実行するか、あるいは完全に間違えるかのどちらかであり、「中間的な」試行がほとんどなくなりました。以前のAIは、正解に近い様々な方法を試していたかもしれませんが、数学の訓練後、AIはそれらの中間的な経路を試すことをやめてしまいました。これは、指示タスクにおいて、もしAIに多くの回答を試行させたとしても(例えば32回試行させるなど)、成功する回答を見つける確率が低くなることを意味します。数学の訓練によってAIの焦点が絞られすぎたため、新しい指示追従のテクニックを学ぶために必要な「サポート(試行の多様性)」を探索することを止めてしまったのです。
指示から数学への罠
逆のパターンはさらに興味深いものでした。AIをまず指示追従者として訓練すると、AIは数学問題への答え方を変え始めました。ステップバイステップで思考過程を示す(例:「まず、2と2を足すと……」)代わりに、AIは答えへ直接ジャンプするようになりました(例:「答えは4です」)。研究者たちはこれを、「意図的な推論の開始(Deliberate Reasoning Initiation: DRI)」から「直接回答の開始(Direct Answer Initiation: DAI)」への移行と呼んでいます。
この変化は重大でした。AIがステップを飛ばし始めると、たとえAIがまだ数学を知っていたとしても、正しい答えを見つけることが非常に困難になりました。実際、AIが直接回答へとジャンプすればするほど、複数の試行をサンプリングした際の成功率は低下しました。「サポート」、つまり正しい数学の答えを見つけるための領域が縮小したのです。
「最初のトークン」の秘密
研究者たちは、なぜこのようなことが起きているのかを深く掘り下げました。彼らは、この変化が、文の後半で数学を忘れることによるものではないことを突き止めました。変化は、AIが最初に入力する「最初の単語」で起きていたのです!
実は、数学の「検証器」は「さて」「手順を説明しましょう」といった言葉で始めることを促し、一方で指示の「検証器」は「答えは」「以下に」といった言葉で始めることを促します。一度AIが「答えは」で始めることを学習すると、思考ステップをスキップする経路にロックされてしまいます。研究者たちは、指示追従として訓練されたAIに対して、強制的に「数学的」な言葉で始めるようにさせることで、この事実を証明しました。そうすると、AIの数学の解法を見つける能力は劇的に改善しました。これは、AIが数学の脳を失ったのではなく、単に「悪いオープニングムーブ(初手)」の習慣に陥っていたことを示唆しています。
解決できるのか?
チームはこの問題の解決を試みました。AIに常に正しい言葉で始めるよう「事前学習(DRIプライア)」を行いましたが、これは問題を先送りにしただけで、最終的にはAIはやはり直接回答スタイルへと切り替わってしまいました。また、「オンポリシー蒸留(on-policy distillation)」という、生徒AIが教師AIを模倣する手法も試しましたが、これは教師を非常に慎重に選ばなければ機能しませんでした。もし教師がすでに「悪い習慣」を学習していた場合、生徒もそれをコピーしてしまうからです。
結論
本論文は、単にAIを一つのタスクにおいて優れたものにすることが、次のタスクへの準備ができていることを保証するわけではない、と結論付けています。実際、ある領域での向上は、次の領域における「探索空間」をあまりにも小さくしてしまい、AIが正しい答えを見つけられなくなることがあります。数学や指示追従における成果は、必ずしも「正解であり、かつルールに従っている」という両方の条件を満たす答えには結びつきません。これはAI開発者への警告です。モデルが今日、あるテストで高いスコアを出したとしても、それが将来の学習への扉を閉ざしていないとは限らないのです。AIの柔軟性を保つためには、単に今スコアが高いものだけでなく、幅広い「オープニングムーブ(初手)」の選択肢を保持し続けられるようにする必要があります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。