Boosting Reasoning in Large Multimodal Models via Activation Replay
本論文は、検証可能な報酬を用いた強化学習(RLVR)によって訓練された大規模マルチモーダルモデルの推論能力を、ベースモデルからの低エントロピーな活性化を再生するために視覚トークンを操作することによって向上させる、学習を必要としない手法である「Activation Replay」を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能が急速に進化する世界において、人間と同じように世界を見て理解することができる新しい世代のコンピュータ・システムが登場しました。これらの大型マルチモーダルモデルは、写真を見たり、動画を視聴したり、図面を読み取ったりした上で、それに基づいた質問に答えたり問題を解決したりすることができます。長年、研究者たちは、これらのシステムに単なるパターンマッチングを超えた、真の推論を行うための深い思考を教えようと試みてきました。これを行うための一般的な手法の一つに、コンピュータが長いステップバイステップの説明を通じて自分の答えが正しいことを証明できたときにのみ報酬を与えるという学習技術があります。このアプローチは、モデルに話す前に立ち止まって考えることを効果的に促し、数学や論理パズルの分野で目覚ましい成果をもたらしてきました。しかし、結果は見えているものの、この学習がモデルの「脳」をどのように変化させるのかという内部メカニックは謎のままです。科学者たちは、特にモデルが初めて画像を見ているときに、この学習が情報の処理方法をどのように変容させているのかを完全には理解していませんでした。
ある研究チームは、モデルが問題を解いている間の内部処理レイヤーを観察することで、これらの隠された変化を明らかにしようと試みました。彼らは、この学習法が効果的である一方で、意図せずモデルの内部的な焦点(フォーカス)を特定かつ予期せぬ方法でずらしてしまうことを発見しました。モデルが自身の答えを検証するように訓練されると、通常は非常に自信に満ち、明確であるはずの内部システムのパーツが、わずかに混乱したり変化したりします。対照的に、自然と不確実であったり、さまざまな可能性を探索したりするシステムの部分は、ほとんど影響を受けずに残ります。研究者たちは、この自信に満ちた部分における特定の変化が、実際にはモデルの正しい推論能力を妨げていることを突き止めました。それはまるで、学習によってモデルが視覚的な世界を理解するために使用していた最も信頼できる信号が、誤ってかき乱され、結論に達するために不確実な経路に頼らざるを得なくなっているかのようでした。
これを修正するために、チームは「アクティベーション・リプレイ(Activation Replay)」と呼ばれるシンプルで新しい手法を開発しました。モデル全体を再学習させることは非常にコストと時間がかかるため、代わりに、モデルが問題を解いている瞬間に、モデルを元のクリアな状態へと優しく押し戻す方法を見出したのです。モデルが画像を与えられると、研究者たちは視覚システムから送られてくる内部信号を一時的に調整します。彼らは、モデルの元々の(学習前の)バージョンから得られる明確で自信に満ちた信号を借り、それを学習済みのバージョンへと再生(リプレイ)することでこれを行います。このプロセスは修正メカニズムとして機能し、モデルが長い推論の連鎖を開始する前に、画像に対する初期の理解が鋭く信頼できる状態であることを保証します。研究者たちは、幾何学問題の解決、高解像度画像内での特定オブジェクトの探索、ビデオ内のイベントシーケンスの推論など、さまざまな複雑なタスクを用いてこのアプローチをテストしました。
結果は、このシンプルな調整が、これらすべての異なるシナリオにおいて一貫してモデルのパフォーマンスを向上させることを示しました。初期の視覚信号の明晰さを回復させることで、モデルは以前は見逃していた問題を解決し、ステップバイステップの論理におけるエラーを回避することができました。ワイヤーを円形にした後に台形に変形させる数学の問題に関する特定のテストでは、学習済みのモデルは当初、中間ステップでミスを犯し、誤った答えを導き出しました。しかし、この新手法を用いることで、モデルは内部の推論経路を修正し、正しい解に到達しました。また、研究者たちは、このアプローチが、複数回の試行を与えられた際にモデルがより多様な正解を生成するのを助けることも発見しました。これは、モデルが単一の経路を暗記しているのではなく、問題をより真に理解していることを示唆しています。この研究は、これらの高度なシステムにおけるより優れた推論の鍵は、必ずしもより複雑な学習にあるのではなく、むしろモデルの初期の知覚の明晰さを維持することにあるかもしれないことを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。