← 最新の論文
💻 computer science

Perturb the Thought, Not the Pixels: Latent-Space Rollout Diversification for Reinforcement Learning of Vision-Language Models

本論文は、ピクセルではなく潜在空間に校正されたノイズを注入することで、視覚言語モデルの強化学習におけるロールアウトを多様化させ、最小限の実装コストを維持しつつ、分布外推論能力とハルシネーションへの堅牢性を大幅に向上させる手法であるNoise-Contrastive GRPO (NC-GRPO) を導入するものである。

原著者: Michael Jerge, Joseph Pelczar, Justin Downes

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Michael Jerge, Joseph Pelczar, Justin Downes

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

画像を見て質問に答えたり、言葉で書かれた数学の問題を読んで解いたりできるコンピュータを想像してみてください。これらのシステムは「ビジョン・ランゲージ・モデル(視覚言語モデル)」として知られ、ますます能力を高めていますが、依然として間違いを犯します。時には、十分に深く考えられていないために答えを間違えることもありますし、また別の時には、自信満々に事実とは異なることを述べてしまうこともあります。これは「ハルシネーション(幻覚)」と呼ばれる問題です。これらのモデルに、より良く考えさせる方法として、研究者たちは「強化学習」と呼ばれる手法を用いています。このプロセスでは、モデルに対して単一の問題を解くための多くの異なる試行を生成させます。もしいくつかの試行が正解で、他の試行が不正解であれば、モデルは成功した経路を好むように学習します。しかし、この学習が機能するためには、異なる試行が互いに異なっている必要があります。もしモデルが同じ思考プロセスを何度も繰り返すだけなら、新しいことは何も学べません。

課題は、いかにしてモデルに異なる思考の道を探索させるかということでした。伝統的に、研究者たちはコンピュータの意思決定プロセスの「温度」を変えたり、写真にノイズを加えるような画像のわずかな歪みを与えたりすることで、状況を変化させようとしてきました。Amazon Web Servicesの研究者による新しい研究は、これらの外部的な変化が、モデルの思考を多様化させるための最も効果的な方法ではない可能性を示唆しています。代わりに彼らは、モデルが問題を処理し始めるまさにその瞬間に、モデル自身の内部表現の中で変化が起こるべきだと提案しています。モデルが回答を生成し始める前に、モデルの隠れた精神状態に、制御されたごくわずかなランダムなノイズを注入することで、より堅牢で正確な思考主体を作り出せることを見出したのです。

研究者たちは、「ノイズ・コントラスティブ・グループ・レラティブ・ポリシー・オプティマイゼーション(Noise-Contrastive Group Relative Policy Optimization)」と呼ぶ技術を開発しました。これがどのように機能するかを理解するために、一団の生徒たちが皆、同じ幾何学の問題を解こうとしている場面を想像してください。標準的なトレーニングセッションでは、各生徒は偶然によって解き方がわずかに異なるかもしれませんが、彼らは皆、問題に対する全く同じ理解からスタートします。この新しいアプローチでは、半数の生徒に少し異なる出発点が与えられます。研究者たちは、モデルの内部状態(モデルが問題をどのようにその「心」の中に符号化したか)を取り出し、グループの半分に対して小さなランダムな衝撃を加えます。この衝撃は、画像自体への変更でもなければ、ページ上の言葉への変更でもありません。それは、モデルの内部的な視点の微妙な変化であり、まるで生徒に対して、書き始める前に問題を少し異なる角度から見るように求めるようなものです。

その後、モデルはこれら2つのグループから回答を生成します。一つは通常のクリーンな理解から始まるグループ、もう一つは、このわずかにずれたノザイ(ノイズを含んだ)理解から始まるグループです。鍵となる洞察は、モデルがその結果からどのように学ぶかにあります。もし、最初に導入された混乱にもかかわらず、ノイズのある出発点を持つグループが正解にたどり着いた場合、モデルには報酬が与えられます。もしノイズによってモデルが脱線し、失敗した場合、その経路にはペナルティが課されます。時間をかけて、モデルは、出発点が多少不安定であっても機能するほど強固な解決策を見つける方法を学びます。それは単に答えを学んでいるのではなく、自身の思考プロセスにおける小さな乱れに対しても堅牢である方法を学んでいるのです。

この実験の結果は驚くべきものでした。研究者たちは、幾何学の問題を学習させた大規模なビジョン・ランゲージ・モデルを用いてこの手法をテストしました。この新しい手法を、標準的な手法や、入力画像を歪ませるという古い手法と比較したところ、新しい手法は、未学習の難しい数学問題に対して著しく優れた結果を出しました。モデルは、見たことがない問題を解く能力、すなわち「ドメイン外推論」において向上しました。おそらくさらに驚くべきことに、モデルはハルシネーションを回避することにも長けていました。画像の歪みを利用する古い手法は、モデルが視覚的な詳細をより明確に捉える助けにはなりましたが、時にはモデルが事実に固執することを妨げることもありました。対照的に、この新手法は、モデルの推論能力と誠実さの両方を同時に向上させたのです。

この研究では、具体的に何がこのテクニックを機能させているのかについても調査されました。研究者たちは、恩恵がノイズの特定の方向性によるものなのか、それとも単にノイズがランダムであることによるものなのかをテストしました。その結果、方向は重要ではないことがわかりました。ノイズがモデルの思考を一方向に押し進めようと、あるいは別の方向に押し進めようと、決定的な要因は、各試行がユニークで独立した視点から始まるという点にありました。また、ノイズの大きさが「ダイヤル」のように機能することも発見しました。少量のノイズは、一般的な能力を損なうことなく推論能力を向上させましたが、ノ々すぎるノイズは全体的なパフォーマンスを低下させ始めました。これは、モデルが一般的な知識を失うことなく、より優れた専門家になるための「スイートスポット(最適値)」が存在することを示唆しています。

最も重要な発見の一つは、この手法が画像やテキストを変更するのではなく、モデルの内部状態を変更することによって機能するという点です。これは、このテクニックが画像を見るモデルだけでなく、情報を処理するあらゆるタイプのモデルに適用できる可能性があることを意味します。研究者たちは、この手法が効率的であり、モデルを実行するソフトウェアへの変更はわずかであり、回答を生成するプロセスを遅らせることもないことを示しました。データを受け取る側ではなく、モデルが思考を開始する瞬間に焦点を当てることで、彼らはモデルの推論をより信頼性が高く、エラーが少ないものにする方法を見出したのです。

研究では、このアプローチが異なるサイズのモデルに対して機能するかどうかについても調査が行われました。研究者たちが同じテクニックをより小さなバージョンのモデルに対して試したところ、その恩恵は消失しました。小さなモデルは推論能力が向上することも、悪化することもなく、単に変化しませんでした。これは、このテクニックが効果を発揮するためには、モデルにある程度の複雑さが必要であることを示唆しています。これはどんなコンピュータにも効く魔法のトリックではなく、より大規模でより有能なシステムが思考を洗練させるための特定のツールなのです。研究者たちは、結果は有望であるものの、現時点では一つのモデルファミリーに対してのみテストを行っており、他のモデルでも機能するかどうかを確認するにはさらなる研究が必要であると慎重に述べています。

結局のところ、この研究は、人工知能の訓練方法についての新しい考え方を提示しています。入力データをより多様にしたり、意思決定プロセスをより混沌としたものにしたりする代わりに、研究者たちは、精密な内部的な摂動(揺さぶり)が、より安定した知的な結果をもたらすことを発見しました。出発点が多少ずれていても成功するように教えることで、彼らは、自身の不確実性に惑わされることの少ないシステムを作り上げました。このアプローチは、モデルを数学に強くするだけでなく、モデルをより信頼できるものにし、確かな答えと自信に満った推測を区別できる能力を与えます。これらのシステムが私たちの日常生活に統合されるにつれ、それらをより堅牢にし、エラーを減らす方法を見つけることは不可欠であり、この研究はその目標を達成するための明確な道筋を示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →