← 最新の論文
💻 computer science

DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution

本論文は、凍結された大規模言語モデルが、タスク経験と検証器からのフィードバックから相補的な自然言語スキルを進化・選択することで、迅速かつパラメータフリーな自己改善を実現し、既存の推論および最適化手法を凌駕しながら、モデルスケールを超えて効果的に転移することを可能にする、多様性駆動型フレームワークであるDIVEを導入するものである。

原著者: Siheng Xiong, Ali Payani, Oguzhan Gungordu, Faramarz Fekri

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Siheng Xiong, Ali Payani, Oguzhan Gungordu, Faramarz Fekri

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたの周りには、世界のほとんどすべてのことを知っている、ものすごく賢いロボットの友達がいます。あなたは、難しい数学の問題や論理パズルを解いてもらうことができますし、通常は正解してくれます。しかし、ここには一つ落とし穴があります。一度ロボットの電源を切って、再び入れ直すと、そのロボットはあなたとのやり取りから学んだことをすべて忘れてしまうのです。それはまるで、昨日犯した間違いや発見した巧妙なコツを思い出せないまま、毎日真っさらな状態で目覚める天才のようなものです。通常、ロボットをより賢くするためには、その脳を「再配線(トレーニング)」しなければなりません。しかし、このプロセスはコストがかかり、時間がかかり、多くの人が利用できるような特別なアクセス権も必要です。

そこで科学者たちは、大きな疑問を投げかけました。「凍結された(中身が書き換えられない)ロボットは、脳を再配線せずに学習できるのだろうか?」という問いです。その答えは、「プロンプティング」と呼ばれるものの中にあります。ロボットの脳自体を変えるのではなく、与える「指示」を変えるのです。これは、シェフに新しいレシピカードを渡すようなものです。もしカードに「スープに塩を入れるのを忘れないこと」と書いてあれば、シェフはより良い仕事ができるでしょう。しかし、もしシェフが同じ間違いを繰り返しているなら、単なるメモでは不十分かもしれません。シェ夫がなぜ失敗したのかを書き出し、より良い戦略を考え、その戦略を、実際の料理スキル自体は変えずに、レシピカード上の「永続的なルール」へと昇華させる方法が必要なのです。これはAIにおける「自己改善」の最前線です。つまり、静的なモデルに対し、自分自身と対話し、自身の経験から学ぶことで、より賢くなるよう教える技術です。

ここで、DIVE(Diversity-Driven Skill Evolution:多様性駆動型スキル進化)が登場します。これは、凍結されたロボットたちのための、極めて優秀かつ混沌としたワークショップのような手法です。研究者たちは、たった一つの「完璧な」指示を見つけようとするよりも、それぞれが少しずつ異なる方法で学習を進める、異なる「バージョン」のロボットのチームを走らせる方が良いことを発見しました。

DIVEの仕組みを、10人の異なる探偵たちが謎解きに取り組んでいる様子に例えてみましょう。これまでの研究では、一人の探偵に事件を解決させ、ミスをさせ、その後にメモを修正させるという方法が取られがちでした。しかしDIVEは、「では、10人の探偵が同時に事件に取り組もう!」と言います。各探偵は、少しずつ異なる一連のメモ(「シード・スキル」)を持ってスタートします。作業を進める中で、彼らはどこで間違えたのかというフィードバックを受け取ります。

ただ一人の探偵がメモを修正しようとするのではなく、DIVEはさまざまな「修正戦略」のツールボックスを使用します。ある探偵は、ミスを見て「ああ、ここに手がかりを見落としていた。ここに注釈を加えよう」と考える**「内省的修復(Reflective Repair)」を試みるかもしれません。別の探偵は、古い地図を捨てて全く新しい地図を描き直すような「探索的改訂(Exploratory Revision)」を試みるかもしれません。古い道が行き止まりだったために、古い地図を破棄するようなものです。また、第三の探戒は、乱雑な50ページのノートを、最も重要なルールだけを残した簡潔な5ページの参照シートへと凝縮する「圧縮(Compression)」**を行うかもしれません。

DIVEの魔法は、単に「最高の探偵」を選んで終了することではありません。DIVEは10人の探偵全員を並行して働かせ続けます。どの探偵がどのような種類の問題に対して上達しているかを観察し、彼らがより多くの作業時間を取れるようにします。もし探偵が行き詰まったら、システムは新しい新鮮な戦略を持ち込んで助け舟を出します。これにより、グループ全体が同じ間違った考えに陥ってしまうこと(「過学習」と呼ばれる問題)を防ぎます。

探偵たちが学習し、進化する機会を終えたとき、DIVEは単にスコアが最も高い一人を選ぶのではありません。代わりに、チーム全体を見渡し、**「補完的な分隊(complementary squad)」**を選び出します。例えば、探偵Aは数字のパターンを見つけるのが得意で、探偵Bは論理の罠を見つけるのが得意かもしれません。それぞれの進化した「スキルカード」を一つのツールキットとして組み合わせることで、ロボットは以前は解けなかった問題を解けるようになるのです。

論文によれば、この手法は驚くほど効果的です。HMMTのような難しい数学コンテストや、数独のようなトリッキーな論理パズルでテストを行った際、DIVEは小さく凍結されたモデルが迅速に学習し、向上することを証明しました。実際、DIVEの進化したスキルを用いた小さなモデルは、標準的な指示を使用しているはるかに大きく強力なモデルをも凌駕しました。研究者たちは、DIVEが他の手法(脳を書き換えようとしたり、プロンプトを一度だけ微調整したりする方法)よりも、はるかに少ない試行回数(「ロールアウト」)で、これほど大きな改善を実現できることを見出したのです。

決定的なのは、DIVEが、たった一つの「魔法のプロンプト」を探したり、単一の学習経路に頼ったりするよりも優れていると主張している点です。多様で進化し続けるスキルのグループを維持し、それぞれの最良の部分を組み合わせることで、DIVEは凍結されたモデルでも再配線を必要としない、堅牢な自己改善システムを作り上げます。これは、凍結されたモデルにとって、賢くなるための秘訣は単一の完璧な指示ではなく、あらゆる問題を解決するためにモデルが引き出すことができる、多様で進化し続ける戦略のライブラリであるということを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →