← 最新の論文
🤖 AI

Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher

本論文は、ハイブリッド・モードの強化学習を利用してプロポーザー(提案者)、ソルバー(解決者)、およびジャッジ(判定者)を協調的に進化させるHybrid Open-Ended Tri-Evolution (HOTE) フレームワークを提案しており、これにより8Bモデルが、オープンエンドなタスクにおいて、時間オーバーヘッドを削減しつつ、より大規模な静的モデルや最先端のディープリサーチモデルを凌駕することを可能にしている。

原著者: Hongming Piao, Chi Liu, Mengzhuo Chen, Yan Shu, Derek Li, Ying Wei, Bryan Dai

公開日 2026-06-15
📖 1 分で読めます☕ さくっと読める

原著者: Hongming Piao, Chi Liu, Mengzhuo Chen, Yan Shu, Derek Li, Ying Wei, Bryan Dai

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

全体像:ロボットに「超・研究者」になってもらう方法

想像してみてください。あなたは、世界クラスの研究者のように振る舞えるAIを作りたいと考えています。そのAIは、インターネット上の情報を探し出し、何千もの記事を読み、複雑なトピック(例:「2050年における気候変動がコーヒー生産にどのような影響を与えるか?」)について、詳細で長いレポートを作成できなければなりません。

問題は、ほとんどのAIモデルが「決まった教科書」からしか勉強しない学生のような点です。教科書を読み終えると、学習を止めてしまいます。彼らは、新しい事柄を自力でリサーチする能力を向上させることができないのです。

この論文では、HOTE(Hybrid Open-Ended Tri-Evolution)と呼ばれる新しいシステムを紹介しています。HOTEを単なる一人の学生としてではなく、自分自身と対戦して学ぶ「自己進化する研究チーム」だと考えてください。

チームを構成する3つのキャラクター

単一のAIがすべてをやろうとするのではなく、HOTEは共に進化する3つの専門的な役割を使用します。

  1. Solver(ソルバー/解決者:研究者):

    • 役割: 実際に作業を行うAIです。問いを受け取り、ウェブを検索し、文書を読み、長い研究レポートを作成します。
    • 比喩: Solverを、謎を解こうとする探偵だと考えてください。
  2. Judge(ジャッジ/審判:批評家):

    • 役割: Solverが書いたレポートを読みます。単に「良い」「悪い」と言うのではなく、レポートを採点するためのカスタムチェックリスト(「ルーブリック」と呼ばれます)を作成します。特定の強みや弱点を見つけ出します。
    • 比喩: Judgeは、厳しい編集者スポーツの審判のようなものです。もし探偵が見落としがあれば、審判は笛を吹き、「ここにある特定の詳細を見逃しています」と指摘します。重要なのは、Judge自身も新しい種類のミスを目にするたびに、独自のルールブックを更新していくことです。これにより、古いルールに固執することがありません。
  3. Proposer(プロポーザー/提案者:クイズマスター):

    • 役割: JudgeのフィードバックとDetective(探偵)のミスを見て、新しい、より難しい問題を作成します。その目的は、探偵の弱点を見つけ出し、そこに挑戦することです。
    • 比喩: Proposerは、アスリートが特定の動きで失敗する様子を見守り、その弱点を克服するために、あえて少し難しい新しい練習メニューを設計するジムのコーチのようなものです。

学習方法:「Tri-Evolution(三位一体の進化)」ゲーム

魔法は、これら3者がループの中で協力し、絶えず向上していくことで起こります。

  1. クイズマスターが、手強い研究課題を作成します。
  2. 探偵がそれに答えようと、ウェブを検索し、レポートを執筆します。
  3. 審判がレポートを採点し、新しいチェックリストを作成して、探偵がどこで失敗したのかを正確に指摘します。
  4. 探偵は、その成績から学び、再び挑戦します。
  5. クイズマスターは、探偵がいまだに苦手としていることを見極め、次のラウンドのためにさらに難しい問題を用意します。

このサイクルが何千回も繰り返されます。この論文では、3つのキャラクターすべてが同時に進化(向上)しているため、これを「Tri-Evolution」と呼んでいます。

「ハイブリッド」の秘訣

この論文では、「Dual-Mode Hybrid(デュアルモード・ハイブリッド)」戦略についても触れています。これは、アスリートを2つの異なる方法でトレーニングするようなものです。

  • モードA(ツール使用): 探偵は、答えを見つけるためにインターネット(検索ツール)を使用することが許可されています。これは現実的ですが、ノイズが多く、時間がかかることがあります。
  • モードB(ツールなし): 探偵は、何も調べずに、記憶と論理だけで答えを出さなければなりません。これは高速ですが、すでに持っている知識に依存します。

HOTEシステムは、探偵を両方のモードで同時にトレーニングします。

  • なぜか? もしインターネットを使ったトレーニングしか行わなければ、探偵は検索結果に頼りすぎて怠慢になってしまうかもしれません。逆に、インターネットを使わないトレーニングしか行わなければ、ツールの効果的な使い道を忘れてしまうかもしれません。これらを混ぜ合わせることで、探偵は「いつ検索すべきか」と「ツールなしでいかに深く考えるべきか」を知る、熟練の研究者へと成長するのです。

結果:なぜ重要なのか

研究者たちは、このシステムを3つの困難なベンチマーク(健康、科学、および総合研究)でテストしました。

  • 主張: HOTEでトレーニングされた80億パラメータのモデル(中規模のAI)は、より大規模なモデル(32B以上)や他の最先端の研究AIよりも賢くなりました。
  • 効率性: 他の手法よりも短い時間で、少ない計算資源で、これらの結果を達成しました。
  • 持続可能性: 他の手法とは異なり、HOTEチームは長期間にわたって向上し続けました。なぜなら、「クイズマスター」が、まだ「探偵」が解決できていない新しい、挑戦的な問題を次々と見つけ出し続けたからです。

1文でのまとめ

HOTEは、研究者批評家、そしてクイズマスターが互いに継続的な「チェス」のゲームを繰り広げ、インターネット検索と純粋な思考を組み合わせることで、中規模のAIを世界クラスのディープ・リサーチャーへと、誰よりも速く、より良く変貌させる自己進化型AIシステムです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →