← 最新の論文
💬 NLP

Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning

Search-E1 は、複雑な外部監督や補助モジュールに依存することなく QA ベンチマークで最先端のパフォーマンスを達成するために、純粋な GRPO とオフライン自己蒸留のみを使用して検索拡張推論エージェントを強化する自己進化手法である。

原著者: Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に頭がよいが、少し不器用な生徒(AI)が、ひねくれた雑学クイズに答えようとしている状況を想像してください。正解を出すために、この生徒は図書館(検索エンジン)を使って事実を調べることができますが、いつ調べ、何を尋ねるかを自分で決める必要があります。

現在のほとんどの手法では、この生徒に、エッセイ全体を書き終えるまで待ってから教えます。最終的な答えが正しければ、先生は金の星を与えます。間違っていれば、赤い×を与えます。問題は何でしょうか?生徒は、どの特定のステップが間違っていたのかを知りません。間違った質問をしましたか?間違った段落を読みましたか?気が散りましたか?彼らが知っているのは、全体の試みが失敗したということだけです。

Search-E1 は、この生徒を教える新しい、よりシンプルな方法です。超賢い人間の先生も、派手な追加のロボットも、特別な報酬システムも必要としません。代わりに、「自己進化(Self-Evolution)」と呼ばれる技術を用いた、2 段階のダンスを使用します。

ステップ 1: 「すべてを試す」フェーズ(GRPO)

まず、生徒に同じ質問を 5 回出されます。

  • ある試みでは、図書館をうろうろし、ばかげた質問をし、失敗するかもしれません。
  • 別の試みでは、完璧な質問をし、正しい本を見つけ、素早く正解にたどり着くかもしれません。

システムはこの 5 つの試みを検討し、「よし、正解にたどり着いたものが、このラウンドにおける『ゴールドスタンダード』だ」と言います。しかし、以前と同様に、これでは生徒に「そのエッセイ全体はよくできた」と伝えるだけで、「その特定の質問をすること」がよかったとは伝わりません。

ステップ 2: 「巻き戻して学ぶ」フェーズ(オフライン自己蒸留)

ここで魔法が起きます。システムは、失敗した試み(「生徒」)と成功した試み(「先生」)を取り出します。

ここには巧妙なトリックがあります。

  1. システムは生徒に、元の質問を与えます。
  2. システムは先生に、同じ質問を与えますが、同時にカンニングペーパーも渡します。それは、別の試みで生徒が取った成功への完全な経路そのものです。
  3. 先生はカンニングペーパーを読み、「もし私が今、正しい経路を知ってこの質問に答えるなら、次に Exactly 何を言うか」と言います。
  4. 生徒はその後、先生の話を聞き、一歩一歩その言葉に合わせようと強いられます。

生徒は単に「正解だった/間違っていた」と言われているだけではありません。トークンごと(単語ごと)に、よりよく考える方法を正確に示されているのです。「ああ、なるほど!私が『大統領は誰ですか?』と聞いたとき、先生は『1990 年の大統領は誰でしたか?』と聞いた。そこが違いだ!」と。

なぜこれが特別なのか?

  • 外部の先生不要: 通常、このレベルの詳細さを得るには、すべてのステップを評価するために超賢い AI(720 億パラメータのモデルなど)が必要です。Search-E1 は、生徒の自分自身の成功した試みを先生として利用します。これは、教授に採点されるのを待つ代わりに、A を取った後の自分のテスト用紙を勉強する生徒のようなものです。
  • 追加の機構不要: 他の手法は、どのステップが優れていたかを特定するために複雑なツールを追加します。Search-E1 は、標準的な「試行と再試行」ループを使用し、その間に「自分の成功を学ぶ」というステップを追加するだけです。
  • 結果: 7 つの異なる雑学チャレンジでこれをテストしたところ、Search-E1 を使った生徒は、より複雑な手法を使った他の生徒よりも著しく高いスコアを獲得しました。特に「マルチホップ」質問(複数の点を結びつける必要があるもの)において優れていました。なぜなら、そのような質問には間違う可能性のある多くのステップがあり、この手法は壊れていた特定のステップを修正するからです。

要約すると: Search-E1 は、AI が失敗することを許し、その後、その成功した試みを完璧な教科書であるかのように研究させることで、AI をより賢くします。外部の助けを必要とせず、すべての瞬間に何を言うべきかを正確に学ぶのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →