← 最新の論文
🤖 machine learning

LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation

LoongReflectは、リフレクションをメモリ制御ポリシーとして定式化し、局所的なリフレクションの決定をグローバルなタスク結果に整合させるためのデュアルチャネル蒸留メカニメントを採用することで、結果ベースの強化学習における疎な教師信号の課題を克服し、探索エージェントにおける長期的推論を強化するトレーニングフレームワークである。

原著者: Zhixin Zhang, Xinke Jiang, Zhibang Yang, Weixuan Xu, Guohong Qiu, Xu Chu, Junfeng Zhao, Yasha Wang

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Zhixin Zhang, Xinke Jiang, Zhibang Yang, Weixuan Xu, Guohong Qiu, Xu Chu, Junfeng Zhao, Yasha Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、意欲に満ちたロボットに、大規模で多段階の謎解きを教える場面を想像してみてください。このロボットは、大規模言語モデル(LLM)によって動かされており、何百万冊もの本を読み、質問を投げかけ、手がかりを繋ぎ合わせることができる探偵のような存在です。しかし、ここに一つ問題があります。探偵が途中で行き詰まったり、間違った手がかりを追ったりしたとき、自分自身ではそれに気づかず、支離滅裂な内容を章ごと書き進めてしまうことがよくあるのです。AIの世界では、これを「ロングホライゾン・リーズニング(長期的推論)」と呼びます。これは、単に一歩を踏み出すだけでなく、長い旅路を計画する能力のことです。

大きな問題は、「待てよ、自分は間違った方向に進んでいる。引き返そう」と言わせるようにロボットを教えることが、非常に難しいという点です。通常、ロボットは物語の最後にしか成績をもらえません。「謎を解けました!」あるいは「失敗しました」といった具合に。もしロボットが3時間前にミスをしていたとしても、その特定の瞬間が問題だったのだとは分からないのです。それは、学生が期末試験で悪い成績を受け取りながら、どの宿題が原因でその結果になったのか全く分からない状態に似ています。この論文は、まさにそのフラストレーションに取り組んでいます。どうすればAIに、自分の仕事を見直し、エラーを特定し、プロジェクト全体を台無しにする前に「元に戻す(Undo)」ボタンを押せるように教えられるのか、という課題です。


ここで、AIエージェントを自己修正可能な探偵へと変貌させるために設計された新しい学習フレームワーク、LoongReflectをご紹介します。北京大学の研究者たちは、AIが複雑なパズルを解くためには、単なる「やり直し」ボタン以上のもの、つまり、自らの思考プロセスを一時停止し、考え、書き直すための構造化された方法が必要であることに気づきました。

AIの思考プロセスを、直線ではなく、**巨大で可逆的な「木(ツリー)」**として考えてみてください。AIが問題を探索するにつれ、枝が成長していきます。ほとんどの場合、AIは一つの枝を進み、事実を集めていきます。しかし、時には行き止まりに突き当たったり、つじつまの合わない手がかりを見つけたりすることもあります。これまでは、AIはその間違った手がかりを引きずったまま突き進み、物語全体を崩壊させてしまうことがありました。LoongReflectは、AIに2つのスーパーパワーを与えます。それが (内省)と (バックトラック)です。

というアクションは、探偵が地図を確認するために立ち止まるようなものです。AIはこう問いかけます。「自分が確実に知っていることは何か? 何が足りないのか? この枝は安全か?」単に推測するのではなく、証拠を要約し、リスクを特定します。もし探偵が間違った道にいると気づいたら、 アクションを使用します。これは単に最後の文章を消去することではありません。最後の安全なチェックポイントまで時間を巻き戻し、混乱した間違った枝を切り落とし、「この道には二度と入らない」という小さな付箋を残すようなものです。そして、学んだ教訓を携えて、その安全な地点から再びスタートを切ります。

では、どのようにしてAIにこれを教えるのでしょうか? この論文では、厄介な「学習シグナルのジレンマ」を指摘しています。もしAIが最終的な答えに到達したときだけに報酬を与えると、AIは「どのように内省すべきか」についてほとんど助けを得られません。それは、車をクラッシュさせたときにクラクションを鳴らされるだけで、運転を学ぼうとしているようなものです。AIは、原因が曲がり角にあったのか、スピードだったのか、それとも雨のせいだったのかを知ることができません。

これを解決するために、著者たちは、まるで2人のコーチが協力して指導しているような、**「2チャンネル学習システム」**を構築しました。

  1. 速いコーチ(教師): このコーチは、AIが動き出す前に、可能性のツリー全体と最終的な結果を見ることができる「特権的な」バージョンのAIです。このコーチは、生徒(AI)のローカルな枝を観察し、「おい、ここで重要な手がかりを無視しているぞ」とか「今、バックトラックすべきだ」と指示します。重要なのは、このコーチは最終的な答えを教えないことです(これにより、AIが推論プロセスをスキップしてしまうのを防ぎます)。代わりに、どのように考え、いつ引き返すかというヒントだけを与えます。これにより、AIの内省スキルに対して、密度が高く即時的なフィードバックを提供します。
  2. 遅いコーチ(結果): このコーチは、旅の最後まで待ちます。そして、最終的な結果を見て、「素晴らしい、パズルを解けたね!」あるいは「失敗だ」と告げます。この最終スコアを用いて、AIの局所的な決定が、現実の世界で実際に成功につながるかどうかを確認します。

魔法は、これら2人のコーチが連携するときに起こります。「速いコーチ」は局所的な論理に基づいて方向を提案し、「遅いコーチ」は、その方向が実際に勝利につながるかどうかをチェックします。もし両者が意見を食い違った場合、システムは巧妙な「先読み(look-ahead)」手法を用いて、速いコーチの提案を調整し、AIを誤った方向へ導かないようにします。これは、ショートカットを提案するGPSに対し、交通管制官がそのショートカットが本当に目的地への到着を早めるかどうかをチェックするようなものです。

結果は有望です。研究者たちは、困難な多段階の質問(複数の文書に隠された特定の事実を見つけるなど)や数学の問題を用いてLoongReflectをテストしました。その結果、この手法で訓練されたエージェントは、他のトップレベルのAIエージェントを一貫して上回ることが分かりました。例えば、30億パラメータのモデルにおいて、平均スコアは約31%から46%以上に跳ね上がりました。さらに印象的なことに、この読解タスクで学習したスキルは、見たこともない数学の問題にも転移しました。これは、AIが単に答えを暗記したのではなく、真の意味で「内省の技術」を学んだことを示唆しています。

要約すると、LoongReflectは、AIエージェントに、立ち止まり、自らのエラーを診断し、間違いを綺麗に元に戻すための構造化された方法を与えることで、現在彼らを立ち往生させている複雑で長期的な問題を解決する能力を大幅に向上させられることを示しています。これは、AIを「ただ歩き続けるだけのロボット」から、「いつ立ち止まり、考え、別の道を探すべきかを知っている探偵」へと進化させるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →