← 最新の論文
💬 NLP

InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning

InftyThink+は、戦略的な要約とモデル制御による反復境界の最適化を通じて反復的な推論を最適化するエンドツーエンドの強化学習フレームワークであり、従来の長い思考の連鎖(chain-of-thought)手法と比較して、精度、効率性、および汎化性能を大幅に向上させます。

原著者: Yuchen Yan, Liang Jiang, Jin Jiang, Shuaicheng Li, Zujie Wen, Zhiqiang Zhang, Jun Zhou, Jian Shao, Yueting Zhuang, Yongliang Shen

公開日 2026-06-03
📖 1 分で読めます☕ さくっと読める

原著者: Yuchen Yan, Liang Jiang, Jin Jiang, Shuaicheng Li, Zujie Wen, Zhiqiang Zhang, Jun Zhou, Jian Shao, Yueting Zhuang, Yongliang Shen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に巨大で、信じられないほど難しいパズルを解こうとしているところだと想像してください。あなたには、非常に賢いものの、記憶力が極めて短く、一度に多くのピースを頭の中に保持しようとすると疲れてしまう優秀な助手(AI)がいます。

以下は、その論文が取り組んでいる問題です:

  • 従来の方法(バニラな推論): あなたは助手に、パズル全体を一気に解くよう指示します。助手は考え始めます。「ステップ1、ステップ2、ステップ3……」と進んでいきます。しかし、記憶力が限られているため、ステップ100に取り組んでいる間に、ステップ1で何をしたかを忘れてしまいます。また、考えれば考えるほど、コンピュータがその思考を処理するためのコストが増大し、遅くなってしまいます。彼らは作業を終える前にメモリ不足に陥ったり、自分の思考の長いリストによって混乱したりする可能性があります。
  • 新しい方法(InftyThink+): この「章」分けによる手法では、助手はパズルを小さな「章」に分割します。数ステップごとに、彼らは一旦停止し、これまでに解明したことの**要約(サマリー)**を書き、それから雑多で詳細なメモをすべて捨てます。そして、その要約と元のパズルのみを使用して、次の章を開始します。これにより、彼らの記憶は新鮮に保たれ、コンピュータの動作も高速になります。

大きな革新:いつ止まるべきかを助手に教えること

この論文は、InftyThink+ と呼ばれる新しいシステムを紹介しています。

この「章」分けの手法を用いたこれまでの試みは、まるで「どんな時でも500語ごとに必ず書くのをやめなさい」と強制する教師のようなものでした。時には、助手が素晴らしいアイデアの真っ最中であるにもかかわらず、強制的に中断されてしまうこともありました。また、彼らはどのように優れた要約を書けばよいのかも知りませんでした。

InftyThink+ は、強化学習(RL)を用いて、試行錯誤を通じて、以下の3つの重要なスキルを助手に教え込みます。これは、おやつを使って犬を訓練するようなものです:

  1. いつ要約するか: 今、要約を書いて止まるべきか、それともこのまま進むべきか? AIは、単にタイマーが鳴ったからではなく、最も重要な情報を捉えた瞬間に止まることを学びます。
  2. 何を保持するか: 次のステップにとって重要な詳細は何か? AIは、重要な手がかりを残し、不要な情報を捨てるような要約を書くことを学びます。
  3. どのように継続するか: 要約からどのように物語を拾い上げるか? AIは、自分の要約を読み、迷うことなく論理をシームレスに継続することを学びます。

仕組み(トレーニングのプロセス)

論文では、2段階のトレーニング・レシピについて説明しています。

  1. 「コールドスタート」(形式の学習): まず、AIにゲームの基本的なルールを教えます。パズルをどのように書き、どのように停止し、どのように要約を書き、そしてどのように再開するかという例を見せます。これは、学生に傑作を書かせる前に、エッセイの形式を教えるようなものです。
  2. 「強化学習」(戦略の学習): AIが形式を理解したら、いよいよ解き放ちます。
    • もしAIがパズルを正しく解けたら、「ご褒美(報酬)」を与えます。
    • もしAIが迅速かつ効率的に解けたら、「追加のご褒美」を与えます。
    • もしひどい要約を書いたり、不適切なタイミングで停止したりしたら、ご褒美は与えられません。
    • 何千回もの試行を経て、AIは完璧な戦略を導き出します。「ここで止まって、このような要約を書き、その上でこのように進めば、最も多くのおやつをもらえるのだ」と。

結果:より賢く、より速く、より強く

この論文では、これらを難しい数学の問題(AIMEコンテストなど)でテストしました。判明したことは以下の通りです:

  • より賢くなった: AIは問題を解く能力が大幅に向上しました。ある難しいテストでは、精度が従来の方法と比較して**21%**跳ね上がりました。従来の方法では最後まで完了できなかった問題を解決できました。
  • より速くなった: AIは100ページの歴史を記憶しようとする必要がなかったため、問題をより速く解きました。ケースによっては、標準的な方法よりも30%から40%高速でした。
  • より効率的になった: トレーニング自体も高速化されました。コンピュータはAIを教えるために膨大な負荷をかける必要がなく、研究者はより少ないエネルギーと時間で、より優れたモデルを訓練できることを意味します。

結論

InftyThink+ を、AIに「より優れたプロジェクトマネージャー」になるよう教えることだと考えてください。プロジェクトの全履歴を頭の中に保持しようとして(それが原因でクラッシュしたり忘れたりするのではなく)、一時停止し、明確な「状況報告書(要約)」を書き、その報告書に基づいて前進することを学ぶのです。いつその報告書を書くべきか、そしてそこに何を盛り込むべきかを学ぶことで、AIは天才的な問題解決者であると同時に、非常に効率的なワーカーとなるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →