← 最新の論文
🤖 AI

Recursive Synthesis for Long-Horizon Terminal Tasks

本論文は、長期間のターミナル・エージェント・タスクを再帰的に生成および検証することで、低コストで37,484個の高品質な例を生成するスケーラブルなフレームワークであるRecursive Synthetic Terminal Tasks (RST) を導入し、収穫逓減の兆候を示すことなく、困難なベンチマークにおけるファインチューニング済みモデルおよびエージェント型モデルの性能を大幅に向上させる。

原著者: Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに熟練のメカニックになるよう教える場面を想像してみてください。単にレンチがどのような形をしているかを知っておくだけでは不十分です。これまでに壊れたことのない車のエンジンを、実際に修理できるようになってほしいのです。これが「AIエージェント」の世界です。彼らは単にあなたとチャットをするだけでなく、コマンドを入力したり、ファイルを移動したり、ソフトウェアのバグを修正したりといった、実際に「行動」する賢いコンピュータプログラムです。大きな問題は、これらのロボットが長く複雑な作業にはめっぽう弱いことです。もし家を建ててほしいと頼んだら、彼らはレンガを一つ積んだところで混乱してしまうかもしれません。彼らをより良く教えるためには、ロボットが家を建てようとして失敗し、修正を受け、再び挑戦するというプロセスを含む、何千もの練習問題が必要です。しかし、こうした練習問題を作るのは悪夢のような作業です。人間が手作業で書けば、莫大な費用がかかります。コンピュータに書かせれば、ツールと一致しないルールを捏造したり、解くことが不可能なパズルを作成したりすることがよくあります。それはまるで、シェフにケーキのレシピを書かせるのだが、そのレシピにはキッチンに存在しない材料が指定されていたり、オーブンが壊れていたりするようなものです。

ここで、「Recursive Synthetic Terminal Tasks (RST)」と呼ばれる新しい手法が登場します。これは、ロボットの訓練用パズルを作成するための「デジタル進化マシン」だと考えてください。人間がすべての問題を書く代わりに、研究者たちは、検証済みの動作するパズルの小さな集まり(「シード」)である639個からスタートしました。そして、強力なAIを、いたずら好きだが天才的なゲームデザイナーのように機能させました。このAIは、動作するパズルを観察し、そこに解決策のための新しい、より難しいステップを追加し(エンジンの部品に新しいギアを追加するように)、その後すぐに、新しい難易度のバージョンに合わせて指示書と「解答集」を更新しました。極めて重要なのは、新しいパズルが保存される前に、それが実際に動作するかどうかを確認するために、デジタル・サンドボックス(安全で隔離されたコンピュータ上の実験室)に投入されたことです。もし解決策が失敗すれば、そのパズルは破棄されました。もし成功すれば、それは保持され、次の、より難しいパズルのためのシードとして使用されました。研究者たちはこのループを15回実行しました。最終的に、彼らは38,000個近い、検証済みの新しいパズルを作り出しました。素晴らしい点は、ラウンドが進むごとにパズルが真に難しくなっていったことです。中間のパズルは、解決するために必要なコードの行数が67行から374行へと増加しました。ロボットが入力しなければならないコマンドの数も、40から244へと跳ね上がりました。

結果は劇的でした。トップクラスのAIソルバーを使用してこれらのパズルをテストしたところ、第1ラウンドの簡単なパズルでの成功率90%から、第15ラウンドではわずか2.5%へと低下しました。これは、システムが単に指示を長くしているのではなく、実際により深い思考とより多くのステップを必要とするタスクを作成していたことを証明しています。しかし、本当の魔法は、これらのパズルを使って別のAIモデル(Qwen3.5)を訓練したときに起こりました。これらのパズルから生成された軌跡(ステップ・バイ・ステップの試行)を用いて訓練した後、そのモデルは現実世界のターミナル・タスクを解決するのが大幅に上手くなりました。標準的なテストにおいて、その性能は最大10ポイント上昇し、さらなる強化学習を行うことで、テストの内容に応じて20%から41%向上しました。最もエキサイティングな発見は、このシステムが停止の兆しを見せなかったことです。物事を難しくする15ラウンドを経ても、システムはナンセンスな内容に崩壊したり、同じトリックを繰り返したりすることなく、有効で多様なパズルを生成し続けました。これは、私たちがAIエージェントのための高品質な訓練データを無限に生成できる可能性を示唆しており、高価で低速な人間の教育プロセスを、高速で自動化されたスケーラブルな進化へと変貌させるものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →