daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently
本論文は、本物のプルリクエストのシーケンスを活用して高品質で長期的な学習データを合成することで、膨大なアノテーションコストをかけることなく、複雑なエージェント・ワークフローにおける大幅な性能向上を可能にする、データ効率の高いフレームワークであるdaVinci-Agencyを紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、論文 daVinci-Agency の解説です。シンプルな概念、日常的な比喩、そして著者による具体的な主張に基づいて構成されています。
大きな問題:AIの「注意力不足」
あなたは、非常に優秀な学生を想像してみてください。その学生は、「2+2は?」や「猫についての詩を書いて」といった単一の質問に答えるのは素晴らしいのですが、もしあなたがその学生に「家を建てて」と頼んだらどうなるでしょうか。彼らは基礎を築いた後、屋根が必要であることを忘れてしまったり、壁を間違った場所に作り、それが最後の方まで気づかなかったりします。これは、AIの世界では**ロングホライゾン・タスク(長期的な課題)**と呼ばれます。それは多くのステップを必要とする仕事であり、早い段階でのミスが、後のプロジェクト全体を台無しにしてしまう可能性がある仕事のことです。
論文では、現在のAIモデルがこうした長い仕事に失敗する理由は、長い期間にわたって**「先を見通して計画を立て、一貫性を保ち、自らの間違いを修正する」**方法を示すデータで訓練されていないからだと主張しています。
解決策:「ソフトウェアの進化」から学ぶ
著者たち(SII、SJTU、GAIRの研究者)は、AIに長く複雑なプロジェクトを扱う方法を教える最善の方法は、人間がどのようにソフトウェアを構築しているかを見ることであり、と気づきました。
比喩:「プルリクエスト」の連鎖
ソフトウェア開発において、プログラマーが新機能を追加したりバグを修正したりしたいとき、完成したコードをただ投げ込むわけではありません。彼らは**「プルリクエスト(PR)」**を提出します。
- ステップ1: 彼らは小さな変更(PR #15)を提出します。
- ステップ2: レビュアーが「見た目は良いが、安全装置が足りない」と指摘します。
- ステップ3: プログラマーはそれを修正し、最初のものの上に構築された新しい変更(PR #21)を提出します。
- ステップ4: 機能が完璧になるまで、このプロセスが数ラウンド続きます。
著者たちはこれを**「プルリクエストの連鎖(Chain of Pull Requests)」**と呼んでいます。これは、各章が前の章に依存しており、登場人物(コード)が時間の経過とともに進化し、改善していく物語のようなものです。
革新:daVinci-Agency
チームは daVinci-Agency と呼ばれる新しいシステムを作成しました。AIに学習させるための架空のシナリオを作成したり、人間に長い物語を書かせて報酬を支払ったりする(これにはコストと時間がかかります)代わりに、彼らはGitHub(膨大な実際のソフトウェアプロジェクトのライブラリ)へ行き、これらの自然な「プルリクエストの連鎖」を収穫しました。
彼らは、これらの現実世界の開発ストーリーをトレーニングデータへと変えました。
- トレーニング: 彼らはモデル(GLM-4.6)を取り出し、これらの連鎖を見せました。
- 教訓: AIは、成功するためには以下のことが不可欠であることを学びました。
- 分解(Decompose): 巨大な目標を、小さく管理可能なステップに分解すること。
- 一貫性の維持(Stay Consistent): 50ステップを経過した後でも、元の目標を忘れないこと。
- 洗練(Refine): 自分の間違い(バグ)を見つけ、最初からやり直すのではなく、それを修正すること。
「魔法のような」結果:少ないデータで大きな成果を
通常、AIをより賢くするためには、数百万の例を読み込ませる必要があります。
- 従来の方法: 66,000の例で訓練する(論文内の他のデータセットと同様)。
- daVinciの方法: わずか 239の例 で訓練する。
結果:
200倍も少ないデータを使用したにもかかわらず、daVinci-Agencyで訓練されたモデルは、膨大なデータセットで訓練されたモデルよりも大幅に優れた性能を発揮しました。
- AIが問題を解決するためにツールを使うテストである Toolathlon において、モデルは 47% 向上しました。
- 実際のソフトウェアのバグを修正するテストである SWE-bench においても、より高いスコアを記録しました。
なぜか? それは、239の例が高品質だったからです。それらはランダムなものではなく、複雑な問題がいかにして時間をかけて解決されるかを示す、現実の物語でした。AIは単に事実を暗記したのではなく、粘り強さと修正を行うという「習慣」を学んだのです。
AIが実際に学んだこと(「メタスキル」)
この論文は、AIが単にコーディングが上手くなっただけでなく、**「思考」**が上手くなったことを示しています。
- 以前: もしAIが間違いを犯すと、混乱したり、無関係なトピックに迷い込んだり、諦めてしまったり(これを「エスカピズム(逃避)」と呼びます)していました。
- 以後: 間違いに気づくと、AIは立ち止まり、「待てよ、これは間違っている」と気づき、それを修正できるようになりました。AIは計画を立て、軌道を外れないことを学んだのです。
効率性:より少ないものでより多くを成し遂げる
論文では、新しいAIの方が効率的であることも判明しました。
- 比喩: 二人の人が迷路を解こうとしていると想像してください。
- 人物A(旧来のAI): あらゆる行き止まりに突っ込み、叫び声を上げ、100通りの間違った道を試します。
- 人物B(daVinci AI): 地図を確認し、行き止まりを見極め、最短ルートを通ります。
- daVinciで訓練されたAIは、同じ問題を解決するために、より少ない言葉(トークン)と、より少ないツールのクリック数を使用しました。混乱によるエネルギーの無駄がありませんでした。
「スケーリング」の発見
最後に、著者たちは、訓練するストーリーをさらに長くした場合に何が起こるかをテストしました。
- 彼らは、より多くのステップを含む連鎖(より長いプルリクエストの連鎖)でAIを訓練すると、AIはさらに向上することを発見しました。
- これは、AIがより長い「遠距離」の思考を練習すればするほど、非常に長く複雑な問題を解決する能力が高まることを示唆しています。
まとめ
daVinci-Agency は、AIエージェントを訓練するための新しい方法です。AIに数百万の短く架空のタスクを暗記させるのではなく、人間がソフトウェアを構築する際の現実の長い物語を見せることで教えていきます。これらの自然な「出来事の連鎖」から学ぶことで、AIは計画を立て、一貫性を保ち、自らの間違いを修正することを学び、以前よりもはるかに少ないデータで、より賢く、より効率的になります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。