Evo-Bench: Can Language Models Improve Agent Harness?
本論文は、言語モデルが自律的に動作用ハーネスを進化させる固有の能力を分離して評価するために設計された初のベンチマークであるEvo-Benchを紹介し、それが大幅な性能向上と転移可能な推論構造を明らかにする一方で、高度に特定されたワークフローを必要とするタスクにおけるドメイン固有の課題を浮き彫りにしていることを示すものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、超スマートなロボットの脳を構築したばかりだと想像してください。それは読み、書き、パズルを解く能力において、ほとんどの人間よりも優れています。しかし、一つだけ問題があります。この脳は、天才的ながらも不器用なシェフのようなものなのです。材料(知識)はすべて持っていますが、実際に料理を作るためのレシピ(指示書)を持っていません。人工知能の世界では、この「レシピ」は**エージェント・ハーネス(agent harness)**と呼ばれます。それは、AIにどのように脳を使って仕事を遂行するか(ウェブ検索、スプレッドシートの編集、レポート作成など)を教えるための、ルール、ツール、およびワークフローのセットです。
長い間、これらのレシピを書いて、AIをより良く機能させるために細かく調整してきたのは人間でした。しかし、もしAIが自分自身のレシピを書けるとしたらどうでしょう? 私たちがAIに間違いの直し方を教える代わりに、AIが自らの失敗を観察し、何が間違っていたのかを突き止め、自らの指示書を書き換えてより賢くなることができたら? これこそが、科学者たちが問い続けている大きな疑問です。「AIは真に、自分自身をより優れた労働者へと教え込むことができるのか、それとも単に人間に手を引いてもらう必要があるのか?」 この論文は、まさにその謎に深く切り込み、AIが自らの「オペレーティングシステム」を進化させ、自らの運命の達人になれるかどうかを検証しています。
AI自己改善の偉大なる実験
Evo-Benchをご紹介しましょう。これは、AIが自身のソフトウェアをアップグレードできるかどうかをテストするために特別に設計された、世界初の「ジム(訓練場)」です。キャラクターが経験値を得てレベルアップするだけでなく、キャラクター自身がより強くなるために自らのコードを書き換えることを許されるビデオゲームのようなものだと考えてください。研究者たちは、3つの異なるタイプの「ミッション」を備えた制御された環境を構築しました:サーチ(Search)(ウェブ上の情報の探索)、オフィス(Office)(複雑な文書やスプレッドシートの管理)、そしてジェネラル(General)(難解でオープンエンドなタスクの混合処理)です。
この実験では、さまざまなAIモデルに対し、基本的でシンプルな指示セット(「シード・ハーネス」)と、時間および計算能力の厳格な予算を与えました。AIの役割は、自律的なエンジニアとして振る舞うことでした。つまり、どこで失敗したかを確認し、その原因を推測し、その後、自らのコードを書き換えてそれを修正することです。彼らは単にAIに推測させたわけではありません。最終的な秘密の「評価(evaluation)」セットに直面する前に、検証用のタスクセットで自らの改善を証明させました。これにより、AIが単に答えを暗記しているのではなく、より良いツールを構築する方法を実際に学んでいることを保証しました。
結果:天才と不具合の混在
結果は、高揚と落胆が入り混じった激しい展開となりました。GPT-5.6 SolやClaude Opus 4.8のようなトップクラスのAIモデルは、確かに自己改善を学習できることを示しました。彼らは開始時点から16.6ポイントという大幅なパフォーマンス向上を実現し、人間が長年かけて手作業で設計してきたシステムのレベルに非常に近いところまで到達しました。
しかし、物語は単純な「AIの勝利」ではありませんでした。論文によると、AIの自己改善能力は、それが「何を」しようとしているかに大きく依存することが分かりました。
- サーチ・タスク: AIはここでスーパースターでした。ウェブをナビゲートし、乱雑なデータをクリーンアップする方法を見事に習得し、人間の専門家に肉薄しました。
- ジェネラル・タスク: これらの広範でクリエイティブな挑戦において、AIは実際に人間が設計したシステムを凌駕しました。彼らは、人間が思いつかなかった新しい思考法を編み出したのです。
- オフィス・タスク: ここがAIの弱点でした。非常に具体的で硬直したワークフロー(複雑なスプレッドシートの処理など)を必要とする場合、AIは苦戦しました。必要な正確な手順を理解できず、しばしば行き詰まったり、小さく繰り返されるエラーを起こしたりしました。
「早期飽和」の罠
著者たちが**「早期飽和(early saturation)」**と呼ぶ現象は、最も興味深い発見の一つです。テストを受けている学生を想像してみてください。彼らは一生懸命勉強し、初回で素晴らしいスコアを取り、その後も勉強を続けることに決めました。しかし、成績が上がるどころか、考えすぎてしまい、逆に回答を悪化させてしまうのです。論文は、多くのAIモデルが非常に早い段階で「スイートスポット(最適解)」に到達し、優れた解決策を見つけ出すものの、その後のラウンドでもあれこれと手を加え続け、結果として機能していた部分を誤って壊してしまう傾向があることを示唆しています。彼らは、真に完璧なシステムを見つけ出す前に、時間や忍耐力を使い果たしてしまったのです。
天才の代償
論文はまた、この自己改善にかかるコストについても調査しました。最高の成果を得るには、コストがかかることが判明しました。トップパフォーマンスを発揮したAIは、実験を通じて走らせるのに500ドル以上を要しましたが、他のモデルは40ドル未満でそこそこの結果を出していました。これは、「パレートの境界線(Pareto frontier)」、つまり、最後の数ポイントの完璧さを手に入れるためには多額の費用を投じなければならないというトレードオフの関係を示唆しています。
結論
では、言語モデルは自らのエージェント・ハーネスを改善できるのでしょうか? 答えは「イエス、ただし限界はある」です。 論文は、AIがオープンエンドなタスクや検索主体のタスクにおいて、自らを再発明することに非常に長けており、時には人間のエンジニアを打ち負かすことさえあることを示しています。しかし、硬直した特定のプロセスを必要とするタスクにおいては、依然として導いてくれる人間の手が必要です。研究者たちは、私たちは真のAI自己進化の最初の火花を目撃しているものの、まだ完全な到達点には至っていないと結論付けています。AIは、新しい調理技法を編み出すことはできるが、玉ねぎの切り方については依然としてマスターシェフに教わる必要がある、優秀な見習いのようなものです。この新しいベンチマークであるEvo-Benchは、現在のAIがどこに立ち、明日どこへ向かうべきかを示す明確な地図を提供しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。