Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement
本論文は、自動化されたUIテストと自然言語によるフィードバックに基づき、エージェントが仕様の不十分なプロジェクトを反復的に改善していく実世界のマルチラウンドのリファインメント・サイクルをシミュレートすることで、コードエージェントをウェブ開発タスクにおいて評価するために設計された新しいベンチマークであるAsuka-Benchを紹介し、現在のモデル間の顕著な性能差を明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、少し融通の利かない、しかし極めて優秀な建築家を雇って家を建てさせると想像してください。
旧来の手法(既存のベンチマーク)
かつて、こうした建築家をテストする方法は、釘一本、電線一本、塗料の色に至るまで、あらゆる詳細が記された完璧な50ページの設計図を与えるようなものでした。「これを作ってください」と頼むと、彼らは完成した家を提出しました。もし家が設計図と一致していれば「A」評価、一致していなければ「F」評価でした。
問題は、現実の世界はそんな風には動かないということです。実際のクライアントが完璧な50ページの設計図を持っていることは滅多にありません。彼らは通常、「キッチンと寝る場所がある家が欲しい」と言うだけです。そして、最初のドラフトを見た後に、「あ、実はキッチンをもっと広くしたかったんだ」とか、「待って、ドアが逆向きに開くよ」と気づくのです。
新しい手法(Asuka-Bench)
この論文は、「コードエージェント」(ソフトウェアを書くAIプログラム)をテストするための新しい方法であるAsuka-Benchを紹介しています。AIに完璧な設計図を与える代わりに、研究者たちは「商品のリストとカート機能があるショッピングサイトを作って」といった、曖昧で雑なリクエストを与えます。
そして、単に最初の結果を採点するだけではありません。現実世界の開発サイクルを再現するために、3人組のチームを設定します。
- ビルダー(コードエージェント): 曖ティブなリクエストに基づいてウェブサイトを作ろうとしているAIです。
- インスペクター(UIエージェント): ウェブブラウザ上で実際にウェブサイトを訪れるロボットです。彼はコードを読みません。人間のユーザーのように振る舞います。ボタンをクリックし、買い物を試し、ページが正しく読み込まれるかを確認します。これは、ドアが開くかどうかを確認するために、家の中を歩き回る品質管理検査員のようなものです。
- クライアント(ユーザーLLM): インスペクターの様子を見守る別のAIです。もしインスペクターが問題(例:「『購入』ボタンが機能しない」)を見つけた場合、クライアントはその内容を丁寧なメモに変換してビルダーに伝えます。「ボタンが壊れています。直してください」といった具合です。
その後、ビルダーはウェブサイトを修正し、このサイクルが繰り返されます。これは最大3ラウンドまで行われます。
「DAG」のアナロジー
研究者たちは、フィードバックを与えるためのスマートな方法として、**DAG(有向非巡回グラフ)**を考案しました。これは、レシピのようなものだと考えてください。
- ケーキにアイシングをする前に、ケーキを焼くことはできません。
- 従来のテスト手法では、もしケーキが焦げていた場合、インスペクターは「アイシングが足りない」とも文句を言うかもしれません。しかし、焦げたケーキにアイシングを施すことは不可能です。
- Asuka-Benchでは、システムが順序を把握しています。もし「焼く」ステップが失敗した場合、システムはインスペクターが「アイシング」のステップをチェックするのを止めます。そしてビルダーに対しては、「ケーキを焼けていない」とだけ伝えます。これにより、まだ起きていない事象に対する不満によって、ビルダーが混乱するのを防ぎます。
研究結果
研究者たちは、この手法を用いて8つの異なるAIモデルをテストしました。以下のような発見がありました。
- 修正が得意なAIもあれば、そうでないAIもいる: 最初のドラフトを作るのが得意だからといって、間違いを直すのが得意であるとは限りません。優れた初版を作れるモデルもあれば、クライアントのメモを理解して修正することができないモデルもありました。また、最初はひどい状態からスタートしても、フィードバックのラウンドを重ねるごとに改善していくモデルもありました。
- その差は歴然としている: 修正を3回行った後、プロジェクトを完璧に完了できたのは、最も優れたモデルで約52%でした。最も劣ったモデルはわずか8%でした。これは極めて大きな差です。
- 依然として困難である: 最も賢いAIであっても、すべてのプロジェクトを完璧に終わらせることはできませんでした。これは、AIが進化している一方で、現実の人間による、あいまいでやり取りの多い要求への対応には、まだ苦戦していることを示しています。
まとめ
Asuka-Benchは、AIコーダーのための新しい「運転免許試験」です。彼らに、完璧な設計図(完璧に直線的で空いているコース)の上を走ることを求めるのではなく、街中の交通状況の中で運転し、曲がり角を間違えたら助手席の人から指示を受け、進路を修正することを求めています。結局のところ、「真っ直ぐに走ること」と、「人の話を聞いて間違いを直すこと」は、全く別のスキルなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。