← 最新の論文
🤖 machine learning

SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions

本論文は、現実的なマルチターンかつユーザー主導のソフトウェアエンジニアリング・タスクにおいてコーディングエージェントを評価する新しいベンチマークであるSWE-Interactを紹介しており、従来のシングルターン型ベンチマークにおける高いパフォーマンスが、効果的な実世界の開発に求められるインタラクティブで反復的なワークフローには必ずしも確実に反映されないことを明らかにしている。

原著者: Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、素晴らしい才能を持ちながらも経験の浅い建築家を、家を建てるために雇う場面を想像してみてください。

旧来の手法(従来のベンチマーク)
かつて、研究者たちはこれらのAI「建築家」をテストする際、初日に完成した50ページの設計図を手渡していました。その設計図には、木材の種類、塗料の正確な色合い、すべてのコンセントの配置、蛇口のブランドに至るまで、あらゆる詳細が記載されていました。AIの仕事は、単にその計画を読み取り、完璧に家を建てることでした。

  • 問題点: これは実際の建設現場のあり方を反映していません。現実の世界では、クライアントが完璧な設計図を用意していることは滅多にありません。彼らは通常、「居心地の良い、大きなキッチンがある家が欲しい」と言い、進捗を見ながら考えを変えていくものです。

新しい手法(SWE-INTERACT)
この論文は、現実の建設プロジェクトをシミュレートする新しいテスト、SWE-INTERACTを紹介しています。

  • セットアップ: 完璧な設計図の代わりに、AIは「家を建ててくれ」という曖昧な要求からスタートします。
  • クライアント(シミュレーター): コンピュータプログラムが「クライアント」として機能します。このプログラムはただ座って見ているだけではありません。建設現場を積極的に歩き回ります。
    • 基礎を見て、「あ、地下室が欲しかったのを忘れていた」と言います。
    • キッチンを見て、「やっぱり、コンロはここじゃなくてあっちにしたい」と言います。
    • 配線を確認して、「待って、コンセントがもっと必要だ」と言います。
  • ゴール: AIは、こうした進化し続けるコメントに耳を傾け、ミスを修正し、クライアントが新しい要求を出し続ける中で、家をパーツごとに組み立てながら、クライアントが「本当に何を求めているのか」を理解しなければなりません。

大きな発見
研究者たちは、世界で最も賢いAIコーディングモデルを、両方のシナリオでテストしました。結果は以下の通りです。

  1. 読むのは得意だが、聞くのが苦手: 完璧な設計図から家を建てること(「シングルターン」テスト)には長けていたモデルも、クライアントが考えを変え続けると、成功率は約**50%から25%**へと大幅に低下しました。
  2. 「自信過剰」なミス: 最も優れたモデル(GPT-5.5やOpus 4.8など)は、曖昧な指示であっても勇敢に建築を開始できました。彼らはリカバリーを行い、クライ達の指摘に応じて修正することもできました。しかし、あまりに器用に振る舞おうとするあまり、初期の指示を忘れてしまったり、技術的なミスを犯したりすることがよくありました。
  3. 「諦め」のミス: 能力の低いモデルは、曖昧なスタートに混乱して早々に諦めてしまったり、クライアントの新しい指示を完全に無視してしまったりしました。

なぜこれが重要なのか
これはビデオゲームのようなものだと考えてください。旧来のテストは、敵がどこにいてボスがどのような姿をしているか、すべて分かっているレベルのようなものです。新しいテストは、ゲームマスター(クライアント)がプレイ中にストーリーを変更していく、ライブアクションRPGのようなものです。

この論文は、優れたコーダーであるということは、単にコードの書き方(設計図)を知っていることではなく、自分が何を求めているのかを完全には理解していない人間と一緒に働くための忍耐強さとスキルを持つことである、と結論付けています。現在のAIモデルはこれに近づいていますが、現実世界の混沌とした協力的な環境において、人間の開発者に真に取って代わるには、まだ長い道のりがあります。

要約すると: この論文は、AIコーダーに対し、単に命令に従うだけでなく、物事を決めていく最中の人間と実際に「協調」するための新しい「ジム(訓練場)」を構築したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →