← 最新の論文
💻 computer science

SWE-Together: Evaluating Coding Agents in Interactive User Sessions

本論文は、実際のユーザーとエージェントによるコーディングセッションから派生したマルチターン・ベンチマークであるSWE-Togetherを導入するものであり、リアクティブなLLMベースのユーザーシミュレータを用いて、最終的なリポジトリの正当性と修正フィードバックに要したターン数の両面からコーディングエージェントを評価し、より強力なエージェントはより少ない介入で高い成功率を達成することを明らかにしている。

原著者: Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、新しいソフトウェアエンジニアを採用していると考えてください。かつて、彼らをテストするために、あなたは完璧に書かれた10ページの指示書を渡し、「この機能を構築してください」と言っていました。そして、彼らが作業を終えるのを待ち、最終的なコードを確認して、成績をつけていました。コードが動作すれば「A」、動作しなければ「F」でした。

問題点: 現実はそのようにはいきません。実際の仕事では、完璧なマニュアルなど存在しません。曖昧なアイデアから始まり、エンジニアが何かを構築し、あなたが重要な詳細を言い忘れたことに気づき、彼らのミスを修正し、途中で目標を明確化するということが起こります。古いテストは、エンジニアがいかにこの泥臭い、やり取りの多い会話をうまく扱えるかを測定できていませんでした。それらは最終的な成果物のみを測定しており、そこに到達するためにどれほどの「手助け(ハンドホルダー)」が必要だったかを無視していたのです。

解決策:SWE-Together
この論文の著者たちは、SWE-Togetherと呼ばれる新しいテストの場を作り出しました。これは、コーディングエージェント(AIプログラマー)のための「リプレイ可能なビデオゲーム」のようなものです。

その仕組みを、シンプルな要素に分解して説明します。

1. 素材:現実世界の映像

研究者たちは、架空のテスト問題を作る代わりに、現実の世界から情報を釣り上げました。彼らは、人間とAIコーディングアシスタントとの間で行われた11,260件の実際の会話を調査しました。この膨大な集まりの中から、テストに最適な109個の特定のタスクを慎重に選び出しました。

  • フィルター: 彼らは、あまりに支離滅裂なもの、明確なゴールがないもの、あるいは再現不可能な会話を排除しました。人間が明確な目標を持ち、AIが実質的な作業を行い、かつ結果を確認できるものだけを残しました。

2. 「ロボットユーザー」シミュレーター

これが最も巧妙な部分です。新しいAIをテストする場合、単に古い人間のメッセージを再生することはできません。なぜなら、新しいAIは異なる経路を辿る可能性があるからです。もし新しいAIが異なるミスをした場合、元の人間の次のメッセージは意味をなさなくなってしまうかもしれません。

そこで、彼らはスマート・ロボットユーザーを構築しました。

  • 仕組み: 演劇を見ているディレクターを想像してください。ディレクターは、元の人間が何を達成したかったのかを正確に理解しています。新しいAIのアクターが演技をする間、ロボットユーザーはそれを見守ります。もしAIが脱線したり、元の人間なら気づいたであろう点を見落としたりした場合、ロボットユーザーが介入し、「待ってください、実は私はXと言いたかったのです」や「Yを忘れていますよ」と言います。
  • 目的: ロボットユーザーは、元の人間と全く同じように振る舞いますが、新しいAIのパフォーマンスに合わせてそのタイミングを調整します。これにより、たとえAIが異なるルートを通ったとしても、すべてのAIが同じ「意図」に対してテストされることが保証されます。

3. 新しいスコアカード

古いテストでは、スコアは一つだけでした。「コードは動いたか?」です。
SWE-Togetherでは、2部構成のスコアカードを使用します。

  • パートA:最終成績(正確性): AIは最終的に求められた通りに構築できましたか?
  • パートB:「手助け」スコア(ユーザーによる修正): これが大きな革新です。彼らは、ロボットユーザーがAIを何回修正しなければならなかったかをカウントします。
    • 例え話: 二人の生徒が数学のテストを受けていると想像してください。二人とも正解にたどり着きました。
      • 生徒Aは、自力で解きました。
      • 生徒Bは、先生に3回もヒントをもらい、大きな間違いを訂正されて、ようやく正解にたどり着きました。
    • SWE-Togetherでは、生徒Aの方が高いスコアを得ます。なぜなら、介入が少なくて済んだからです。論文ではこれを「ユーザー修正(User Correction)」と呼んでいます。

彼らが発見したこと

研究者たちは、利用可能な最もスマートな7つのAIモデルをテストしました。結果は以下の通りです。

  1. 賢いAIほど助けを必要としない: 明確なパターンがありました。(Claude Opus 4.8のような)「より賢い」AIモデルは、高い最終スコアを獲得すると同時に、ロボットユーザーからの修正も少なくなりました。「弱い」モデルは、スコアが低く、ロボットユーザーによる絶え間ない促しや修正を必要としました。
  2. ロボットユーザーは説得力がある: 彼らは、人間がロボットユーザーと本物の人間を区別できるかどうかをテストしました。人間には区別できませんでした。シミュレーションは非常に優れており、人間は両者を信頼性を持って見分けることができなかったのです。
  3. 効率性: モデルによっては、仕事を完了させるために高速で少ない「トークン(言葉や計算資源)」を使用したものもあれば、遅いけれど正確だったものもありました。

結論

この論文は、コーディングAIを、完璧な解答集がある記述式試験を受けているかのようにテストするのはやめるべきだと主張しています。私たちは、彼らが実際のオフィスで働いているかのようにテストする必要があります。

SWE-Togetherは、最高のコーディングエージェントとは、単に最終的にコードを修正できるモデルではなく、曖昧な指示を聞き、理解し、人間から「いや、そうじゃない」と絶えず言われることなく、自らのミスを修正できるモデルであることを証明しています。

要するに: これは、AIが単なる「コード生成器」であることではなく、優れた**協力者(コラボレーター)**であることを評価するためのベンチマークなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →