← 最新の論文
🤖 AI

How Do Practitioners Build SE Agents? Insights from a Mixed-Methods Study

100人の実務家を対象とした混合研究法による本論文は、ソフトウェアエンジニアリング・エージェントの構築が、開発のボトルネックをコーディングから要件定義や調整といった非コーディング活動へとシフトさせ、7段階のプロセスによって特徴付けられる評価主導型のワークフローと、信頼性の低い評価シグナルや理解の負債といった課題を促進していることを明らかにしている。

原著者: Yunbo Lyu, David Williams, Jieke Shi, Zhensu Sun, Chao Peng, Zhou Yang, Federica Sarro, David Lo

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Yunbo Lyu, David Williams, Jieke Shi, Zhensu Sun, Chao Peng, Zhou Yang, Federica Sarro, David Lo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

かつてソフトウェア開発が、ハンマーとノコギリを使って家を建てるようなものだったと想像してみてください。板を一枚ずつ切り、釘を一本ずつ打ち、表面を一つひとつ手作業で磨かなければなりませんでした。それは遅く、疲れやすく、「大変な部分」は単にハンマーを振ることでした。

今、誰かがあなたに、瞬きする間に家一軒を切り出し、釘を打ち、磨き上げることができる、魔法のような超高速ロボットを渡したと想像してください。突然、ハンマーはもう問題ではなくなりました。問題は、あなたが設計図を描き終える前に、ロボットがあまりにも速すぎて大邸宅を建ててしまうことです。

これは、開発者がSEエージェント(コードを書くAIロボット)を使い始めたときに、まさに起こったことです。研究者たちが12社から20人の「建築家」にインタビューし、さらに80人に調査を行った新しい研究によると、ロボットによってコードを書くことは安価で高速になりましたが、仕事が消えてなくなったわけではありません。その代わりに、「ボトルネック」(プロセスの交通渋滞)が道路の別の場所に移動しただけなのです。

以下に、好奇心旺盛な探検家の言葉を用いて、研究者たちが発見した内容を記します。

新しい「7ステップのダンス」

この論文は、これらのAIエージェントを構築することはもはや直線的なプロセスではなく、7つのステップを持つループするダンスであると示唆しています。それは工場の組立ラインというよりも、より高いスコアを目指してレベルを何度もリプレイし続けるビデオゲームのようなものです。

  1. 設計図(要件/Requirements): ロボットに何をすべきかを伝えます。しかし今では、人間とロボットの両方が読めるように、指示を非常に明確に書かなければなりません。
  2. スコアカード(評価/Evaluation): これが最も重要な新しいステップです。作業の最後にチェックするだけでなく、スコアカードを使用して、ロボットが作業している最中に舵取りを行います。
  3. 燃料(データ/Data): ロボットに、学習のための「良い仕事」の例を与えます。
  4. 構築(システム構築/System Construction): ロボットの「脳(モデル)」を選び、その周囲に「ハーネス(ツールやメモリを備えた鎧のようなもの)」を構築します。
  5. 試運転(テストとデプロイ/Testing & Deployment): ロボットを走らせ、クラッシュしないかを確認します。
  6. フィードバックループ(人間のフィードバック/Human Feedback): ロボットの動きを観察し、「いや、こうして」「はい、それが素晴らしい」と伝えます。
  7. チューニング(適応的メンテナンス/Adaptive Maintenance): ロボットの脳は、作成者によるアップデートを受けて、考え方が変わることがあります。その変化についていくために、常にハーネスを微調整しなければなりません。

大きな転換:ハンマー使いからロボット・マネージャーへ

研究によると、ロボットが非常に速くコードを書けるため、「コーディングが難しい部分である」という古い概念は否定されました。研究者たちは、コーディングは決して最も難しい部分ではなく、単に最も「声が大きかった(目立っていた)」部分に過ぎなかったのだと主張しています。

今やロボットが重労働をこなすようになったため、本当の仕事は「レビュー」と「評価」へとシフトしました。

  • 「バイブ・コーディング(雰囲気コーディング)」の効果: ロボットがこれほど速く構築できるため、「研究者」「エンジニア」「マネージャー」の境界線が曖昧になっています。一人の人間が、アイデアを思いつくことから最終的なバグの修正まで、全工程を行うこともあります。
  • 「ブラックボックス」問題: 研究者たちは、ロボットは「ブラックボックス(どのように考えているのかが見えない)」であるため、単に信頼することはできないと示唆しています。そのため、厳格な「評価駆動型開発(Evaluation-Driven Development)」のスタイルが必要です。つまり、作業を開始する前に成功のルールを定義し、ロボットが単に速くなっているのではなく、実際に向上しているかどうかを常にチェックする必要があります。

6つの罠(課題)

超高速のロボットがあっても、建築家たちは6つの大きな難関に直面しました。論文は、これらが単なる些細な不具合ではなく、現実的で困難な問題であることを示唆しています。

  1. 壊れたスコアカード: ロボットがうまくやったかどうかをどうやって知るのでしょうか?研究者たちは、ロボットを採点するために使われる「テスト」がしばしば壊れていることを発見しました。時には、ロボットがテストが期待していたものよりも優れた解決策を見つけたとしても、テストが古い答えを探しているために「不合格」と判定されることがあります。また、テストを実行するたびにコストがかかりすぎることもあります。
  2. 「何も変えなければ、すべてが変わる」の呪い: これは不気味な現象です。研究者たちは、ロボットの脳を作った会社がアップデートを行った場合(たとえ自分のコードには一切触れていなくても)、あなたのロボットが突然異なる挙動をし始めることを発見しました。昨日まで機能していたツールが、コードを一行も変えていないのに今日壊れてしまうのです。
  3. 安全性 vs 速度: 建築家たちは、仕事を早く進めるために、ロボットに対して恐怖を感じながらも、そのまま走らせてしまうことがよくあります。論文はこのことは危険であると示唆しています。あるチームはロボットを解き放ったところ、指示を忘れたために、誤ってユーザーのホームディレクトリを削除してしまいました。
  4. 「暗黙のルール」のギャップ: ロボットは書かれたことしか読めません。しかし現実の世界では、多くの知識は(なぜ特定の壁が傾いて建てられたのかといった、人の頭の中にしかない)「語られない知識」として存在します。研究者たちは、ロボットはこの「語られない」知識にアクセスできず、混乱を招くことを発見しました。
  5. 理解の負債(Comprehension Debt): これが最大の驚きです。ロボットは人間が理解できるよりも速くコードを書いています。それはまるで、ロボットが一日で摩天楼を建てている一方で、人間はまだ設計図を理解しようともがいているような状態です。建築家たちは、理解できないコードの「負債」を蓄積しています。これを解決するために、一部のチームはコードそのものを保存するのではなく、コードを再構築するための「指示(インストラクション)」を保存し始めています。
  6. 偽りの生産性: もし単にロボットが書いたコードの行数を数えるだけなら、全員が非常に生産的に見えるでしょう。しかし研究者たちは、これが罠であると示唆しています。誰も理解していない、あるいは誰も必要としていないコードを1万行書くことは、「生産的」ではありません。それは単なる「ノイズ」です。

私たちはどの程度確信しているのか?

研究者たちは、単に推測したのではなく、これらを「測定」したため、これらの知見に強い自信を持っています。

  • 彼らは20人の専門家にインタビューを行い、その後80人に調査を行いました。
  • 調査グループに対し、これらの知見に同意するか尋ねたところ、**91%**が新しいワークフローに同意し、**71%から95%**の間で具体的な課題についても同意しました。
  • さらに、元のインタビュー対象者に戻って、彼らが要約に同意するかどうかを確認するプロセス(メンバー・チェッキング)を行いましたが、専門家たちは「そうです、これがまさに私たちのやっていることです」と答えました。

結論

この論文は、AIエージェントを構築することはソフトウェアエンジニアリングを容易にしたのではなく、単に「異なったもの」にしたのだと示唆しています。「難しい部分」は、コードを書くことから、ロボットを管理し、その仕事をチェックし、ロボットが誤ってインターネットを削除しないように監視することへと移動しました。

研究者たちは、実装が安価になるにつれて、ボトルネックは消えるのではなく、単に移動するのだと結論づけています。ソフトウェア構築の未来は、より速くタイピングすることではなく、重労働をこなすロボットのために、より優れたマネージャー、より厳格な審判、そしてより賢明な設計者になることにあるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →