← 最新の論文
💻 computer science

ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports

ReProAgentは、バグ再現テストの生成を、バグ特定、根本原因分析、プランニング、および生成という局所的なステージに分解することで、既存のプロンプトベースのアプローチを凌駕する、マルチステージかつツール拡張型のエージェントフレームワークであり、多様なベンチマークにおいて著しく高い成功率を達成しています。

原著者: Quanjun Zhang, Yi Zheng, Ye Shang, Weifeng Sun, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao

公開日 2026-07-13
📖 1 分で読めます☕ さくっと読める

原著者: Quanjun Zhang, Yi Zheng, Ye Shang, Weifeng Sun, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは探偵になりきって、あるミステリーを解こうとしていると想像してください。しかし、手元にある唯一の手がかりは、「キッチンで変なことが起きた!」と書かれた、ぼやけた手書きのメモだけです。ソフトウェアの世界では、このメモは「イシューレポート(不具合報告)」と呼ばれます。通常、開発者は何が間違っていたのかを推測し、それを証明するためのテストを書き、そして修正を試みなければなりません。しかし、多くの場合、テストが存在しないため、このプロセスは遅く、もどかしいものになります。

しばらくの間、賢いコンピュータプログラム(大規模言語モデル、通称LLM)は、これらのテストを自動的に書こうと試みてきました。彼らは、メモを読んで即座に「犯人はトースターだと思う!」と叫ぶ探偵のようなものでした。彼らは近くにあるいくつかの手がかり(コードのテキスト)をつかみ、答えを推測しました。しかし、この論文は、そのアプローチは単純すぎると主張しています。それは、容疑者を尋問したりアリバイを確認したりすることなく、犯罪現場の写真だけを見て複雑な殺人事件を解決しようとするようなものです。これらの古い手法は、コードの異なる部分(「キッチン」、「リビングルーム」、「地下室」)がどのように繋がっているかを理解していなかったため、真の問題を見逃してしまうことがよくありました。

ReProAgent:スーパー探偵チームの登場

著者たちは、ReProAgentと呼ばれる新しいシステムを構築しました。ReProAgentは、一人の探偵が答えを推測するのではなく、厳格な4ステップの調査プロセスに従って働く、専門化されたエージェントのチームです。彼らは単に推測するのではなく、調査し、分析し、計画し、そして行動します。

彼らの「探偵のワークフロー」は次のように機能します。

  1. 探索(バグの局所化): まず、チームは建物全体を見るわけではありません。彼らは、図書館員が特定の書籍を探し出すように、特別なツールを使ってコードの中を検索します。キーワードを探し、「パン屑(依存関係)」を辿ることで、どのファイルや行のコードが異常を起こしているのかを正確に特定します。
  2. 尋問(根本原因分析): 容疑者を見つけたとしても、彼らはただ逮捕するわけではありません。彼らはエラーが辿った正確な経路を追跡します。「エラーはどのようにして玄関から裏窓へと移動したのか?」と問いかけます。単に「どこで」バグが起きたかではなく、「なぜ」起きたのかを理解するために、実行パスのマップを作成します。
  3. 罠のデザイン(テスト計画): 罠を仕掛ける前に、彼らは計画を立てます。バグを再び出現させるために、どのような条件を満たす必要があるのかを正確に突き止めます。それは、容疑者が必ず罪を露呈してしまうような、特定のシナリオを設定するようなものです。
  4. 潜入捜査(テスト生成とレビュー): 最後に、彼らはテスト(罠)を書き、安全で隔離されたサンドボックス(デジタルな遊び場)で実行します。しかし、ここが面白い点です。もしテストがバグを捕まえられなかったり、あるいは間違ったものを捕まえてしまったりした場合、チームは諦めるのではなく、結果をレビューし、「正しい犯人を捕まえられたか?」と問いかけ、テストを洗練させます。彼らは、テストが完璧にバグを再現するまで、このプロセスをループさせます。

結果:うまくいったのか?

チームは、2つの大規模な現実世界のソフトウェア問題のセット(SWT-bench-liteおよびSWT-bench-verified)でReProAgentをテストしました。結果は目覚ましいものでした。

  • 小規模なセット(SWT-bench-lite)において、ReProAgentは**58.43%**のケースでバグの再現に成功しました。
  • より困難な検証済みセット(SWT-bench-verified)において、**70.30%**のケースで成功しました。

これを比較すると、次に優れた手法(AssertFlipと呼ばれるシステム)は、小規模なセットにおいて約38.0%の問題しか解決できませんでした。ReProAgentは単に競合に勝っただけでなく、同じ「脳」(GPT-5-miniというモデル)を使用した場合、次点のシステムよりも約20パーセントポイント多くケースを解決し、彼らを置き去りにしました。

また、このチームが異なる「脳」(Qwen3-CoderDeepSeek-V3.2といった他のAIモデル)とも連携できるかどうかを調査しました。結果、問題なく動作しました!システムはこれらすべてにおいてうまく機能しており、これは、単に最も賢い単一の探偵を持つことよりも、探偵としての「プロセス」を持つことの方が重要であることを示唆しています。

ReProAgentが「行わないこと」

この論文は、ReProAgentが何では「ない」のかについても明確に述べています。それは、バグ自体を修正する魔法の杖ではありません。その役割は、バグが存在することを証明するためのテストを厳密に書くことです。しかし、著者たちは、作成されたテストをバグを修正する他のシステムに与えたとき、それらのシステムが向上することを発見しました。例えば、ReProAgentのテストをSWE-agentというシステムを支援するために使用したところ、正常に修正された問題の数は143から153へと増加しました。

コスト

スーパー探偵になるには、少しの費用がかかります。論文によると、ReProAgentを実行するコストは1ケースあたり約0.14ドルです。これは、より単純な手法(約0.11ドル)よりもわずかに高価ですが、論文は、実際に問題を解決できる頻度が高いことから、数セントの追加コストは価値があると主張しています。ほとんどの場合、システムが正解にたどり着くまで、平均して約1.29回の「潜入捜査」を行うだけで済みました。

結論

複雑なソフトウェアの謎を解くためには、単にいくつかの言葉に基づいた素早い推測に頼ることはできない、とこの論文は示唆しています。全体像を把握し、エラーの経路を辿り、証拠を再確認するという、構造化された多段階の調査が必要です。ReProAgentは、AIエージェントに適切なワークフローを与えれば、非常に効果的にソフトウェアのバグを見つけ出し、証明できることを示しています。つまり、ぼやけた目撃者のメモを、鮮明な事件ファイルへと変えることができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →