← 最新の論文
💻 computer science

SWE-QA: Can Language Models Answer Repository-level Code Questions?

本論文は、既存のスニペットベースのデータセットの限界を克服し、576 件の厳選された質問と関連するエージェントフレームワークを通じて大規模言語モデルを複雑な複数ファイルの推論タスクで評価する 77,100 件の GitHub イシューから派生したリポジトリレベルのコード質問応答ベンチマークである SWE-QA を紹介する。

原著者: Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

公開日 2026-04-28
📖 1 分で読めます☕ さくっと読める

原著者: Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大な10階建ての図書館がどのように機能するかを理解しようとしていると想像してください。

問題:「スニペット」の罠
これまで、AI の「コード脳」に対するほとんどのテストは、本から孤立した1ページだけを見せて、「この文の意味は何か?」と問うようなものでした。AI がその答えを正しく導き出せたとしても、現実世界のソフトウェアは単一のページではありません。それは図書館全体です。「日没時に玄関の鍵が自動的にロックされるのはなぜか?」という問いに答えるには、地下室を歩き、屋根裏の配線を確認し、管理者室の設計図を読む必要があります。多くの異なるファイルにまたがって点をつなぐ必要があるのです。

以前の AI テストが失敗したのは、AI にこの「図書館巡り」を強制しなかったからです。それらは AI が単一のページを読めるかどうかだけをテストしていました。

解決策:SWE-QA(図書館巡り)
この論文の著者たちは、SWE-QA という新しいテストを構築しました。これは AI に対する厳格な「図書館巡り」試験と考えることができます。

  • ソース資料: 彼らは単に質問を作り上げたわけではありません。15 の実在する人気ソフトウェア「ライブラリ」(GitHub リポジトリ)に入り、実際の開発者同士が実際にやり取りした 77,000 の実質問を調査しました。
  • 分類体系(地図): これらの質問を地図のように整理しました。「これは何か(What)?」「なぜこのように作られたのか(Why)?」「コードはどこに隠れているのか(Where)?」「どのように機能するのか(How)?」という問いを立てました。
  • 構築: 720 の高品質な質問を作成しました。これに答えるには、AI は単に推測するだけではいけません。以下の手順を踏む必要があります:
    1. 正しいファイルを見つける(適切な棚を見つけるようなもの)。
    2. そのファイル内のコードを読む。
    3. 異なるファイルにジャンプして、それらがどのように接続されているかを確認する(マルチホップ推論)。
    4. 全体システムを説明する回答を統合する。

実験:AI 司書たちのテスト
研究者たちは、利用可能な最も賢い AI モデル 6 つ(GPT-5.1、Gemini など)を選び、この「図書館巡り」試験を行いました。3 つの異なる方法でテストを行いました:

  1. 「記憶屋」(直接プロンプト): 図書館の本を与えずに、AI に単に質問しました。
    • 結果: AI は見事に失敗しました。まるで一度も訪れたことのない図書館について説明するように求められたようなものです。
  2. 「索引発見者」(RAG): 回答する前に関連ページを検索できるツールを AI に与えました。
    • 結果: 大幅に改善されました!AI は正しいページを見つけられますが、時折、それらの間のつながりを見逃していました。
  3. 「探偵エージェント」(エージェントフレームワーク): AI に「探偵キット」(OpenHands などのツール)を与え、自ら考え、検索し、読み、再度検索し、点をつなぐことを可能にしました。
    • 結果: これが勝者でした。コードベースを能動的に探索する探偵のような振る舞いをする AI が、最高得点(100 点中約 70 点)を獲得しました。

発見:AI ができるとできないこと

  • 良い知らせ: AI は、なぜ特定のものがそのように作られたのか(設計の根拠)や、特定の機能がどのように機能するのかを説明することに非常に優れてきています。特に、その説明がコードのコメントに明確に書かれている場合です。
  • 悪い知らせ: AI は依然として「どこ(Where)」の質問(10 ファイルにわたって特定の変数が正確にどこで定義されているかを見つける)や、長い依存関係の連鎖を追跡する必要がある複雑な「何(What)」の質問に苦労しています。まるで AI は図書館の物語を理解できるものの、裏口の特定の鍵を見つけようとするときに道に迷ってしまうようなものです。
  • コスト: 「探偵」アプローチが最も効果的ですが、高価です。単なる推測に比べて、計算リソース(トークン)を 100 倍使用します。それは一瞥と完全な鑑識調査の違いです。

結論
この論文は、AI に対するより難しく、より現実的な新しいテストを導入します。それは、AI がソフトウェアの理解において有望である一方で、現実世界のコードの複雑で相互接続された性質をナビゲートするには依然として支援が必要であることを示しています。最良の結果は、単にスニペットを読むのではなく、コードファイルを能動的に「歩き回る」ことができる AI エージェントから得られます。

要約: 私たちは、AI がその小さな一部ではなく、ソフトウェアプロジェクト全体を本当に理解できるかどうかを確認するために、より厳しいテストを構築しました。AI は上達していますが、最も難しいパズルを解くには、良い地図と探偵の思考様式が必要です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →