← 最新の論文
💻 computer science

RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository

本論文は、既存のベンチマークが見過ごしてきた「README からマイクロサービスリポジトリの完全生成」という実世界開発ワークフローに焦点を当て、多言語・多フレームワークに対応した初の評価基準「RepoGenesis」を提案し、その品質を検証するとともに、同データで微調整したエージェントが最先端モデルと同等の性能を発揮することを示しています。

原著者: Zhiyuan Peng, Xin Yin, Pu Zhao, Fangkai Yang, Lu Wang, Ran Jia, Xu Chen, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

公開日 2026-04-16
📖 1 分で読めます☕ さくっと読める

原著者: Zhiyuan Peng, Xin Yin, Pu Zhao, Fangkai Yang, Lu Wang, Ran Jia, Xu Chen, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

🏗️ 1. 背景:これまでの AI は「レンガ」しか積めなかった

これまでの AI(大規模言語モデル)は、プログラミングのテストでは**「レンガ」「窓」**を作るのが得意でした。

  • 例え話: 「この窓の設計図(コード)を書いて」と言われれば、きれいな窓を作れます。
  • しかし: 「この家をゼロから建てて」と言われると、どうすればいいかわからなくなります。壁と屋根のつなぎ目がバラバラだったり、電気配線が繋がっていなかったりします。

これまでのテストは「窓(関数)」や「部屋(クラス)」を作る能力を測るものが中心でした。でも、実際の仕事は「家(マイクロサービス)」全体をゼロから建てる必要があります。

🚀 2. 新登場!「RepoGenesis(リポジトリー・ジェネシス)」とは?

この論文の著者たちは、**「AI に『家』全体をゼロから建てさせるテスト」**を作りました。それが「RepoGenesis」です。

  • 何をするテスト?

    • 人間が「こんなお店を作りたいです(要件)」というメモ(README)を AI に渡します。
    • AI は、そのメモを見て、**「設計図、壁、電気、水道、鍵、すべてを含んだ完成された建物(コードの集まり)」**をゼロから作ります。
    • 最後に、その建物が実際に動いて、お客さん(テスト)を受け入れられるか確認します。
  • どんなデータが入ってる?

    • 106 個の「家(リポジトリ)」があります。
    • Python と Java という 2 つの言語で、18 種類の分野(ゲーム、チャット、データ管理など)を網羅しています。
    • 1,258 個の「入り口(API)」と、2,335 個の「検査(テストケース)」を用意しました。

🧪 3. 実験結果:AI は「家」を建てられるのか?

著者たちは、最新の AI アシスタント(Cursor や Copilot などの商用ツール)や、オープンソースの AI たちにこのテストを受けさせました。

✅ できたこと(良い点)

  • 設計図はよく描ける: 必要な「入り口(API)」の多くを、AI は見事に作れました(70% 以上)。
  • 建物は立つ: 多くの AI は、コードをコンパイルしてサーバーを立ち上げることに成功しました。

❌ できなかったこと(課題)

  • 完成品は少ない: 「すべてのテストをパスする完璧な家」を作れたのは、最高の AI でも 20% 程度でした。
  • なぜ失敗するのか?
    1. つなぎ目のミス: 壁と屋根のつなぎ目がズレている(ファイル間の整合性が取れていない)。
    2. 設計の矛盾: 1 階の設計と 2 階の設計が合っていない(アーキテクチャの整合性がない)。
    3. 部品不足: 必要なネジや配線(依存関係)が抜けている。

💡 重要な発見:
「コードを書く能力」と「実際に動くシステムを作る能力」には大きなギャップがあります。

  • 例え話: AI は「美しい家具(コード)」をたくさん作れますが、それらを組み合わせて「住める家(動くシステム)」にすると、ドアが開かない、電気がつかないといったトラブルが起きるのです。

🛠️ 4. 解決策のヒント:AI を鍛え直すと?

著者たちは、このテストデータを使って、特定の AI(Qwen3-8B)を「特別訓練(微調整)」させました。

  • 結果: 訓練を受けた AI は、「GPT-5 mini」という超高性能な AI と同等の成績を叩き出しました。
  • 意味: 「完璧なテストデータがあれば、AI は劇的に成長できる」ということを証明しました。

🎯 5. まとめ:この研究がなぜ重要なのか?

この研究は、**「AI が本当の意味で『ソフトウェア開発者』になれるかどうか」**の分水嶺を示しています。

  • 現状: AI は「助手」としては優秀ですが、「一人前の職人」として家をゼロから建てるには、まだ「設計の整合性」や「部品管理」で失敗します。
  • 未来: この「RepoGenesis」というテストを使って、AI を鍛え続けることで、近い将来、人間が「作って」と言うだけで、完璧な Web アプリが自動で完成する日が来るかもしれません。

一言で言うと:

「これまでの AI は『レンガ』を作るのが上手でしたが、今回は『家』全体を建てるテストをしました。まだ完璧ではありませんが、このテストで AI を鍛えれば、近い将来、AI が一人前の建築士になれるはずです!」

という内容です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →