← 最新の論文
🤖 AI

One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents

本論文は、単一の実行認識型「ジャンプ・トゥ・ディフィニション」ツールを活用して最先端のレポジトリレベルの問題特定を達成し、蒸留に依存せずに大規模なクローズドソースモデルを上回る強化学習で訓練された LLM エージェント「RepoNavigator」を導入する。

原著者: Zhaoxi Zhang, Yitong Duan, Yanzhi Zhang, Yiming Xu, Zhixiang Wang, Kun Liang, Weikang Li, Jiahui Liang, Deguo Xia, Jizhou Huang, Jiyan He, Yunfang Wu

公開日 2026-05-27
📖 1 分で読めます☕ さくっと読める

原著者: Zhaoxi Zhang, Yitong Duan, Yanzhi Zhang, Yiming Xu, Zhixiang Wang, Kun Liang, Weikang Li, Jiahui Liang, Deguo Xia, Jizhou Huang, Jiyan He, Yunfang Wu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

「One Tool Is Enough」という論文を、平易な言葉と創造的な比喩を用いて解説します。

大きな問題:デジタル図書館で見失うこと

あなたが探偵で、巨大な多階建ての図書館にある壊れた機械を修理しようとしている状況を想像してください。この図書館には数百万冊の本(コードファイル)があり、それらは複雑に相互接続されています。誰かが「『分離性』という機能に何か問題がある」と言いますが、どの本、どのページを見るべきかは教えてくれません。

過去には、AI 探偵(LLM)たちは、数十種類もの専門ツールが入った巨大な工具箱を持ってこの問題を解決しようとしました。「著者で検索」ツール、「タイトルで発見」ツール、「索引を確認」ツール、「目次を読む」ツールなどです。

  • 問題点: これらすべてのツールを持ち運ぶのは重く、混乱を招きます。AI はしばしば圧倒され、間違ったツールを選んだり、順序を間違えて使ったりします。それは、十個の懐中電灯を同時に操りながら、干し草の山から特定の針を見つけようとするようなものです。

新しい解決策:「マジックジャンプ」

この論文の著者である RepoNavigator は、異なるアプローチを試すことにしました。彼らは問いかけました:「もし探偵に、たった一つのスーパースターなツールだけを与えたらどうなるでしょうか?」

彼らは**「Jump(ジャンプ)」**と呼ばれる単一のツールを作成しました。

  • 仕組み: 探偵が本を読んでいて、理解できない単語(「シンボル」)に出会ったと想像してください。どこを探すべきか推測する代わりに、その単語に向かって単に「ジャンプ!」と言えばよいのです。瞬時に、探偵はその単語が元々定義されていた正確なページへテレポートします。
  • 比喩: ウェブサイト内のハイパーリンクで「Ctrl+ クリック」をするようなものです。インターネット全体を検索する必要はありません。リンクをクリックするだけで、直接ソースへ移動します。

訓練:実践を通じて学ぶ(強化学習)

AI はこのツールを手にし、ただ運を天に任せたわけではありません。著者たちは、**強化学習(RL)**と呼ばれる方法でこれを訓練しました。

  • 従来の方法: 通常、AI を教えるには、他の賢い AI が問題を解決する例を見せます(生徒が先生の宿題を写すようなものです)。この論文は、「いや、それはやめよう」と言います。
  • 新しい方法: AI 自身に問題解決を試させました。
    1. AI は推測を行い、「ジャンプ」ツールを使います。
    2. 正しい場所へジャンプすれば、「ご褒美」(報酬)がもらえます。
    3. 間違った場所へジャンプしたり、行き詰まったりすれば、「ノー」(ペナルティ)が与えられます。
    4. 数千回の試行を通じて、AI は最適な経路を学び、壊れたコード部分を見つけるためにどの単語へ「ジャンプ」すべきかを正確に把握するようになります。

結果:小ささが力になる

この論文は、GitHub などで見られるような実世界のソフトウェアプロジェクトでこのシステムをテストしました。結果は驚くべきものでした:

  • 小さなモデルが大きなモデルに勝る: この方法で訓練された小さな AI(70 億パラメータ)は、従来の「多数のツール」アプローチを用いたより高価な大規模 AI(140 億パラメータ)よりも優れた性能を発揮しました。
  • 巨人たちを打ち負かす: 彼らの AI の最大バージョン(320 億パラメータ)は、ほとんどのテストにおいて、GPT-5 などの最先端のクローズドソースモデルさえも凌駕しました。
  • 単純さが勝つ: 五つや六つのツールではなく、たった一つのツールを使うことで、システムはより高速になり、信頼性が高まり、制御しやすくなりました。これは、完璧に研ぎ澄まされたメス一本が、スイスアーミーナイフよりもよく仕事を果たすことを証明しました。

まとめ

この論文は、複雑なコードをナビゲートする際、**「少ないことが多い」**と主張しています。AI に多くの検索ツールが入った散らかった工具箱を与えるのではなく、コードの実際の流れに従う「ジャンプ」という一つのツールを与えるのです。この単純なエージェントを、試行錯誤を通じて学習させる(強化学習)ことで、バグを修正すべき場所を正確に見つける能力が驚くほど高まり、はるかに大きく複雑なシステムさえも凌駕することができました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →