One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents
本文介绍了 RepoNavigator,这是一个经过强化学习训练的大语言模型智能体,它利用单一的感知执行的“跳转至定义”工具,实现了最先进的仓库级问题定位,在不依赖知识蒸馏的情况下超越了更大规模的闭源模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和创意类比对论文《一个工具就足够了》的解释。
核心难题:在数字图书馆中迷失
想象你是一名侦探,试图在一座巨大的多层图书馆里修理一台损坏的机器。这座图书馆藏有数百万本书(代码文件),它们以复杂的方式相互关联。有人告诉你:"‘可分离性’功能出了问题”,但他们没告诉你该看哪本书或哪一页。
过去,AI 侦探(大语言模型)试图通过携带一个装满数十种不同专用工具的巨大工具箱来解决这个问题:有“按作者搜索”工具、“按标题查找”工具、“查阅索引”工具、“阅读目录”工具等等。
- 问题所在:携带所有这些工具既沉重又令人困惑。AI 常常感到不知所措,选错工具,或者使用顺序错误。这就像在试图从干草堆里找一根特定的针时,还要同时挥舞十支不同的手电筒。
新方案:“魔法跳跃”
这篇论文的作者 RepoNavigator 决定尝试一种不同的方法。他们问道:如果我们只给侦探一个超级强大的工具,会怎样?
他们创建了一个名为 “跳跃(Jump)” 的单工具。
- 工作原理:想象侦探正在阅读一本书,看到了一个不懂的词(一个“符号”)。与其猜测该去哪里查找,他们只需对该词说一声“跳跃!”。瞬间,侦探就被传送到该词最初被定义的确切页面。
- 类比:这就像在网站上对超链接进行“Ctrl+ 点击”。你不需要搜索整个互联网;只需点击链接,就会被直接带到源头。
训练:在实践中学习(强化学习)
AI 并非只是拿到这个工具就指望运气。作者使用一种称为 强化学习(RL) 的方法对其进行了训练。
- 旧方法:通常,为了教会 AI,你会展示其他智能 AI 解决问题的示例(就像学生抄袭老师的作业)。这篇论文说:“不,我们不要那样做。”
- 新方法:他们让 AI 尝试独立解决问题。
- AI 做出猜测并使用“跳跃”工具。
- 如果它跳到了正确的位置,它就得到一份“奖励”(奖励)。
- 如果它跳到了错误的位置或陷入困境,它就得到“否定”(惩罚)。
- 经过数千次尝试,AI 学会了最佳路径,弄清楚究竟该“跳跃”到哪些词,以找到代码中损坏的部分。
结果:小即是强
该论文在现实世界的软件项目(如 GitHub 上的项目)上测试了此系统。结果令人惊讶:
- 小模型胜过大模型:用这种方法训练的较小 AI(70 亿参数)的表现优于使用旧“多工具”方法的更大、更昂贵的 AI(140 亿参数)。
- 击败巨头:他们 AI 的最大版本(320 亿参数)在大多数测试中甚至超越了最先进的闭源模型(如 GPT-5)。
- 简单制胜:通过使用一个工具而不是五六个,该系统变得更快、更可靠且更易于控制。它证明了当你只需要一把完美锋利的解剖刀就能更好地完成任务时,你并不需要一把瑞士军刀。
总结
该论文认为,在导航复杂代码时,少即是多。与其给 AI 一个塞满多种搜索工具的杂乱工具箱,不如给它一个遵循代码实际运行流程的“跳跃”工具。通过训练这个简单的智能体通过试错(强化学习)来学习,它变得极其擅长精确定位需要修复的漏洞,其表现往往优于更大、更复杂的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。