← 最新论文
💬 NLP

Closing the Loop: Universal Repository Representation with RPG-Encoder

该论文介绍了 RPG-Encoder,这是一个将仓库理解与生成统一为高保真、可扩展表示的框架,通过将原始代码编码为动态的仓库规划图(Repository Planning Graph),从而在代码定位方面实现了最先进的性能,并达到了近乎完美的重构覆盖率。

原作者: Jane Luo, Chengyu Yin, Xin Zhang, Qingtao Li, Steven Liu, Yiming Huang, Jie Wu, Hao Liu, Yangyu Huang, Yu Kang, Fangkai Yang, Ying Xin, Scarlett Li

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jane Luo, Chengyu Yin, Xin Zhang, Qingtao Li, Steven Liu, Yiming Huang, Jie Wu, Hao Liu, Yangyu Huang, Yu Kang, Fangkai Yang, Ying Xin, Scarlett Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图修复一座庞大而古老的图书馆,但书本散落各处,书架混乱不堪,而你手里唯一的地图要么是一份包含所有书名但不知道它们在哪里的清单,要么是一份包含所有房间但不知道里面装了什么的清单。

这就是计算机科学家在尝试编写软件智能体(AI 助手)来修复庞大代码库时所面临的问题。论文 《Closing the Loop: Universal Repository Representation with RPG-Encoder》 提出了一种新的方式来组织这些数字图书馆,让 AI 能够真正理解它们。

以下是使用简单类比对他们解决方案的拆解:

问题所在:“破碎的地图”

目前的 AI 智能体在尝试修复代码时,被困在两个糟糕的选择之间:

  1. 字典法 (API 文档): 想象你有一本字典,解释了每个词的含义,但它没告诉你这个词在第几页,或者句子是如何连接起来的。AI 知道“意义”,但在寻找“位置”时会迷失方向。
  2. 蓝图法 (依赖图): 想象你有一张图书馆房间和走廊的蓝图。它展示了如何从 A 房间走到 B 房间,但它没告诉你里面的书究竟是做什么用的。AI 知道“路径”,但不知道“用途”。

正因如此,AI 智能体经常会感到困惑、原地打转或产生幻觉(凭空捏造),因为它们无法将“是什么”(意义)与“在哪里”(结构)联系起来。

解决方案:“有生命的、呼吸着的地图” (RPG-Encoder)

作者创建了一个名为 RPG-Encoder 的工具。你可以把它想象成一张混合地图,结合了两者的优点。它创建了一个“仓库规划图”(Repository Planning Graph, RPG),作为 AI 的一个有生命、会呼吸的指南。

他们通过三个聪明的技巧构建了这张地图:

1. “翻译官” (编码)

系统不仅仅是逐行阅读代码,而是像一位超级聪明的图书管理员,阅读一堆乱七八糟的书,并立即为每本书制作一张摘要卡片。

  • 它的作用: 它将原始代码转化为“语义特征”(对代码功能的简单描述,例如“计算税款”),并将其与其物理位置联系起来。
  • 类比: 这就像是在仓库里给每个箱子贴上标签,不仅标明地址,还贴上清晰的标识,如“冬装”或“电子产品”。现在,AI 无需打开每个箱子就能准确知道里面装了什么。

2. “自我更新系统” (演化)

代码一直在变化。通常,如果图书馆增加了一个新翼楼,你就必须重新绘制整张地图,这既费时又费钱。

  • 它的作用: RPG-Encoder 只更新地图中发生变化的部分。如果一个函数被删除了,它就会移除那个分支;如果新增了一个,它就会将其插入。
  • 类比: 想象一个 GPS,它不需要在每条新街道开通时都重新扫描整个城市,它只需更新发生施工的具体街区即可。论文声称,与重新绘制整张地图相比,这节省了 95.7% 的工作量。

3. “智能向导” (操作)

一旦地图构建完成,AI 就可以像使用带有语音指令的 GPS 一样使用它。

  • 它的作用: AI 可以询问:“我在哪里可以找到处理用户登录的代码?”地图会立即指向正确的“功能区域”,然后引导 AI 沿着特定的“依赖路径”走向精确的代码行。
  • 类比: AI 不再需要通过询问“这本书在书架上吗?不在。那是在那个书架上吗?也不在”来四处徘徊,而是由向导说:“去历史区,第三排,第四层书架,就在那里。”

结果:它有效吗?

作者在两个主要挑战上测试了这个系统:

  1. 寻找漏洞 (定位): 他们要求 AI 在现实世界的软件项目(如著名的 SWE-bench)中寻找特定的漏洞。

    • 结果: RPG-Encoder 的表现显著优于以往的方法。在允许 5 次尝试的情况下,它 93.7% 的时间都能找到正确的代码,大幅领先于次优方法。这就像 AI 突然戴上了一副 X 光眼镜,能看清问题到底出在哪里。
  2. 重建图书馆 (重构): 他们尝试仅使用这张地图作为指南,从头开始重建整个软件项目。

    • 结果: AI 成功重建了 98.5% 的原始代码结构。相比之下,当使用标准文档(“字典法”)时,AI 在迷失方向之前仅能重建约 17% 的代码。这张地图提供了必要的结构,使 AI 能够保持航向。

核心结论

该论文认为,要让 AI 真正擅长软件工程,我们不能只给它代码,也不能只给它一份说明书。我们需要一张统一的地图,将“意图”(代码本应做什么)与“结构”(代码是如何组织的)连接起来。

RPG-Encoder 构建了这样一张地图,让 AI 能够以人类专家的精准度来导航复杂的代码库,同时随着代码的变化自动更新。它完成了从“理解问题”到“修复代码”之间的闭环。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →