← 最新论文
💻 computer science

From Fragments to Paths: Task-Level Context Recovery for Large Industrial Codebases

该论文介绍了 DeepDiscovery,这是一个两阶段的“定位—推理”框架,通过超越局部代码片段,有效地从大型工业级代码库中恢复与任务相关的上下文,从而显著提升了在复杂软件工程任务上的文件检索和编码智能体性能。

原作者: Jiawei He, Weisong Sun, Mengyu Shi, Jie Jia, Tong Bian, Xikai Yang, Dong Sun

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiawei He, Weisong Sun, Mengyu Shi, Jie Jia, Tong Bian, Xikai Yang, Dong Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位试图在一个庞大且混乱的城市(即大型工业级代码库)中破解复杂案件的高级侦探。这个城市拥有数百万栋建筑、秘密隧道、隐藏的布线以及不断变化的街道指示牌。你的任务是找到解决犯罪(即任务,如修复 Bug 或添加功能)所需的特定线索。

问题在于,大多数现有的侦探工具(现有的 AI 方法)就像只能照亮眼前街角的电筒。它们可能会找到一些相关的文档,但会错过至关重要的连接:建筑之间的隐藏布线、特定机器的使用手册,或是隔了三个街区外的测试日志。如果看不清全局,侦探就会陷入困境。

这篇论文介绍了一种新的侦探工具,名为 DEEPDISCOVERY。它不再只是随机地照亮某些点,而是使用一种聪明的两步策略,来重建侦探完成任务所需行走的整个“路径”。

以下是它的工作原理,使用了简单的类比:

1. 两步策略:“寻找锚点,然后追踪路径”

大多数工具试图同时搜索整个城市,这既慢又混乱。DEEPDISCOVERY 分为两个阶段工作:

  • 第一阶段:锚点(定位)
    想象你正在体育场里寻找一个特定的人。与其扫描每一个座位,你首先寻找“高置信度”的入口点:比如提到的球队标志、特定的区域编号或 VIP 通行证。

    • 在论文中: 系统快速扫描代码以找到一些“锚点”(关键文件,如主配置文件或特定的服务入口点)。它利用文件名、文件夹结构和编码模式来推测行动发生的地点,而无需阅读每一行代码。
  • 第二阶段:路径(推理)
    一旦找到了锚点,侦探并不会止步于此。他们开始向外扩展“实现路径”。

    • 在论文中: 系统从这些锚点向外扩展。它寻找显式链接(比如连接两个房间的门)和隐式链接(比如建筑蓝图中未写明的秘密隧道或两人之间的电话联系)。它通过这些连接进行追踪,以找到任务实际需要的配置文件、测试和相关代码。

2. “智能预算”(元数据优先)

想象你在为徒步旅行打包背包,但空间有限,只能装下几件物品。

  • 旧方法: 你把整座图书馆都塞进包里,希望能找到那张正确的地图。这既沉重又缓慢。
  • DEEPDISCOVERY 的方法: 你先看书脊(元数据/摘要)。如果书脊显示这本书是关于“烹饪”的,你就把它留在书架上。只有当书脊表明它对你的徒步旅行至关重要时,你才会打开书并阅读其中的页面(加载全文)。
  • 在论文中: 系统首先读取文件的“摘要”。只有当该文件的全文对任务绝对必要时,它才会加载沉重的全文内容。这节省了时间和成本(计算能力)。

3. 为什么这很重要:“新鲜度”问题

许多现有工具依赖于城市的预制地图(离线索引)。但在一个快速扩张的城市里,一旦有新建筑建成,地图就会立刻过时。

  • 论文的观点: DEEPDISCOVERY 不等待新地图绘制完成。它是在此时此刻探索这座城市。这意味着即使代码每分钟都在变化,它也能完美运行,而这在大型公司中非常普遍。

4. 结果:解决更多的案件

作者通过三种方式测试了这个新的侦探工具:

  • 试驾测试(方法层面): 他们给了它 27 个中等难度的谜题。DEEPDISCOVERY 在 92.6% 的情况下找到了完整的一套必要线索,击败了所有其他工具。它在不需要预建任何地图的情况下完成了任务,因此速度更快、成本更低。
  • 现实世界(工业系统): 他们将它接入了一家大型公司使用的六个不同的真实 AI 编程助手中。在几乎所有案例中,这些助手在寻找修复问题所需的全套文件方面都变得更加出色。对于大型复杂项目,这种提升非常显著(成功率提升高达 9.2%)。
  • 最终考试(端到端): 他们在著名的软件工程任务基准测试 SWE-bench Verified 上对其进行了测试。
    • 结果: 使用 DEEPDISCOVERY 的系统解决了 78.6% 的任务。
    • 对比: 没有使用 DEEPDISCOVERY 的同一系统仅解决了 70.4% 的任务。
    • 结论: 通过更好地理解代码,该系统在 500 个任务中多解决了 41 个任务。

总结

可以将 DEEPDISCOVERY 想象成一位不仅会阅读说明书最近一页,而且理解整台机器如何运作的侦探。它寻找起点,追踪隐藏的电线和连接,并且只在绝对必要时才阅读沉重的指令。

论文声称,通过这样做,AI 编程助手可以停止遗漏关键的拼图碎片,并开始更可靠地解决复杂的软件工程问题,尤其是在庞大且快速变化的代库中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →