← 最新论文
💬 NLP

Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agents

本文介绍了 Agent Retrieval Bench,这是一个用于评估编码智能体在利用真实工作流信号进行上下文检索能力的全面文件级基准测试,该测试揭示了没有单一的检索方法能在多样化任务中占据主导地位,并凸显了当前智能体在识别必要仓库文件方面存在的显著差距。

原作者: Bowen Qin, Yi Xie

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Bowen Qin, Yi Xie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正试图在一座巨大且混乱的图书馆中破解谜题的侦探。你有一个线索——一张撕碎的页面、一声低语或一种奇怪的声音——但为了破案,你必须先在书架上找到那本正确的书。在计算机科学的世界里,这座“图书馆”是一个软件项目的代码,而这些“侦探”则是旨在编写和修复代码的 AI 智能体。长期以来,我们主要通过这些 AI 侦探最终是否写出了完美的解决方案来评判它们。但本文认为,在 AI 开始思考如何编写修复方案之前,它必须先在代码中成功玩一场“寻找沃尔多(Where's Waldo?)”的游戏。如果它拿错了书,无论它的推理能力有多强,它都永远无法解开谜团。这项名为 Agent Retrieval Bench 的新研究,就是一个专门设计的测试,旨在观察这些 AI 侦探在开始打字之前,在仓库中寻找正确文件的能力究竟如何。

研究人员利用从 25 个不同软件项目中提取的 427 个真实世界的编码场景,构建了一个严密的测试场。他们设计了五种不同类型的“线索”,以观察 AI 对线索的反应。有时线索是对新功能的描述(要求 AI 找到相关的测试);有时是针对特定文件的评审意见(要求 AI 找到理解该评论所需的其他文件);有时是崩溃报告(要求 AI 找到根源代码);有时是微小的改动(要求 AI 找到所有可能因此而损坏的其他文件)。甚至还有一个棘手的线索组,其答案根本不在图书馆里,旨在测试 AI 是否知道何时说:“我在这里找不到它。”

研究结果对于“越大越好”或“某种搜索工具总是胜出”的观点来说,无疑是一次冲击。研究发现,没有任何一种方法是无可争议的冠军。这就像是在干草堆里找针:有时磁铁(语义搜索,即寻找含义)效果最好;而其他时候,图书馆布局的地图(结构化搜索,即观察文件如何连接)则是找到那根针的唯一途径。事实上,“最好的”工具会根据特定的线索类型以及 AI 拥有的“阅读空间”(上下文预算)而改变。

其中一个最有趣的发现是,即使允许 AI 侦探进行交互式地请求帮助和四处查看,它们仍然会在 27% 到 35% 的案例中错过正确的文件。事实证明,仅仅因为 AI “能够”搜索,并不意味着它“知道”该去哪里找。研究还表明,如果你基于智能搜索给 AI 一个“提示”(一份预选的文件列表),它解决问题会更快,且浪费的精力更少,而不是仅仅把随机的文件扔给它。然而,研究也否定了一个令人期待的想法:简单的置信度评分不足以告诉 AI 何时停止搜索并承认“这不在这个图书馆里”。

最终,本文表明,构建一个真正好用的编程 AI 并不是要寻找一个神奇的搜索引擎。相反,它是要混合不同的策略——比如同时使用语义地图和结构地图——以确保 AI 在尝试修复代码之前能找到正确的上下文。作者谨慎地指出,虽然这有助于 AI 找到正确的文件,但并不保证 AI 一定能写出完美的修复方案,但如果不找到正确的文件,修复是不可能实现的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →