← 最新论文
💻 computer science

Libra: Training the Environment for Agentic Information Retrieval

本文介绍了 Libra,这是一个自我演进的框架,它通过提示、求解和修复的合成查询驱动循环,迭代优化仓库内层级化“目录”的检索过程,从而为智能体 LLM(agentic LLMs)优化信息检索,并最终在代码定位准确度方面实现了显著且可迁移的提升。

原作者: Xuan Zhao, Andy Chiu, Gengyu Wang

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuan Zhao, Andy Chiu, Gengyu Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个包含数百万本书籍(代码仓库)的巨大且混乱的图书馆。你雇佣了一位非常聪明但有点糊涂的图书管理员(AI 智能体)来为你寻找特定的页面。

通常,当图书管理员迷路时,我们会尝试用两种方式解决问题:

  1. 重新训练图书管理员: 我们花费数月时间教导图书管理员关于这个特定图书馆的新知识,让他们记住布局。(这是目前大多数 AI 系统所做的事情)。
  2. 提供更好的工具: 我们给图书管理员一张精美的地图或一个超快速的搜索引擎。(这是其他研究人员所做的事情)。

Libra 提出了第三种不同的想法:不要修复图书管理员;要修复图书馆的索引卡。

核心理念:“活着的目录”

作者创建了一个名为 Libra 的系统。他们不是试图让 AI 变得更聪明,而是让图书馆的“目录”(他们称之为 Catalogs)变得更聪明。这些目录只是简单的文本文件,充当导航指南。

奇迹发生在一个涉及三个角色的自我改进循环中,这三个角色都是“冻结”的(意味着它们的大脑不会改变),它们在玩一场“捉迷藏”游戏来改进地图:

  1. 提问者 (Prompter): 这个智能体观察图书馆中的随机页面,并设计一个棘手的难题,该问题只能通过找到那个特定页面来回答。它就像是一个正在出题的测验主持人。
  2. 寻找者 (Solver): 这是实际执行任务的 AI 智能体,它试图寻找答案。它只能依靠当前的“目录”来进行导航。它无法直接看到答案。如果地图很糟糕,寻找者就会迷路。
  3. 修复者 (Healer): 这是最重要的角色。当寻找者找不到正确的页面时,修复者会观察错误。它会问:“为什么寻找者迷路了?是地图太令人困惑了吗?还是它错过了某个线索?”修复者随后会重写“目录”,以便下次能更清晰地引导。

它是如何运作的

把它想象成在训练一个 GPS 系统,但你不是在更新软件,而是在更新路标。

  • 第一轮: 寻找者尝试使用一张空白或没有任何信息的地图来寻找文件。它有 90% 的概率失败。
  • 修复: 修复者看到了这些失败,并在地图上添加了一条注释:“如果你在寻找‘数学函数’,请检查‘Math’文件夹,而不是‘Graphics’文件夹。”
  • 第二轮: 寻找者再次尝试。由于有了稍微好一点的地图,它失败的次数减少了。
  • 修复: 修复者看到了剩余的错误,并添加了更具体的细节:“‘Math’文件夹有两个子文件夹;‘Algebra’用于方程,‘Geometry’用于形状。”

随着时间的推移,地图变得极其详细且准确,这并不是因为寻找者变得更聪明了,而是因为环境(地图)被“修复”得更加契合寻找者的思维方式。

实验结果

研究人员在 12 个不同的大型软件项目(如 Python 库 sympydjangomatplotlib)上测试了该系统。

  • 持续改进: 随着系统运行轮数的增加,寻找正确代码的准确率持续上升,呈现出对数曲线趋势。它起步较慢,随后迅速提升,并不断变好。
  • 零样本迁移 (Zero-Shot Transfer): 这是最酷的部分。一旦“地图”使用某一个特定的 AI 智能体进行了训练,他们就可以更换一个完全不同的 AI 智能体(来自不同公司的不同模型),新的智能体只需使用这张新地图,就能立即表现得更好。这张地图适用于任何人。
  • 击败最强对手: 尽管实验中使用的“寻找者”非常简单(它只拥有 lsgrep 等基础工具),但一旦它获得了 Libra 训练出的地图,它的表现就超越了许多拥有更复杂工具和记忆的现有顶尖系统。

总结

论文声称,优化环境与优化大脑同样强大。 通过创建一个能够从自身错误中学习的自我改进式纯文本索引,Libra 让即使是简单的 AI 智能体也能高精度地导航大规模代码库。它将“图书馆”本身变成了一个聪明的、进化的伙伴,而不仅仅是一个静态的数据堆。

该论文并未声称:

  • 它并未声称这适用于医疗诊断或临床用途。
  • 它并未声称该系统可以自动修复代码(它仅帮助找到用于修复的代码)。
  • 它并未声称该系统在代码发生变化时能实时工作(它是针对代码的静态快照进行测试的)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →