想象一下,你拥有一个包含数百万本书籍(代码仓库)的巨大且混乱的图书馆。你雇佣了一位非常聪明但有点糊涂的图书管理员(AI 智能体)来为你寻找特定的页面。
通常,当图书管理员迷路时,我们会尝试用两种方式解决问题:
- 重新训练图书管理员: 我们花费数月时间教导图书管理员关于这个特定图书馆的新知识,让他们记住布局。(这是目前大多数 AI 系统所做的事情)。
- 提供更好的工具: 我们给图书管理员一张精美的地图或一个超快速的搜索引擎。(这是其他研究人员所做的事情)。
Libra 提出了第三种不同的想法:不要修复图书管理员;要修复图书馆的索引卡。
核心理念:“活着的目录”
作者创建了一个名为 Libra 的系统。他们不是试图让 AI 变得更聪明,而是让图书馆的“目录”(他们称之为 Catalogs)变得更聪明。这些目录只是简单的文本文件,充当导航指南。
奇迹发生在一个涉及三个角色的自我改进循环中,这三个角色都是“冻结”的(意味着它们的大脑不会改变),它们在玩一场“捉迷藏”游戏来改进地图:
- 提问者 (Prompter): 这个智能体观察图书馆中的随机页面,并设计一个棘手的难题,该问题只能通过找到那个特定页面来回答。它就像是一个正在出题的测验主持人。
- 寻找者 (Solver): 这是实际执行任务的 AI 智能体,它试图寻找答案。它只能依靠当前的“目录”来进行导航。它无法直接看到答案。如果地图很糟糕,寻找者就会迷路。
- 修复者 (Healer): 这是最重要的角色。当寻找者找不到正确的页面时,修复者会观察错误。它会问:“为什么寻找者迷路了?是地图太令人困惑了吗?还是它错过了某个线索?”修复者随后会重写“目录”,以便下次能更清晰地引导。
它是如何运作的
把它想象成在训练一个 GPS 系统,但你不是在更新软件,而是在更新路标。
- 第一轮: 寻找者尝试使用一张空白或没有任何信息的地图来寻找文件。它有 90% 的概率失败。
- 修复: 修复者看到了这些失败,并在地图上添加了一条注释:“如果你在寻找‘数学函数’,请检查‘Math’文件夹,而不是‘Graphics’文件夹。”
- 第二轮: 寻找者再次尝试。由于有了稍微好一点的地图,它失败的次数减少了。
- 修复: 修复者看到了剩余的错误,并添加了更具体的细节:“‘Math’文件夹有两个子文件夹;‘Algebra’用于方程,‘Geometry’用于形状。”
随着时间的推移,地图变得极其详细且准确,这并不是因为寻找者变得更聪明了,而是因为环境(地图)被“修复”得更加契合寻找者的思维方式。
实验结果
研究人员在 12 个不同的大型软件项目(如 Python 库 sympy、django 和 matplotlib)上测试了该系统。
- 持续改进: 随着系统运行轮数的增加,寻找正确代码的准确率持续上升,呈现出对数曲线趋势。它起步较慢,随后迅速提升,并不断变好。
- 零样本迁移 (Zero-Shot Transfer): 这是最酷的部分。一旦“地图”使用某一个特定的 AI 智能体进行了训练,他们就可以更换一个完全不同的 AI 智能体(来自不同公司的不同模型),新的智能体只需使用这张新地图,就能立即表现得更好。这张地图适用于任何人。
- 击败最强对手: 尽管实验中使用的“寻找者”非常简单(它只拥有
ls 和 grep 等基础工具),但一旦它获得了 Libra 训练出的地图,它的表现就超越了许多拥有更复杂工具和记忆的现有顶尖系统。
总结
论文声称,优化环境与优化大脑同样强大。 通过创建一个能够从自身错误中学习的自我改进式纯文本索引,Libra 让即使是简单的 AI 智能体也能高精度地导航大规模代码库。它将“图书馆”本身变成了一个聪明的、进化的伙伴,而不仅仅是一个静态的数据堆。
该论文并未声称:
- 它并未声称这适用于医疗诊断或临床用途。
- 它并未声称该系统可以自动修复代码(它仅帮助找到用于修复的代码)。
- 它并未声称该系统在代码发生变化时能实时工作(它是针对代码的静态快照进行测试的)。
技术摘要:Libra:为智能体信息检索训练环境
问题陈述
在大规模软件仓库中进行代码定位是自主编程智能体的基本能力,这与下游任务的解决率强相关。现有的提升智能体性能的方法通常分为两类:
- 以模型为中心(Model-Centric): 利用从仓库衍生的数据对底层基础模型进行微调。这种方法将系统锁定在特定模型上,可能会丧失最先进商业大语言模型(LLM)更优越的推理能力。
- 静态环境增强(Static Environment Augmentation): 构建静态索引(如层级摘要、反向索引或知识图谱)以辅助检索。这些索引虽然与模型无关,但属于静态结构,缺乏根据智能体特定的检索挑战进行动态调整,或利用交互数据进行持续改进的机制。
目前领域内缺乏一种模型无关且数据驱动的框架,能够为特定仓库主动演进智能体的信息检索能力。
方法论:Libra 框架
Libra 引入了一种范式转变,即从静态索引转向一种存在于仓库内部的、主动演进的纯文本索引。该系统采用了一个由三个冻结智能体和一个可变环境人工制品——**Libra Catalogs(Libra 目录)**驱动的自演进对抗性 LLM 优化循环。
1. 可变人工制品:Libra Catalogs
Libra 构建了一个位于仓库根目录及子模块目录下的 Markdown 文件层级结构(称为“目录”)。这些文件作为可导航的索引,编码了仓库的路由信息。与静态嵌入或图结构不同,这些目录是人类可读、可编辑且可修改的状态变量,由系统进行更新。
2. 三个冻结智能体
优化循环利用了三个权重和提示词固定的不同智能体:
- Prompter(提示者/数据合成器): 生成合成的问答对。它从仓库中采样一个随机代码块 c,并伪造一个自然语言查询 q,使得 q 可由 c 回答,并将金标准文件路径 p∗ 作为答案。Prompter 被指示避免使用精确的标识符,以强制进行语义搜索。
- Solver(求解者/查询解析器): 代表下游的编程智能体。给定查询 q 和当前的目录状态 K,Solver 尝试通过仅使用目录作为引导来导航仓库,从而定位正确的路径 p^。至关重要的是,Solver 在此过程中无法访问金标准代码块或路径。
- Healer(修复者/LLM 优化器): 作为优化器运行。它分析 Solver 的失败集合 F(其中 p^=p∗),并重写 Markdown 目录 K 以修复路由信号。Healer 会诊断失败是源于信息缺失、噪声还是结构性问题,并进行针对性的编辑。
3. 优化循环
系统按轮次(T)运行:
- 测试阶段: Prompter 生成一批查询。Solver 使用当前目录尝试解析这些查询。失败案例被汇总到失败集 F 中。
- 修复阶段: Healer 处理 F 并更新目录 K,以减少未来的路由错误。
该循环持续进行直到收敛,最终生成一组优化的目录作为持久化索引。
核心贡献
- 环境训练(Environmental Training): 本文提出训练的是环境(即索引)而非模型,创建了一个模型无关的人工制品,在不微调 LLM 权重的情况下提升了检索性能。
- 对抗性自我改进(Adversarial Self-Improvement): 系统利用了一个对抗循环:Prompter 创建具有挑战性的查询,Solver 暴露当前索引的弱点,而 Healer 根据这些失败情况迭代地精炼索引结构。
- 纯文本索引(Plain-Text Indices): 通过使用 Markdown 目录而非向量嵌入或复杂图结构,Libra 提供了一个可解释、可移植且可编辑的索引,能够原生集成到代码库中。
实验结果
作者在来自 SWE-BENCH LITE 数据集的 12 个 Python 仓库上评估了 Libra。
- 对数级改进: 在 sympy 仓库中,基于合成查询进行训练产生了持续的、对数级的代码定位准确率提升。系统从 60.3% 的文件准确率(第 0 步)开始,达到了 83.3%(第 85 步),超越了最先进的基准模型。
- 向现实世界任务的泛化: 完全基于合成数据训练的目录成功迁移到了真实的 SWE-BENCH LITE Bug 定位任务中。经过训练的 Libra Solver 实现了最高的性能(5 轮时 77.8% 文件准确率,10 轮时 82.3%),尽管其仅使用了极简的工具集(仅
Bash 和 Read),表现优于 LocAgent 和 RepoMem。
- 模型无关性: 优化的目录作为一个持久资源,在无需重新训练的情况下增强了不同 Solver 模型(GPT-5-mini, GPT-5, 和 Gemini-2.5-Flash)的性能。对于较弱的模型(例如 Gemini-2.5-Flash 提升了 +31.0 个百分点),性能增益最为显著。
- 修复效应: 对单个测试实例的分析显示,54.3% 的实例在训练的早期到后期阶段有所改善,改善与退化的比例为 3.3:1,证明了系统系统性纠正路由失败的能力。
意义与主张
论文声称 Libra 证明了通过交互反馈优化基于文本的索引,为传统的检索方法提供了一种可行且具适应性的替代方案。
作者强调的关键结论包括:
- 范式转变: 从静态的、外部的嵌入转向一种主动演进的、存在于仓库内部的纯文本索引。
- 可迁移性: 一个完全通过自生成的合成查询进行训练的系统,可以成功迁移其学习到的路由能力,以解决现实世界的软件工程任务。
- 成本与可移植性: 该方法在实现与最先进基准模型竞争力的性能的同时,提供了在可解释性(人类可读的目录)和可移植性(模型无关)方面的显著优势。
作者承认了局限性,指出优化循环的计算强度较大,且目前假设仓库是静态的,将增量更新和多跳查询合成作为未来的研究方向。然而,他们断言该框架成功弥合了静态环境增强与特定模型微调之间的鸿沟。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。