daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently
本文介绍了 daVinci-Agency,这是一个利用真实的拉取请求(Pull Request)序列来合成高质量、长程训练数据的低数据效率框架,旨在为大语言模型赋能,使其在无需高昂标注成本的情况下,在复杂的智能体工作流中实现显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是对 daVinci-Agency 论文的解释,通过简单的概念、日常类比以及作者提出的具体主张进行了拆解。
核心问题:AI 的“注意力缺陷”
想象你有一个才华横溢的学生,他非常擅长回答单个问题,比如“2+2 等于几?”或者“写一首关于猫的诗”。这个学生就是一个大语言模型(LLM)。
然而,如果你要求这个学生盖一座房子,他就会感到吃力。他可能会铺好地基,然后忘记了还需要盖屋顶;或者他可能把墙砌歪了,直到最后才意识到这个问题。在 AI 世界中,这被称为长程任务(long-horizon task)。这类工作需要许多步骤,其中早期犯下的错误可能会毁掉整个项目。
论文指出,目前的 AI 模型之所以在这些长期工作中表现不佳,是因为它们没有接受过能够展示如何提前规划、保持一致性并在长时间内修正自身错误的数据训练。
解决方案:从“软件演进”中学习
作者们(来自 SII, SJLU 和 GAIR)意识到,教 AI 处理长期复杂项目的最佳方法是观察人类是如何构建软件的。
类比:“拉取请求(Pull Request)”链
在软件开发中,当程序员想要添加一个功能或修复一个漏洞时,他们不会直接丢出最终的代码。他们会提交一个**“拉取请求”(Pull Request,简称 PR)**。
- 第一步: 他们提交一个微小的改动(PR #15)。
- 第二步: 评审人员说:“看起来不错,但你漏掉了一个安全网。”
- 第三步: 程序员修复它并提交一个新的改动(PR #21),这个改动建立在第一个改动之上。
- 第四步: 这个过程会持续多个轮次,直到功能趋于完美。
作者称之为**“拉取请求链(Chain of Pull Requests)”**。这就像一个故事,每一章都依赖于前一章,而其中的角色(代码)会随着时间的推移不断进化和完善。
创新点:daVinci-Agency
团队创建了一个名为 daVinci-Agency 的新系统。他们并没有凭空捏造虚假场景,也没有付费让真人编写长篇故事来供 AI 学习(这既昂贵又缓慢),而是前往 GitHub(一个巨大的真实软件项目库)去采集这些天然存在的“拉取请求链”。
他们将这些真实的软件开发故事转化成了训练数据。
- 训练过程: 他们采用了一个模型(GLM-4.6),并向其展示了这些链条。
- 教学目标: AI 学习到,为了取得成功,它必须做到:
- 分解(Decompose): 将一个宏大的目标分解为细小、易于管理的步骤。
- 保持一致性(Stay Consistent): 即使经过 50 个步骤后,依然能记住最初的目标。
- 精炼(Refine): 观察自己的错误(Bug)并进行修复,而不是推倒重来。
“神奇”的结果:小数据,大收益
通常,要让 AI 变得更聪明,你需要喂给它数百万个示例。
- 传统方式: 在 66,000 个示例上进行训练(如论文中提到的其他数据集)。
- daVinci 方式: 仅在 239 个示例上进行训练。
结果:
尽管使用的数据量减少了 200 倍,但在 daVinci-Agency 上训练的模型表现却显著优于在海量数据集上训练的模型。
- 在 Toolathlon 测试(AI 需要使用工具解决问题)中,该模型的表现提升了 47%。
- 在 SWE-bench(一个修复真实软件漏洞的测试)中,它的得分也高得多。
为什么? 因为这 239 个示例是高质量的。它们不是随机的,而是记录了复杂问题如何随时间演进的真实故事。AI 不仅仅是在记忆事实,它学习到了坚持与纠错的“习惯”。
AI 究竟学到了什么(“元技能”)
论文表明,AI 不仅仅是变得更擅长编程,它还变得更擅长思考。
- 之前: 如果 AI 犯了错,它会变得困惑、偏离主题或放弃(这被称为“逃避主义/escapism”)。
- 之后: 当 AI 犯错时,它会停下来,意识到“等等,我做错了”,然后进行修正。它学会了规划并保持在轨道上。
效率:事半功倍
论文还发现,新的 AI 更加高效。
- 类比: 想象两个人试图走出迷宫。
- A 人(旧 AI): 撞遍每一个死胡同,大喊大叫,尝试 100 条错误的路径。
- B 人(daVinci AI): 看着地图,识别出死胡同,并采取直达路径。
- daVinci 训练出的 AI 使用更少的词元(tokens)和更少的工具点击次数就能解决同样的问题。它不会在混乱中浪费精力。
“规模化”的发现
最后,作者测试了如果让训练的故事变得更长会发生什么。
- 他们发现,如果他们在包含更多步骤(更长的拉取请求链)的链条上训练 AI,AI 会变得更加出色。
- 这表明,AI 进行的“长距离”思考练习越多,它在解决极长、极复杂问题时的能力就越强。
总结
daVinci-Agency 是一种训练 AI Agent 的新方法。它不是强迫它们去记忆数百万个简短的虚假任务,而是通过向它们展示人类构建软件的真实、长篇的故事来进行教学。通过学习这些天然的“事件链”,AI 学会了规划、保持一致性并修正自身的错误,从而在消耗远少于以往的数据量的情况下,变得更加聪明且高效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。