The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents
本文将“地平线差距”(horizon gap)定义为前沿语言模型在多步任务中的失败,通过调研 1,547 项近期研究来区分任务、模型与系统属性,并指出随着任务地平线的延长,仅基于结果的反馈所具有的信息量日益减少,因此该领域向更密集的步骤级信号转变是一种必然的应对之策。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长程问题:当 AI 在途中迷失
想象一下,你正在教一个聪明、反应极快的机器人写故事。如果你让它写一句话,它可能在瞬间就能完美完成。但如果你让它写一部完整的长篇小说,或者管理一个需要耗时数小时的复杂项目,会发生什么?这就是 AI 智能体(AI agents) 的世界。与只能回答单个问题的简单聊天机器人不同,智能体是一个可以思考、采取行动(如点击按钮或编写代码)、观察结果并决定下一步该做什么的机器人。它就像一名数字员工。
科学家们目前面临的巨大挑战是“地平线”。在日常用语中,地平线就是你需要向前看多远。短地平线就像订比萨:你打电话,他们送达,你开吃。长地平线则像盖房子:你必须打好地基、搭建框架、安装屋顶并刷漆,同时还要记得三天前做了什么。问题在于,即使是最擅长瞬间解决难题的聪明 AI 模型,在面对漫长任务时也经常会迷失。它们可能会忘记之前的决策,在任务仅完成一半时就宣布结束,或者悄悄地偏离目标。这种 AI 在单步快速行动的能力与可靠完成长期任务的能力之间的差距,被称为 “地平线差距”(Horizon Gap)。理解如何修复这个问题至关重要,因为如果我们希望 AI 能协助处理需要数小时或数天处理的现实工作,我们就必须知道它们为什么失败,以及如何阻止它们崩溃。
伟大的 AI 旅程:修复地平线差距
在这篇论文中,作者扮演了一支庞大的侦探团队,查阅了 2024 年至 2026 年间发表的 1,500 多篇研究论文。他们的使命是:弄清楚 AI 智能体为什么会在长途旅行中迷失,以及研究人员正试图通过什么方法来修复它。他们将模型单步智能能力与完成长期任务能力之间的距离称为 “地平线差距”。
为了理清混乱,作者首先必须理顺三个人们经常混淆的概念,就像混淆汽车的发动机和油箱一样:
- 长程(Long-Horizon): 这是关于任务的。这意味着工作需要许多步骤,就像一次长途公路旅行。
- 长上下文(Long-Context): 这是关于模型的脑容量的。它是指 AI 在某一瞬间能在大脑中承载多少信息。
- 长期记忆(Long-Term Memory): 这是关于系统的笔记本的。它是指 AI 是否能在当前的“对话”结束后,依然记得昨天的事情并在今天使用。
论文指出,你可以拥有一个超级长的笔记本(记忆),但大脑(上下文)却很短;或者拥有一个巨大的大脑,却没有任何笔记本。这些是不同的问题,需要不同的解决方案。
作者将他们的发现组织成六个主要章节,追踪了一个长任务从开始到结束的全过程:
1. 规划:地图 vs 指南针
当 AI 开始一项长期任务时,它需要一个计划。一些研究人员试图在迈出第一步之前就制定出一份完美的全程地图。但论文发现,这往往会失败,因为世界是不可预测的。如果你提前规划好整个公路旅行,你可能会遇到预料之外的交通堵塞。目前的趋势正转向交织规划(interleaving):走一步,观察周围,然后再计划下一步。这就像是用指南针而不是固定地图来驾驶,随着行程不断调整。
2. 记忆:背包 vs 图书馆
随着 AI 采取更多步骤,它会产生大量信息。如果它试图将所有内容都留在即时大脑(“上下文”)中,它最终会耗尽空间或忘记故事的开头。论文显示,大多数研究人员现在正在构建外部图书馆(类似于背包或文件柜),AI 可以将笔记存储其中并在需要时取出。然而,这里有一个陷阱:如果图书馆变得太乱,AI 可能会取出错误的笔记,或者忘记更新旧的笔记。论文建议,“遗忘”实际上可能是一种功能而非缺陷,这样才能保持图书馆的实用性。
3. 执行:安全网
这是 AI 真正开展工作的部分。论文发现,成功的秘诀不仅仅是拥有更聪明的 AI 模型,而是拥有一个更好的护栏(harness)(即围绕模型构建的软件封装层)。可以将模型想象成发动机,而将护栏想象成汽车的悬挂系统和刹车。如果发动机熄火了,一个好的护栏能接住它,修复它,并让汽车继续行驶。研究表明,拥有强大“恢复”逻辑(即能够察觉错误并立即修复的方法)的系统,比那些只寄希望于 AI 从不犯错的系统表现要好得多。
4. 训练:从每一步中学习
通常,我们通过在任务最后给予评分(比如期末考试给 A 或 F)来训练 AI。但对于长期任务,等到结束才说“你失败了”已经太晚了。论文强调了向**过程奖励(process rewards)**的转变。与其只对最终结果进行评分,研究人员正尝试对 AI 走的每一步都给予反馈。这就像教练在赛季期间进行日常指导,而不仅仅是在赛季结束时才点评。这有助于 AI 学习“如何”做得更好,而不只是学习“答案是什么”。
5. 评估:我们衡量的是正确的东西吗?
这是论文提出批判的地方。作者指出,我们用来测试 AI 处理长期任务能力的许多测试方法都是有缺陷的。例如,有些测试可能仅仅因为 AI 找到了一个能通过简单测试的补丁,就判定它“解决了”某个编程问题,即便代码本身其实是错误的。论文认为,我们不应只关注最终得分(通过/失败),而应开始关注轨迹(trajectory)——即 AI 走的整个路径。它是迷路了?它恢复了吗?它产生了漂移吗?论文指出,许多当前的“成功”评分可能是由薄弱的测试或 AI 记忆答案所导致的幻象。
6. 基础:为什么一切都会崩溃
最后,论文探讨了理论层面。它指出,误差并不会只是线性累加。有时,AI 会运行良好很长时间,然后突然发生“崩溃(meltdown)”。其他时候,它会在没人察觉的情况下悄悄改变目标(目标漂移)。作者承认,我们目前还没有完美的理论来准确预测这些失败何时发生或为何发生。我们知道它们会发生,但预测它们何时发生仍然是一个谜。
核心总结
这篇论文提出的最重要观点是:“护栏”(我们围绕 AI 构建的工具和安全网)可能与 AI 模型本身一样重要。 一个拥有糟糕护栏的聪明模型会在长期任务中失败,而一个拥有优秀护栏的普通模型则可能取得成功。
作者还向我们发出了一个隐藏陷阱的警告:相关测量偏差(Correlated Measurement Bias)。这是一种高级说法,意思是如果我们使用同一种类型的“优秀步骤”信号来既训练 AI 又测试 AI,我们可能会欺骗自己。这就像一个学生只学习老师在考试中会用的练习题;他们可能拿到满分,但实际上并没有理解学科内容。
简而言之,这篇论文并不声称我们已经解决了长程问题。相反,它绘制了一张战场地图。它告诉我们,AI 的未来不仅仅在于打造更大的大脑,还在于构建更好的背包、更好的地图、更好的安全网,以及更完善的衡量 AI 是否在每一步都做得到位的标准。旅程很长,而 AI 仍在学习如何行走而不跌倒。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。