When Replanning Becomes the Bottleneck: Budgeted Replanning for Embodied Agents
本文介绍了 BRACE,这是一个与 E-RECAP Token 修剪方法相结合的预算控制框架,它通过动态分配 Token 预算并修剪上下文,显著减少服务水平目标(SLO)的违规情况,同时保持高任务成功率,从而缓解了具身智能体中基于大语言模型(LLM)的高频重规划所带来的延迟瓶颈。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位正在混乱的小行星带中航行的飞船船长。你有一位超级聪明的 AI 副驾驶来帮助你规划航线。但问题在于,每当飞船撞到岩石或迷失方向时,你都会要求 AI 从头开始重新计算整个路线。起初,这很容易。但随着旅程变得越来越长,AI 对发生过的一切的“记忆”——你躲过的岩石、来自其他飞船的消息、犯过的错误——变成了一个巨大的、纠缠在一起的线团。每次你要求制定新计划时,AI 都必须重新阅读这整个线团。最终,AI 会被自己的历史所淹没,导致思考变得极其缓慢。等到它终于喊出新的方向时,你已经撞上了另一颗小行星了。这就是在机器人和 AI 智能体领域中“重规划”(replanning)的问题:即使它们在技术上仍然能够出色地完成工作,但随着学习的内容越来越多、工作时间越长,它们解决错误的速度也会变得越来越慢。
这篇题为《当重规划成为瓶颈》(When Replanning Becomes the Bottleneck)的论文,专门解决这一困扰“具身智能体”(embodied agents)——即生活在现实世界(或现实模拟环境)中并需要移动和行动的机器人或 AI 系统——的难题。作者刘帅俊及其团队发现,虽然这些机器人在完成任务方面变得越来越好,但它们在衡量一个隐藏指标时却失败了:速度。他们发现,一个机器人可以 100% 成功地到达目标,但如果它在出错后花费了太长时间来思考“如何”到达那里,它就会错过其实时截止时间。这就像一个学生虽然在考试中拿了 A,但写答案解析却花了三天时间;成绩是完美的,但系统是崩溃的。该论文引入了一个名为 BRACE(用于具身系统中智能体控制的有预算重规划)的新系统,以及一个名为 E-RECAP 的智能剪枝工具。你可以把 BRACE 想象成一个严格的项目经理,它会对 AI 说:“你恰好只能用 200 个词来解释你的新计划,而且必须在 2.5 秒内完成。如果你做不到,我们会缩短你的陈述。”而 E-RECAP 则是编辑,它会无情地删除 AI 记忆中那些乏味、重复的部分,同时保留重要的细节,从而让 AI 思考得更快,且不会遗忘关键信息。
问题所在:“过多历史”陷阱
在机器人领域,智能体(如自动驾驶汽车或机械臂)并不仅仅遵循单一、完美的脚本。现实世界是混乱的。机器人会打滑,传感器会产生误判,其他智能体(如其他机器人或无人机)会做出意想不到的行为。为了应对这些情况,现代机器人使用一个循环:它们观察正在发生的情况,规划动作,执行动作,然后,如果事情出错,它们就进行重规划。
问题在于,每次机器人进行重规划时,它不仅仅只看当前时刻。它会向 AI 输入一个包含任务指令、整个发生过程的历史、犯过的错误以及来自其他智能体消息的海量提示词(prompt)。随着机器人的工作时间增长,这个“上下文”(context)也会随之增长。想象一下,你正在读一本书,而每当你翻一页时,书的开头和结尾都会不断增加新的页面。最终,这本书会变得异常厚重,以至于阅读它需要耗费数小时。
作者发现,随着上下文的增长,AI 进行重规划所需的时间(即“延迟”)会出现“重尾”(heavy tails)现象。这意味着,虽然平均重规划时间看起来还可以,但偶尔 AI 会陷入“长尾”思维中,耗费过长的时间。在实时系统中,一次长延迟就可能是灾难性的。论文显示,在许多测试中,机器人在完成任务方面达到了 100% 的成功率,但在重规划调用中,它们违反速度限制(称为服务水平目标,即 SLO)的比例高达 100%。这有点像一名运动员虽然能跑完每一场比赛,但在发令枪响之前要花 10 分钟来系鞋带;他赢得了比赛,但系统是低效且不可靠的。
解决方案:BRACE 与预算管理者
为了解决这个问题,团队创建了 BRACE。BRACE 不会让 AI 在拥有无限记忆的情况下随心所欲地重规划,而是将重规划视为一种有预算限制的资源。它作为一个控制器,为每一次机器人需要重新思考的时刻决定三件事:
- 我们是否需要重规划? 有时机器人只是轻微偏移,并不需要完整的全新计划。BRACE 可以通过说“等待”来避免不必要的思考。
- 我们的“Token 预算”有多少? Token 是 AI 阅读的文本单位。BRACE 会为 AI 用于新计划的 Token 数量设定严格限制。
- 时间限制(SLO)是多少? BRACE 会设定一个硬性截止时间,规定重规划过程可以持续多久。
如果 AI 试图使用过多的内存或耗时过长,BRACE 就会介入。它还具有“冷却窗口”(cooldown windows)等安全功能,防止机器人因为恐慌而每秒钟都进行重规划,因为这只会让速度变慢。
工具:E-RECAP(智能编辑)
即使有了预算,AI 仍然需要阅读一些内容。这就是 E-RECAP 发挥作用的地方。它是一种“渐进式 Token 剪枝”方法。想象机器人的记忆是一个冗长、啰嗦的故事。E-RECAP 是一个超级聪明的编辑,它知道故事中哪些部分是至关重要的,哪些只是废话。
它的工作原理是观察 AI 的内部“隐藏状态”(即它理解文本的方式),并根据每个单词(Token)的重要性进行评分:
- 它保留开头(任务指令)和结尾(最近发生的事件),因为这些通常是最关键的。
- 它删除中间那些不太重要或重复的部分。
- 它通过多个层级进行操作,随着深入 AI “大脑”的过程,剪枝力度会变得越来越严格。
结果是一个更短、更精炼的故事,但它仍然包含了做出正确决策所需的所有必要信息。
研究发现:不牺牲成功的速度
团队在三个不同的平台上测试了 BRACE 和 E-RECAP:Meta Habitat(用于导航的虚拟世界)、RoboFactory(用于机械臂和协作的模拟环境)以及 AirSim(用于无人机和汽车的模拟器)。
结果非常惊人。在 Meta Habitat 导航测试中,标准方法(称为“无 BRACE”)实现了 100% 的任务成功率,但在重规划调用中违反速度限制的比例高达 85.5%。当加入 BRACE 和 E-RECAP 后,成功率保持在 100%,但速度限制违规率大幅下降至仅为 4.7%。
在 RoboFactory 测试中,改进更为显著。标准方法在 100% 的调用中违反了速度限制。使用 BRACE 和 E-RECAP 后,这一数字降至 50.0%。在一种标准方法完全失败(成功率为 0%)的更严苛设置下,新系统在保持低速违规率(4.6%)的同时,实现了 80.0% 的成功率。
该系统还将 AI 需要处理的 Token 数量减少了 62% 到 92%。这意味着 AI 用更少的工作量完成了同样(甚至更好)的结果。在 AirSim 无人机测试中,速度违规从 100% 降至 4.7%。
为什么这很重要
该论文认为,我们需要改变衡量机器人性能的方式。如果一个机器人思考如何行动花费了太长时间,仅仅说“机器人成功了”是不够的。通过将重规划视为一个具有严格预算的系统问题,我们可以构建出不仅聪明而且快速可靠的机器人。
作者还在实验室中使用真实的机械臂进行了测试(执行诸如捡拾水果或推动物体等任务)。虽然模拟结果是研究重点,但真实机器人的测试表明,同样的预算管理和剪枝技术在现实中同样有效,既提高了成功率,又减少了延迟。
简而言之,该论文指出,通过在记忆和时间上更加“吝啬”,并使用智能编辑来剔除废话,机器人可以不再被自己的历史所拖累,从而在世界中展现出所需的敏捷与速度。这提醒我们,有时候,知道“不该记住什么”与记住所有事情同样重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。