← 最新论文
💻 computer science

Latent Action Reparameterization for Efficient Agent Inference

本文提出潜在动作重参数化(LAR),这是一种从智能体轨迹中学习紧凑的多步潜在动作空间的框架,旨在显著降低大语言模型智能体的有效决策视界与推理成本,同时保持或提升任务成功率。

原作者: Wenhao Huang, Qingwen Zeng, Qiyue Chen, Zijie Guo, Yu Sun, Cheng Yang, Siru Ouyang, Jiri Gesi, Fang Wu, Jiayi Zhang, Huaming Chen, Bang Liu, Xiangru Tang, Chenglin Wu

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenhao Huang, Qingwen Zeng, Qiyue Chen, Zijie Guo, Yu Sun, Cheng Yang, Siru Ouyang, Jiri Gesi, Fang Wu, Jiayi Zhang, Huaming Chen, Bang Liu, Xiangru Tang, Chenglin Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在给一个机器人提供一份非常长且详细的建房指令清单。

旧方法(问题所在):
目前,当我们要求大型语言模型(LLM)智能体执行复杂任务时,我们迫使它以微小、原子化的步骤进行思考和表达。这就像告诉机器人:“拿起锤子。现在将手移动 2 英寸。现在挥动。现在敲击钉子。再次拿起锤子。”

即使机器人很聪明,它也必须生成大量文本,仅仅为了表达“我正在拿起锤子”。这创造了一个巨大的“决策视界”——一条计算机必须逐个处理的漫长微小决策链。这使得机器人运行缓慢、成本高昂,并且容易在完成任务前就感到“疲惫”(或耗尽内存)。

新方法(潜在动作重参数化 - LAR):
本文作者提出了一种巧妙的捷径,称为潜在动作重参数化(Latent Action Reparameterization, LAR)

可以将 LAR 想象成教机器人一种新的“超级指令”语言。机器人不再说“拿起锤子、移动手臂、挥动”,而是学会说一个神奇的词:“锤子动作”。

以下是其工作原理,使用简单的类比说明:

1. “宏按钮”类比

想象你在操作电脑。与其依次点击“文件”、“新建”、“文档”、“命名”,不如直接按下一个标有“创建新文档”的按钮。

  • 论文主张: LAR 通过观察机器人的工作自动学习这些“超级指令”。它发现机器人总是执行相同步骤序列的模式(例如打开工具、输入特定格式、然后关闭)。它将这些步骤打包成一个不可见的“潜在动作”。
  • 结果: 机器人做出的决策更少。与其执行 100 个微小步骤,它只需执行 10 个大步骤。这使得运行速度更快、成本更低。

2. “拉链”与“手提箱”(什么被压缩了?)

你可能会问:“如果我们把所有东西打包在一起,机器人不会忘记重要细节吗?”
论文对此非常谨慎。他们使用了拉链类比:

  • 拉链(结构): 指令中枯燥、重复的部分(例如“请打开搜索工具”或“这是代码格式”)是低熵的。它们是可预测的。LAR 将这些部分**压缩(拉上拉链)**成一个单一的潜在标记。
  • 手提箱(内容): 独特、变化的部分(例如具体的搜索查询“谁是下一任英国首相?”或特定数字)是高熵的。这些是手提箱里的“物品”。LAR保持这些部分未压缩且可见
  • 为何重要: 如果你把具体的搜索查询也压缩了,机器人每次都会尝试搜索“下一任英国首相”,即使问题涉及的是另一个国家。这会破坏机器人的功能。LAR 只压缩结构,而不压缩内容

3. “金发姑娘”区(抽象边界)

论文发现了一个关键限制,称为抽象边界

  • 压缩不足: 机器人仍然在说太多小词,因此运行缓慢。
  • 恰到好处: 机器人运行迅速,因为它对枯燥部分使用“超级指令”,但对重要部分仍保持清晰表达。
  • 压缩过度: 如果你尝试将具体的问题或独特细节打包进“超级指令”,机器人就会崩溃。这就像试图用“锤子动作”按钮来搜索特定的人;机器人会感到困惑,因为该按钮不知道要搜索。论文表明,一旦跨越这条线,机器人的性能会突然崩溃。

4. 结果(实际发生了什么?)

研究人员在三种不同类型的任务上测试了这种方法:

  • 常识问答(TriviaQA): 回答复杂问题。
  • 编程(KodCode): 编写计算机代码。
  • 网页浏览(Mind2Web): 导航网站并使用工具。

研究发现如下:

  • 速度: 使用 LAR 的机器人在完成相同任务时生成的词(标记)数量显著减少。这意味着它们完成任务更快,且消耗的计算机资源(GPU 内存)更少。
  • 智能: 尽管使用的词更少,但机器人获得正确答案的能力依然相当(有时甚至更好)。它们并没有失去智能,只是不再浪费时间在重复的闲聊上。
  • 泛化能力: 它们在一种任务集(如编程)上训练机器人后,机器人无需重新训练即可将这些“超级指令”应用于新的、未见过的编程任务。

总结

论文认为,使 AI 智能体更快速的最大瓶颈,不仅仅是构建更大的计算机或更聪明的模型,而是我们如何要求它们表达

通过教导智能体将重复、可预测的动作分组为单一的“超级指令”,同时保持独特、重要的细节可见,我们可以让它们变得更快、更便宜,且同样聪明。这就像将一个数着每一步的机器人,升级为一个懂得将“走”、“跑”和“跳”作为单一、流畅动作的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →