← 最新论文
🤖 AI

Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy

本文介绍了 OmniAct,这是一个层级化异步框架,它统一了信息物理规划、自适应记忆和视觉验证,旨在使具身智能体能够在非结构化环境中自主执行复杂的长程任务,同时保持高效性并针对物理故障具备鲁棒性。

原作者: Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要建造一个能住在你家里的机器人,它能帮你处理日常琐事,而不需要人类不断地去照看它,甚至可以持续工作数周或数月。这就是“具身智能体”(embodied agents)的目标。然而,目前的机器人就像是笨手笨脚的实习生:它们能把一件事情做得很好,但如果它们感到困惑,就会不断出错,直到把一整天都搞砸。而且它们的记忆力极差,要么忘记了一小时前你说过的话,要么因为试图记住每一秒钟发生的事情而变得过于臃icity(信息过载),导致系统卡死。

这篇论文介绍了 OmniAct,这是一个全新的框架,旨在将这些笨手笨脚的实习生转变为可靠的长期家庭管理者。你可以将 OmniAct 视为不仅仅是一个超级大脑,而是一个由三个专业角色组成的、高效的管理团队

三个专业角色

1. 主规划师(“项目经理”)
大多数机器人之所以表现挣扎,是因为它们将“数字”任务(如在网上订餐或打开智能灯)和“物理”任务(如拿起杯子或移动椅子)视为两种完全不同的工作。

  • 类比: 想象一位经理无法同时与 IT 部门和施工队沟通。他必须写张便条,走到 IT 办公室,得到回复,再走回来,然后去和施工队说话。这既慢又容易出错。
  • OmniAct 的解决方案: 规划师使用统一的语言。它可以将指令(如“打开智能灯”——数字任务)与动作(如“拿起书”——物理任务)无缝混合成一个流畅的过程。它不只是靠猜测;它能将复杂的宏大请求(如“给我弄点零食”)分解成一系列清晰、可执行的小步骤。

2. 智能记忆(“拥有归档系统的图书管理员”)
如果你要求机器人记住你所说过的每一句话,它最终会耗尽存储空间,或者被不再重要的旧指令搞混。

  • 类比: 想象试图通过阅读每一句对话的逐字转录稿来记住一场长达 10 小时的谈话。你会迷失在噪音中。更好的方法是让一位图书管理员,只记录对话中的“章节”。
  • OmniAct 的解决方案: OmniAct 不仅仅存储原始视频帧或单词,它使用了事件边界压缩技术(Event-Boundary Compression)。它会等待一个“章节切换”(例如完成一项任务或更换房间)时,然后将发生的事情总结成一段简洁、精炼的笔记。这使得机器人的记忆保持轻量且快速,即使在运行数日后也不会出错,同时不会忘记重要的长期规则(例如“我不喜欢糖”)。

3. 安全监控器(“观察员”)
目前的机器人通常以“开环”方式工作,这意味着它们开始执行任务后就只能听天由命。如果它们掉落了一个杯子,它们并不知道发生了什么,仍会继续执行下一步,从而让局面变得更糟。

  • 类比: 这就像一个蒙着眼睛穿过房间的人。如果他们绊倒了,他们不知道自己摔倒了,所以会继续踉跄前行。
  • OmniAct 的解决方案: 这个系统拥有一个视觉抢占引擎(Visual Preemption Engine)。在机器人工作时,一个独立的“观察员”(摄像头和 AI)会定期进行检查。如果观察员看到机器人掉落了杯子或陷入困境,它会立即喊出“停止!”,并唤醒规划师来修复错误。这能将一场灾难转化为一次简单的绕路。

它在现实世界中的表现

研究人员在两个截然不同的机器人上测试了 OmniAct:一个是机械臂(像桌上的类人手臂),另一个是轮式移动机器人(像可以到处移动的 Roomba)。他们给出了 40 个困难的长期任务,这些任务涉及将物理动作与数字工具结合起来(例如在决定是否打开窗户之前先查看天气应用)。

  • 更高的成功率: OmniAct 完成任务的频率远高于以往的方法。当其他机器人失败时,它们通常会彻底失败。而 OmniAct 能够从错误中恢复并继续进行。
  • 高效的记忆: 其他系统需要存储海量数据(超过 100,000 个“单词”的历史记录)从而导致速度变慢,而 OmniAct 保持了低且稳定的记忆占用,就像图表上的平滑直线一样,无论任务持续多久。
  • 赋能小型模型: 其中一个最令人惊讶的发现是,OmniAct 可以让一个“中型”AI 模型(一种更便宜、性能较低的模型)表现得像最昂贵的顶级商业模型一样出色。它证明了拥有良好的结构(即这个三角色团队)往往比单纯拥有更大的大脑更为重要。

核心结论

OmniAct 表明,要建造一个能真正与我们共同生活并处理现实世界混乱情况的机器人,我们需要的不是一个单一的、完美的巨型大脑。相反,我们需要一个将规划、记忆和安全检查分离的层级化团队。通过让这些专门的部分相互通信,机器人变得更具韧性、更高效,并且能够处理复杂的长期工作,而无需人工干预。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →