← 最新论文
🤖 AI

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents

MIRTH 是一个用于视觉-语言-动作智能体的统一框架,它通过集成双尺度时间记忆枢纽、互信息优化的潜在推理标记以及并行向量化动作解码方案,增强了性能与效率,从而克服了当前单帧架构的局限性。

原作者: Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人做晚饭。你给它一个简单的指令:“把奇异果放在案板上。”

目前的机器人大脑(被称为 VLA 模型)就像是一个只能看到下一秒生活的普通人。如果你递给它一把刀,它能看到这把刀。但如果你用毛巾把刀盖住,它会立刻忘记这把刀的存在并停止工作。此外,它们很难将宏大的概念(“做晚饭”)与微小的肌肉动作(“手臂向右移动 2 英寸”)联系起来。最后,它们反应很慢;它们必须一个接一个地思考每一个微小的动作,就像蜗牛打字一样。

这篇论文介绍了一个名为 MIRTH 的新方法来构建机器人大脑,它解决了这三个问题。以下是它的工作原理,我们使用简单的类比来解释:

1. “双尺度记忆”(解决注意力短浅的问题)

目前的机器人存在“时间近视”(temporal myopia)。如果物体被遮挡,它们就会失去追踪能力。

MIRTH 给机器人提供了两种类型的记忆笔记本:

  • “长期工作空间”笔记本: 这就像是对房间布局的一种缓慢、稳定的记忆。即使机器人因为某些东西挡住了视线而几秒钟内看不见,它也能记住:“案板在左边。”它使用一种特殊的数学技巧(指数移动平均,EMA)来保持这种记忆的平滑和稳定。
  • “短期运动”笔记本: 这是一个节奏极快的笔记本,用于追踪快速的变化,比如“杯子正在向右快速移动”。它以高细节度记录过去几秒钟内的运动情况。

类比: 想象你在开车。你的“长期记忆”是你知道高速公路出口很快就要到了;而你的“短期记忆”是对前方车辆突然刹车的即时反应。MIRTH 将两者结合,使机器人即使在物体被遮挡时也不会迷失方向。

2. “沉默规划器”(解决推理鸿沟的问题)

机器人通常难以将人类的语言转化为物理动作。它们要么随机猜测,要么因为语言与动作无法完美匹配而陷入停滞。

MIRTH 引入了 “潜层推理 Token” (Latent Reasoning Tokens)

  • 类比: 想象机器人在遵循食谱。与其大声喊出每一个步骤(“拿起勺子,向左移动,打开罐子”),MIRTH 在其大脑内部创建了一组沉默且无形的思维气泡。这些气泡不是文字,而是纯粹的“意图”。
  • 该系统经过训练,使这些思维气泡包含恰好足够的信息,从而将指令(“打开抽屉”)与动作(移动手臂)连接起来。这就像是一种秘密代码,在不需要人类为每一个动作编写手册的情况下,架起了“你想做什么”与“你实际做什么”之间的桥梁。

3. “并行引擎”(解决速度问题)

旧的机器人很慢,因为它们是“自回归”的。这意味着它们计算一个微小的动作,然后是下一个,再下一个,就像一个人一次只写一个字母那样。如果机器人需要向 6 个方向移动手臂,它必须一个接一个地写出 6 个字母。

MIRTH 使用了 “并行动作解码” (Parallel Action Decoding)

  • 类比: MIRTH 不是逐个字母地写句子,而是瞬间写出一个完整的单词。它观察计划,并一次性输出整个运动向量(所有关节的完整方向和速度)。
  • 这使得机器人反应极其迅速,能够实现实时反应,就像人类接住球时的反应一样。

结果:发生了什么?

研究人员在两个地方测试了 MIRTH:

  1. 视频游戏模拟环境 (LIBERO): 他们给了机器人需要长期记忆的任务,例如“打开抽屉,把勺子放进去,然后关上抽屉”。
    • 结果: MIRTH 几乎 100% 成功。当物体被遮挡或移动时,它不会感到困惑;它记得物体在哪里,并能从错误中恢复。
  2. 真实的机器人手臂 (LeRobot): 他们将代码运行在一个真实厨房里的物理机器人上。
    • 结果: 机器人可以处理复杂的任务,例如根据类别(例如“把所有红色的东西放在这里”)来整理水果和蔬菜。它在处理错误方面比其他机器人表现得好得多。如果它掉落了一个水果,它不会直接放弃,而是会弄清楚哪里出了错并尝试重新开始。

总结

MIRTH 是一种机器人大脑升级方案,它:

  1. 记忆过去(因此不会忘记被遮挡的物体)。
  2. 通过一种高效的秘密语言进行思考,以弥合语言与动作之间的差距。
  3. 通过一次性计算所有动作而非逐一计算,从而实现快速移动。

该论文声称,这使得机器人更加可靠、快速,并且能够处理现实世界中复杂的长程任务。代码和数据正被发布以供他人使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →