← 最新论文
🤖 AI

Understanding Asynchronous Inference Methods for Vision-Language-Action Models

本文在受控条件下对四种用于视觉 - 语言 - 动作模型的异步推理方法进行了系统比较,结果表明轻量级残差校正(A2C2)在 Kinetix 和 LIBERO 基准测试上优于其他方法,而训练时延迟模拟(TT-RTC)则提供了最稳健的零开销解决方案。

原作者: Ayoub Agouzoul

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Ayoub Agouzoul

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创造性类比对论文的解释。

核心问题:“慢厨师”与“饥饿机器人”

想象一位机器人厨师正在尝试烹饪一顿复杂的饭菜。为了做到这一点,这位厨师(AI 模型)会观察厨房,阅读食谱,然后一次性规划接下来的10 个烹饪步骤。这被称为“动作分块”。厨师不再决定“切洋葱”,然后等待决定“切胡萝卜”,而是瞬间规划出整个序列。这很高效。

问题在于: 这位厨师非常深思熟虑,但也极其缓慢。当厨师写完接下来 10 步的计划时,厨房已经发生了变化。机器人已经移动,食材已经移位,或者炉火已经窜起。厨师刚刚写下的计划现在是基于厨房的旧画面。如果机器人遵循这份“过时”的计划,它可能会切到空气而不是洋葱。

如果机器人等待厨师完成每一个步骤后再移动,它的移动速度太慢,无法发挥作用。如果它只是带着旧计划匆忙向前,就会犯错。

四种解决方案

这篇论文测试了四种不同的方法来解决这个“慢厨师”问题。研究人员建立了一个统一的测试环境(就像一个巨大的模拟健身房),以观察在延迟变长时哪种方法效果最好。

1. IT-RTC:“实时编辑员”

  • 工作原理: 想象厨师写下了 10 步计划,但写完时意识到已经过去了 3 步。厨师没有把纸扔掉,而是抓起一支红笔,擦掉前 3 步,然后迅速重写剩余的 7 步,以符合当前的情况。
  • 弊端: 这种编辑过程非常繁重。厨师必须进行额外的计算来“撤销”旧部分并“重做”新部分。它在短延迟下效果良好,但如果延迟较长,就会变得非常缓慢且笨拙。

2. TT-RTC:“熟能生巧”的厨师

  • 工作原理: 这种方法不是在计划写完后进行修正,而是在学习过程中训练厨师带着延迟进行练习。在训练期间,厨师被告知:“嘿,假装你已经晚了 3 步。假设前 3 步已经完成,写出计划,只给我剩下的部分。”
  • 优势: 因为厨师学会了预期延迟,所以在实际烹饪时不需要进行任何额外的编辑。他们直接交出计划,而该计划已经是正确的。这为烹饪过程增加了零额外时间。

3. VLASH:“时间旅行者”

  • 工作原理: 这种方法试图作弊时间。当厨师观察厨房时,他们不仅仅看当前状态;他们利用已知的动作在脑海中快进到机器人计划准备好时将会处于的位置。他们基于那个未来状态来编写计划。
  • 弊端: 在现实世界中,如果没有水晶球,你无法完美地预测未来。在论文的测试中,他们在一个基准测试中使用了“水晶球”(完美数据),这给了该方法巨大的优势,而这种优势在现实生活中可能并不存在。此外,如果延迟太长,“时间旅行”的猜测就会出错,导致计划失败。

4. A2C2:“抽查助手”

  • 工作原理: 这种方法完全保留原始厨师的计划,但增加了一个微小、超快的助手。厨师写下计划,但助手站在机器人旁边。机器人每走一步,助手就会查看当前的厨房,检查厨师的旧计划,并在需要时进行微小的修正
  • 优势: 助手非常小且快速。即使厨师的计划过时了,助手也能一步步地不断将机器人推向正确的方向。当延迟较长时,这种方法最可靠。

他们的发现

研究人员在两个不同的“厨房”(模拟环境)中测试了这些方法:一个简单的 2D 物理游戏(Kinetix)和一个复杂的 3D 机械臂任务(LIBERO)。

  • 长延迟的赢家(A2C2): 当延迟变得非常长(例如等待 20 步才能拿到计划)时,抽查助手(A2C2) 是明确的赢家。即使厨师非常慢,它也能保持机器人的成功。这是唯一一种在延迟巨大时不会崩溃的方法。
  • 速度与简单性的赢家(TT-RTC): 如果你可以重新训练模型,TT-RTC 是性价比最高的选择。它完全不会减慢机器人的速度,而且非常稳定。这就像从一开始就教会厨师做到完美,因此以后不需要任何修正。
  • “老派”方法(IT-RTC): 这在非常短的延迟下效果尚可,但随着延迟变长,它变得过于缓慢和笨拙,几乎和什么都不做一样糟糕。
  • “水晶球”方法(VLASH): 这出乎意料地有效,但论文警告说,它依赖于对未来状态的完美知识(而真正的机器人并不具备这种知识)。如果没有这种完美知识,它可能不会那么强大。

结论

如果你正在构建一个需要快速反应的机器人:

  1. 如果你可以重新训练 AI: 使用 TT-RTC。它运行免费且非常稳定。
  2. 如果你无法重新训练或延迟巨大: 使用 A2C2。它增加了极少量的额外工作,但在主 AI 太慢时能挽救局面。
  3. 避免使用 IT-RTC,如果你预期会有长延迟;它太沉重了。

这篇论文本质上说的是:“不要只是等待慢速的 AI 赶上进度。要么教会它预期延迟,要么给它一个快速的助手来实时修正它的错误。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →