← 最新论文
🤖 machine learning

Test-Time Training for Visual Foresight Vision-Language-Action Models

本文提出了T3T^3VF,这是一种具有自适应更新过滤机制的测试时训练方法,该方法利用预测的未来图像与实际观测之间的自然监督关系,在无需修改架构的情况下,缓解视觉预见性视觉 - 语言 - 动作模型中的分布外脆弱性。

原作者: Sangwu Park, Wonjoong Kim, Yeonjun In, Sein Kim, Hongseok Kang, Chanyoung Park

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Sangwu Park, Wonjoong Kim, Yeonjun In, Sein Kim, Hongseok Kang, Chanyoung Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人执行任务,比如堆叠积木或拿起杯子。为了做好这件事,机器人使用一种特殊的“大脑”,称为视觉预见 VLA。可以将这个大脑想象成一位分两步走的厨师:

  1. 梦想家:首先,机器人观察当前场景,并尝试想象几秒钟后场景会是什么样子。
  2. 执行者:基于那个被想象出来的未来,机器人决定采取什么行动(移动手臂、抓取物体)。

正如论文所解释的,问题在于这位“梦想家”非常脆弱。如果机器人遇到与其训练内容略有不同的情况(例如不同的光照条件或形状奇特的物体),它的“想象”就会出错。由于“执行者”完全依赖这种想象,整个机器人就会失败。这就像一位司机试图基于一张街道错误的地图来导航;无论他们驾驶得多么熟练,最终都会迷路。

解决方案:“测试时训练”(T3VF)

作者提出了一种巧妙的技巧,称为T3VF。他们不是仅仅运行机器人并寄希望于最佳结果,而是让机器人在工作过程中进行学习

以下是类比:
想象你正在参加考试。通常,你事先学习,然后在不看答案的情况下参加考试。

  • 旧方式:机器人参加“考试”(执行任务),对未来做出预测,采取行动,然后考试结束。如果它做错了,直到下次尝试时它才知道原因。
  • T3VF 方式:机器人预测未来,采取行动,然后立即看到真实结果。它当场将“预测”与“现实”进行比较。如果预测错误,机器人就利用那一刻快速调整其大脑,以便下次做得更好。

论文称这是一种“自然监督对”,因为机器人自身的行动创造了完美的老师:我原本以为会发生什么 vs. 实际发生了什么

即时学习的问题

然而,作者意识到,让机器人在每次犯错时都进行学习是危险的。有时,机器人的预测实际上是正确的,但它做了一个笨拙的动作(“执行者”错误)。如果机器人试图从中学习,它可能会责怪自己的“梦想家”,从而破坏其想象能力。

这就像一个学生因为误读了题目而做错了数学题,而不是因为不懂数学。如果他们以错误的方式学习,可能会完全忘记如何做数学题。

“智能过滤器”

为了解决这个问题,作者添加了一个智能过滤器(一种自适应更新机制)。其工作原理如下:

  1. “信心检查”:在机器人决定从错误中学习之前,它会问自己:“我对我的行动有信心吗?”

    • 机器人在脑海中多次尝试想象该行动。如果所有这些想象中的行动都非常相似(低方差),那就意味着机器人清楚该做什么。如果预测仍然错误,那很可能是“梦想家”(视觉部分)感到困惑,因此学习是安全的。
    • 如果想象中的行动杂乱无章(高方差),说明机器人对要做什么感到困惑。它会跳过学习,因为错误可能是由“执行者”而非“梦想家”引起的。
  2. “相对标尺”:机器人不使用固定规则(例如“仅当误差小于 5% 时才学习”),而是查看其近期历史。它会问:“这个误差是否比我最近的多数误差都要小?”

    • 这就像老师批改试卷。如果全班都在艰难的一天,60 分的成绩相对于其他人可能被认为是“好”的。如果全班都在轻松的一天,60 分可能被认为是“差”的。机器人会根据当前情况的难度调整其学习阈值。

结果

论文在机器人学习在棘手、陌生的环境中操作物体的任务中测试了这种方法。

  • 没有 T3VF:当环境发生变化时(即“分布外”问题),机器人表现显著困难。
  • 使用 T3VF:机器人更好地处理了这些新情况。其成功率平均提高了约 5%。

关键在于,这不需要构建新机器人或添加额外硬件。这是一项软件更新,使机器人能够利用智能过滤器确保仅从有用的时刻进行学习,从而在实时中“自我纠正”。

总结

这篇论文介绍了一种方法,使机器人能够在工作过程中从自身的预测中学习。通过比较它认为会发生的事情与实际发生的事情,机器人可以即时修正其“想象”能力。然而,为了避免从错误的事物中学习,它使用信心过滤器,仅在确定错误是由其视觉而非笨拙引起时才进行自我更新。这使得机器人在面对新颖且棘手的情况时更加稳健。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →