← 最新论文
🤖 AI

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

AcrossVAM1.0 是一种轻量级的文本辅助视频动作模型,它通过将未来帧分解为以物体为中心的粒子动力学和稠密外观,从而改进了机器人视频预测,并证明了显式粒子建模能够降低轨迹误差,尽管目前在语言理解和感知质量方面仍存在局限性。

原作者: Yafei Zhang, Nan Wu

发布于 2026-08-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Yafei Zhang, Nan Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

要理解机器人如何学习预见未来,我们必须首先理解它如何观察现在。在物理人工智能的世界里,机器人不仅仅是在处理一张静态图像;它必须预判当它与世界交互时,那张图像会发生怎样的变化。这就是视频预测的挑战:教机器观察一个场景,并猜测接下来的几刻钟内会发生什么。对于人类来说,这是一种本能。如果你看到一个杯子放在桌子边缘,你知道如果推它,杯子就会掉落。然而,对于机器人来说,这需要一个复杂的内部模拟过程。它必须将场景中会移动的部分与保持静止的部分区分开来,并且必须理解像“拿起蓝色方块”这样简单的指令,根据机器人的手臂和环境的不同,可能会导致许多不同的视觉结果。目标不仅是创造一幅漂亮的未来图像,而是创建一个可靠的运动图谱,供机器人安全且有效地规划其动作。

来自 Across Physical AI 和中国科学院的研究人员采用了一种新的方法来解决这个问题,他们将该系统称为 AcrossVAM1.0。他们并没有尝试一次性预测视频帧中的每一个像素(这往往会导致模糊或混乱的结果),而是将任务分解为两个截然不同的工作。他们意识到,在典型的机器人视频中,大部分图像实际上是静态的。桌子、墙壁和地板是不动的;只有机器人的手臂、抓取器以及它所持有的物体在改变位置。团队设计了一个模型,将这些运动部件视为独特的语义粒子。想象一下,机器人的手臂和抓取器不是连续的像素流,而是几个特定的、被追踪的物体,拥有各自的位置、大小和速度。该模型将计算能力集中在精确预测这些少数运动部件如何在空间中移动上,同时将其余场景视为稳定的背景。

该系统的工作流程是首先观察四帧视频和一段文字指令,例如“拿起蓝色方块”。它使用一个预训练的、冻结的视觉系统来识别机器人、其手臂和抓取器,将它们转化为描述其位置和大小的简单数据点。随后,一个仅包含 0.28 百万个可训练参数的小型、高效的“大脑”会接收这些数据点,并计算它们在接下来的五个时刻的位置。这部分模型严格专注于运动,并受文本指令引导,以确保预测的运动确实对应于给出的命令。一旦模型确定了运动部件的路径,第二个独立的流程就会填充细节。它利用视频的最后一帧,恢复静态背景的精细纹理和色彩,确保墙壁和桌面看起来清晰真实。最后,一个智能混合机制将预测的机器人运动与高质量的静态背景结合起来,创造出一段完整的未来视频。

该方法的结果展示了运动与图像质量之间明显的权衡。当研究人员在真实机器人运动的基准测试中测试该模型时,基于粒子的预测显著提高了运动本身的准确性。与仅仅假设没有任何物体移动的简单方法相比,机器人手臂路径的误差降低了 21.0%。该模型成功预测了手臂和抓取器的轨迹,其精度远高于那些试图同时猜测整个图像的以往方法。然而,该模型并非完美。虽然它擅长正确移动机器人部件,但在处理最终图像的整体视觉质量方面仍略显吃力。在衡量预测视频与真实视频相似度的测试中,新模型的得分略低于仅仅复制最后一帧的简单方法,特别是在处理场景的细微纹理方面。研究人员发现,虽然模型可以遵循文本指令进行移动,但语言与特定路径之间的联系仍然较弱;在大多数情况下,仅稍微改变指令并不会显著改变预测的路径。

这项工作凸显了一个关于教导机器人视觉的基本洞察:理解特定物体的运动,往往比试图同时预测场景中的每一个像素更为有效。通过将预测运动的任务与恢复图像细节的任务分离,研究人员创建了一个轻量化且具有可解释性的系统。他们可以通过观察内部的“粒子”,清晰地看到机器人认为什么是移动的,以及它认为自己要去向何方。虽然该系统尚未准备好取代所有现有方法——因为它仍需提高生成照片级真实图像的能力以及严格遵守复杂语言指令的能力——但它提供了一个充满希望的新方向。它表明,机器人视觉的未来可能在于那些理解运动部件物理特性的简单、结构化模型,而不是那些试图记忆场景中每一个细节的庞大、复杂的系统。未来的路径在于优化这些两类信息(运动部件与静态背景)的结合方式,并寻找让机器人的语言理解更加稳健可靠的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →