← 最新论文
🤖 AI

VGGT-DP: Generalizable Robot Control via Vision Foundation Models

VGGT-DP 是一个通用的机器人控制框架,它通过将预训练 3D 感知模型的几何先验与本体感受反馈相结合,并利用帧间标记重用(frame-wise token reuse)和随机标记剪枝(random token pruning)来提升视觉运动策略的性能,从而增强空间定位能力、鲁棒性和推理效率。

原作者: Shijia Ge, Yijun Liu, Yinxin Zhang, Shuzhao Xie, Weixiang Zhang, Mingcai Zhou, Zhi Wang

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Shijia Ge, Yijun Liu, Yinxin Zhang, Shuzhao Xie, Weixiang Zhang, Mingcai Zhou, Zhi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直难以像生物那样拥有流畅且自信的动作。几十年来,工程师们通过编写僵化的手工规则来为机器编程,精确地告诉它们在每种可能的情况下手臂该如何移动。这种方法在受控的工厂环境中行之有效,但当世界发生哪怕极其微小的变化时,便会彻底失效。近年来,一种新的方法开始盛行:通过展示范例来教导机器人,就像孩子通过观察父母学习一样。机器人观察人类完成一项任务,并尝试模仿其动作。然而,这些学习系统往往缺乏对空间的深度理解。它们可以识别出一个物体,却经常无法理解该物体相对于机器人自身身体在三维空间中是如何摆放的。这种空间理解能力的缺失,限制了机器人处理复杂任务或在相机角度变化及环境改变时进行适应的能力。

一个研究团队开发了一种旨在弥补这一差距的新系统,其灵感源自生物视觉的工作方式。在自然界中,动物并不依赖单一的感觉来导航;它们将视觉与一种持续的、关于自身身体位置的内在感觉(即本体感觉)相结合。这种内在反馈让苍蝇能够落在移动的叶子上,或让猫能在狭窄的边缘行走而不坠落。由葛时佳及其在清华大学及其他机构的同事领导的研究人员,创建了一个名为 VGGT-DP 的框架,模拟了这种生物策略。该系统不再依赖语言指令或简单的视觉线索,而是将强大的预训练视觉模型与机器人的内部状态传感器相融合。这种结合使机器人能够构建一个稳健的三维环境地图,并准确理解自己的肢体在空间中的确切位置。

这一新系统的核心是一个基于海量三维重建数据训练的视觉引擎。标准的机器人视觉模型通常设计得较小且快速,以牺牲细节来换取速度,而该系统则使用了一个大规模模型,能够预测深度、相机角度以及场景中每个点的精确位置。研究人员发现,通过使用这种重型视觉模型,机器人获得了更强的几何感。然而,实时运行如此庞大的模型在计算上非常昂价且缓慢。为了解决这个问题,团队发明了一个巧妙的技巧,称为“帧间标记复用”(frame-wise token reuse)。在典型的视频流中,许多帧之间存在显著重叠;背景和大多数物体在毫秒之间并不会发生变化。新系统识别到了这一点,停止了对图像中未发生变化部分的视觉特征进行重新计算,它仅处理最新帧中到达的新信息,并复用之前时刻缓存的数据。这种方法极大地缩短了机器人的思考时间,使强大的视觉模型在现实世界中使用变得切实可行。

为了确保机器人的视觉与其物理现实相匹配,研究人员添加了一层内部监督。他们教导视觉系统仅凭所见即可预测机器人的关节角度和手部位置。如果机器人的“眼睛”看到一只手正在伸手拿杯子,系统必须能够正确猜测那只手在空间中的位置。这迫使视觉模型与机器人的内部状态完美对齐,从而形成了一个紧密的反馈循环。拼图的最后一块涉及一种称为“随机标记剪枝”(random token pruning)的方法,即系统在训练期间会有意忽略视觉数据中微小的随机部分。这种技术起到了类似“压力测试”的作用,迫使机器人去学习场景的整体形状和结构,而非死记硬背特定细节,从而使其在面对缺失信息或噪声时更具韧性。

在涉及操控的系列挑战性任务(如从孔洞中捡拾物体、将物品扫入篮子或拉动木棒)中,测试表明该新系统比现有方法有了显著改进。在需要精确空间推理的困难场景下,新方法的成功率明显高于以往表现最好的模型。例如,在需要从深孔中捡起物体的任务中,新系统的成功率为 55%,而之前的最佳方法(DP3)仅为 14%。该系统在扫除物品成堆等任务中也表现得非常有效,成功率为 44%,而排名第二的竞争对手仅为 15%。这些结果表明,赋予机器人对空间的深度、具备几何感知能力的理解,对于复杂操控任务而言,远比单纯增加语言能力更为关键。

然而,研究人员也谨慎地指出该系统仍存在的不足之处。虽然它在需要复杂空间推理的任务中表现出色,但在处理非常基础的任务(如伸手拿取近处的物体)时,并不总是能超越旧有的简单模型。在这些简单场景中,沉重的视觉模型有时会引入不必要的复杂性。更显著的是,当相机角度发生轻微变化时,系统会表现挣扎。当研究人员测试机器人并将相机旋转仅 5 度时,成功率从接近 40% 大幅下降到几乎为零。这表明,尽管该系统已经学会了很好地理解三维空间,但尚未学会如何灵活应对训练数据中未曾出现的视角变化。研究人员建议,未来的工作必须致力于使这些视觉表示对视角的变换更加鲁棒。

研究结论认为,通往更强大机器人的路径不在于通过语言让它们变得更聪明,而在于让它们的视觉更扎根于物理现实。通过将理解三维几何的大规模视觉模型与机器人自身的身体感知相结合,研究人员创建了一个能够以以往模仿学习中从未见过的精度来导航和操控世界的系统。这项工作证明,实现通用机器人控制的关键在于对环境的深度空间理解,并辅以对自身状态的内在感知。尽管挑战依然存在,特别是处理意外的相机角度变化,但研究结果为机器人控制的未来提供了一个清晰的方向:优先考虑空间落地(spatial grounding)和生物启发,而非语言复杂性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →