Selective Cross-View Consistency for World Action Models: Held-Out Viewpoint Robustness Without Test-Time Camera Information
本文提出了选择性跨视图一致性(Selective Cross-View Consistency, SCVC),这是一种训练策略,通过仅将一致性损失应用于视图不变输出(如动作)而非视图协变输出(如视频帧),从而提高世界动作模型对留存相机视角的鲁棒性,进而避免了对合法视图特定内容的收缩,且无需相机标签或外参信息。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
通过观看视频进行学习的机器人正在成为现实,但它们面临着一个棘手的问题:当摄像机角度发生变化时,它们往往会失败。想象一下,如果一个机器人在训练时,摄像机位于其左侧的桌子上,它学会了拿起一个杯子。如果你将摄像机移到右侧,即使杯子的位置完全没变,机器人也可能会僵住或掉落杯子。这是因为机器人将动作与它在训练期间看到的特定视角联系了起来,而不是理解了物理任务本身。为了解决这个问题,科学家们正在开发“世界动作模型”(world action models),这是一种既能预测视频中下一秒会发生什么,又能预测机器人应进行何种物理动作的人工智能。人们希望通过从视频中学习,使机器人获得一种对世界运作方式的普遍感知,从而使其在视角发生变化时仍能正确行动。然而,以往试图让这些模型对摄像机变化具有鲁棒性的尝试都碰了壁,因为它们经常会将机器人的内部逻辑与它所持摄像机的稳定性混淆。
清华大学的一个研究小组发现,在训练这些模型处理不同摄像机角度时存在一个根本性的错误,并提出了一个精确的修正方案。他们发现,在训练机器人理解“同一个物理状态在不同角度下看起来不同”时,你不能以同样的方式对待机器人预测的所有部分。机器人的输出是两种类型信息的混合:它预期看到的未来场景(这取决于摄像机的位置),以及它需要采取的物理动作(这必须在摄像机位置改变时保持不变)。研究人员发现,强迫模型在变化的场景细节上达成一致实际上会干扰它,导致机器人对未来的视觉预测变得模糊。相反,他们开发了一种称为“选择性跨视角一致性”(Selective Cross-View Consistency)的方法,该方法强制模型仅在物理动作上达成一致,同时允许预测的场景随摄像机自然变化。
为了测试这一想法,研究人员创建了一种严谨的新评估方法,将真正的泛化能力与简单的记忆区分开来。在许多以往的研究中,机器人在训练期间已经见过的摄像机角度上进行测试,这给人了一种虚假的安全感。这种新方法涉及在广泛的摄像机角度上训练机器人,但故意留出特定的角度区间作为测试。这使得团队能够观察机器人是否能够处理其从未遇到的摄像机位置。他们还解决了如何测试这些机器人的一个主要缺陷:许多系统使用安装在机器人手腕上的摄像机,该摄像机随手臂移动且保持稳定,即使主场景摄像机在移动,它也保持稳定。这种稳定性误导系统认为自己具有鲁棒性,而实际上它只是依赖于手腕摄像机。通过测试一个仅使用场景摄像机的机器人版本,研究人员确保了我们衡量的是对环境的真正理解。
这种选择性方法的实验结果清晰且具体。当机器人在从未见过的摄像机角度(特别是那些远超出其训练范围的角度)上进行测试时,与使用相同数据训练的标准模型相比,新方法将其成功率提高了12.2个百分点。这种提升在不同类型的摄像机运动(如上下移动摄像机或改变距离)中均保持有效。然而,当机器人在其已经见过的角度范围内进行测试时,该方法并未显示出任何益处;在这些情况下,其表现与标准模型完全一致。这种区别至关重要,因为它证明了该方法不仅仅是在让机器人在所有方面都变得更好,而是专门帮助它泛化到新的、未见的视角。研究人员还通过对照实验证实,强迫模型在其预测的错误部分(即变化的场景)上达成一致,确实会降低性能,从而削弱机器人清晰预见未来的能力。
这项工作为让机器人更具适应性提供了清晰的路径。通过理解机器人的未来场景预测必须随摄像机而变化,而其决策必须保持不变,开发者可以构建真正鲁棒的系统。研究表明,通过正确的约束,机器人即使在世界看起来与它以往所见完全不同时,也能学会正确行动,前提是它不会因为试图强行让其视觉预测在应当自然差异时保持一致而感到困惑。研究结果表明,实现鲁棒机器人控制的关键不在于让机器人以同样的方式看待一切,而在于教会它哪些东西应该保持不变,以及哪些东西是被允许改变的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。