Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts
本文介绍了领域算术(Domain ARiThmetic, DART),这是一种基于类比的方法,通过利用子空间对齐的领域特定信息进行权重向量运算,实现了视觉-语言-动作模型向环境变化的快速单样本自适应,从而消除了对高成本多演示训练的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大问题:机器人在新房间里迷失了
想象你有一个技术精湛的机器人厨师(一个 VLA 模型),它在一个特定的厨房(源域)中接受过训练。这个机器人知道如何切菜、搅拌汤品和摆盘,它已经看过成千上万段执行这些任务的视频。
现在,你把机器人移到了一个新厨房(目标域)。
- 摄像头的安装位置变了。
- 灯光变得略有不同。
- 甚至机器人现在换了一个品牌,手臂也有了细微的变化。
尽管机器人知道“如何烹饪”,但它却感到困惑。它认为刀的位置变了(因为视角变了),或者因为它无法识别食材(因为光线不对)。它无法完成以前能轻松完成的任务。
解决旧方法的办法:
为了教会机器人这个新厨房,你通常需要雇佣一名人类训练员,拍摄几十段机器人在新房间里执行每项任务的视频。这既昂贵、缓慢,又不切实际。
“单样本(One-Shot)”的梦想:
如果只需通过看仅仅一段关于某项任务的视频,就能教会机器人适应新厨房,那会怎样?这就是这篇论文的目标。
解决方案:DART(领域算术)
作者提出了一种名为 DART 的方法。他们并没有从头开始重新训练整个机器人,而是使用了一个巧妙的技巧,叫做“权重算术(Weight Arithmetic)”。
把机器人的大脑(它的神经网络权重)想象成一个巨大的指令库。
- 基础机器人: 拥有“如何切菜”(任务)和“如何在厨房 A 中观察”(源域)的指令。
- 新机器人: 需要“如何切菜”(任务)和“如何在厨房 B 中观察”(目标域)的指令。
问题在于,当你只给机器人看一段在新厨房里的视频时,它的脑部更新会变成两者的混合体。它学会了“如何在厨房 B 中切菜”,但它会过度沉溺于这个特定的任务,以至于忘记了如何在那个新厨房里处理其他任务。
魔法技巧:相减与相加
作者发现,机器人的大脑更新可以被分解为两个独立的部分,就像混合颜色一样:
- 任务颜色: “切菜”的指令。
- 领域颜色: “厨房 B 的灯光/摄像头”的指令。
他们发现这两个颜色是混合在一起的,但可以通过数学方法进行分离。以下是 DART 的工作原理:
获取“任务”参考: 机器人已经知道如何在旧厨房里切菜。他们提取一段在旧厨房切菜的视频,并计算出“任务向量”(纯粹的“切菜”指令)。
获取“新”更新: 他们提取一段在新厨房里切菜的视频,并计算出“新更新向量”。
相减(类比):
- 想象“新更新”是一个由 切菜 + 新厨房 组成的奶昔。
- 想象“旧更新”是一个由 切菜 + 旧厨房 组成的奶昔。
- 如果你从“新更新”中减去“旧更新”,“切菜”的部分就会抵消掉!
- 结果: 你得到了一个纯粹的 “新厨房”向量。这个向量只包含关于新摄像头和灯光的信息,而不包含特定的任务指令。
相加: 他们将这个纯粹的“新厨房”向量加回到原始机器人的大脑中。
- 原始大脑 + 新厨房向量 = 一个能完成所有旧任务,但现在能在新厨房里完美观察的机器人。
清理噪声(子空间滤波)
这里有一个陷阱。当你减去两个东西时,有时会不小心留下“噪声”或“伪影”(就像从旧厨房里掉落的一粒尘埃,卡在了减法过程中)。
为了修复这个问题,DART 使用了 子空间滤波器(Subspace Filter)。
- 把机器人的大脑更新想象成一个 3D 形状。
- 滤波器会检查“新厨房”的形状是否与“旧厨房”的形状完美对齐。
- 如果形状的一部分没有对齐(即它只是随机噪声),滤波器就会将其切除。
- 这确保了机器人只学习新旧厨房之间的“真实差异”,而不是随机的故障。
为什么这很重要(实验结果)
作者在模拟环境和现实世界中测试了这些机器人。
- 测试: 他们改变了摄像头的角度、增加了摄像头噪声,甚至更换了机器人的手臂(例如将 Panda 机器人换成了 UR5e 机器人)。
- 结果:
- 旧方法: 失败了,或者需要大量的数据。
- 单样本微调(天真的做法): 机器人学会了一个任务,但忘记了其他所有任务。
- DART: 机器人仅通过 一次演示 就适应了新环境,并且保留了执行所有其他任务的能力。它的表现优于所有其他方法。
总结类比
想象你是一位音乐家,在具有极佳音效的音乐厅里可以完美地演奏钢琴(源域)。
你搬到了一个狭小、有回声的客厅(目标域)。你尝试演奏,但声音听起来很奇怪,你发挥失常了。
- 旧的方法: 你请了一位老师,在客厅里录制你演奏每一首曲子的过程,持续数周。
- DART 的方法:
- 你在客厅里录制自己演奏一首曲子的声音。
- 你在音乐厅里录制同一首曲子的声音。
- 你使用计算机,从“客厅的声音”中减去“音乐厅的声音”。
- 这就得到了一个“客厅音效”文件。
- 你将这个文件应用到你的大脑中。现在,即使你只在客厅练习了一首歌,你也能在客厅里完美地演奏任何曲目。
底线是: DART 允许机器人通过数学手段隔离其大脑中的“环境”部分,并将其添加到现有知识中,从而通过仅需一个示例就能瞬间适应新环境(不同的摄像头、不同的机器人)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。