在机器人领域,教机器移动机械臂去抓取杯子,通常需要向它展示数千个示例。机器人观察人类执行任务的过程,然后尝试模仿其动作。多年来,科学家们一直在思考,如果赋予机器人对物理世界更好的理解——具体而言,是物体之间精确的距离和角度——是否会使其变得更聪明。想象一下,一个机器人不仅能看到杯子和桌子的图像,还能理解它们之间精确的数学关系。人们希望这种额外的几何知识层能帮助机器人在杯子被轻微移动或摄像机角度发生变化时进行适应。这个问题处于一项新研究的核心,该研究涉及一个旨在控制机器人手臂的小型专用计算机大脑。研究人员想要了解,向这个大脑输入关于物理空间的显式指令,究竟是确实有助于它学习,还是机器人仅通过观察就能自行掌握。
这项研究聚焦于一个微小的人工智能模型,它仅包含 0.8 亿个参数,按现代标准来看规模很小,但足以作为一个功能性的机器人控制器。团队在涉及模拟环境中移动物体的任务集上训练了这个模型,使用了总计 620 万个可调节设置来教授它如何行动。他们测试了两种向机器人提供几何信息的主要方式。在第一种方法中,他们将数据直接输入到机器人的决策“门”(gate)中,这些门就像控制机器人随时间处理信息的开关。在第二种方法中,他们将同样的几何数据输入到机器人的输入流中,将其视为句子中的一个单词。为了确保测试的公平性,他们还训练了一个在学习阶段几何数据被随机打乱的版本,即机器人虽然看到了这些数字,但数字与实际动作并不匹配。最后,他们测试了一个使用简单时钟信号而非几何数据的版本,以观察机器人是否仅仅是在跟随一个计时器。
结果令人惊讶,并挑战了“更多几何细节会导致更好性能”这一普遍假设。当机器人使用正确、未打乱的几何数据进行训练时,其成功率约为 2 9%。然而,使用打乱的、无意义的几何数据进行训练的版本表现甚至略好,成功率接近 37%。而完全没有接收几何数据的版本成功率约为 24%。这表明,在本次实验的具体条件下,提供精确且正确的几何指令,并不比提供随机或打乱的数字具有明显的优势。研究人员发现,机器人并不依赖这些数字的正确对齐来取得成功;事实上,打乱的版本有时甚至优于正确版本。这表明,机器人可能正在通过其他线索(如摄像机的视觉模式或动作序列)来学习解决任务,而不是通过计算物体间的物理距离。
研究还测试了这些机器人处理环境变化的能力,这是任何现实世界应用的关键测试。当研究人员旋转整个坐标系——本质上是告诉机器人“向上”现在变成了“向左”时,一个仅依赖绝对位置的机器人完全失败了。然而,一个被训练去理解相对位置(即专注于物体相对于机器人手的方位,而非固定地图)的机器人,在十次尝试中成功了七次。这表明理解相对关系对于灵活性至关重要。然而,当研究人员将物体在桌面上仅移动了五厘米时,所有的视觉策略(包括经过几何训练的策略)都崩溃了。它们的成功率降至接近于零。这揭示了一个显著的差距:虽然机器人可以应对视角的改变,但它们无法应对物体位置的微小物理偏移。几何训练并未能保护它们免受这种失败的影响。
最终,论文得出结论:仅仅向小型机器人大脑添加物理状态信息,并不能保证更好的性能或鲁棒性。研究人员没有发现可靠的证据表明,训练时的几何对齐有助于机器人泛化到新情境。不同训练运行过程中的成功率微小差异表明,结果对偶然性和特定任务细节较为敏感,而非源于几何数据带来的根本性改进。这项研究是对该领域的一次谨慎检查,它表明虽然机器人可以学会适应视角的变化,但在物理布局发生轻微变化时,它们仍然是脆弱的。研究结果表明,实现真正鲁棒的机器人操控路径可能不仅仅是向系统提供更好的物理世界地图,更可能需要这些系统在如何与现实互动方面发生更深层的变革。
技术摘要:具身小语言模型(SLM)中的几何条件化研究
问题陈述
本文研究了物理状态输入(特别是关于物体和目标位置的几何信息)如何影响针对机器人操控任务进行适配的小语言模型(SLM)的性能。虽然近期的研究表明,混合语言模型(结合了注意力机制与门控循环机制)仅需通过数百万个可训练参数即可适配为机器人策略,但目前尚不清楚通过输入 Token 注入几何信号或通过循环衰减门(recurrent decay gates)注入信号是否能提升学习效果。此外,目前仍不确定表观性能的提升是依赖于几何信号在训练期间与演示数据在时间与空间上的对齐,还是模型能够通过其他手段学习到鲁棒性。
方法论
作者使用了一个 0.8B 混合语言模型(Qwen3.5-0.8B),并将其适配于 LIBERO-Spatial 操控基准测试。基础模型权重保持冻结;适配过程是通过对注意力投影(attention projections)、线性输入投影(linear input projection)以及动作头(action head)进行低秩自适应(LoRA)实现的。所有实验条件的总可训练参数量被严格控制在一致水平(约 6.2M)。
本研究对比了几种注入几何数据的条件化路径:
- 基于 Token 的条件化(Token-based Conditioning):
- c1: 一个 Token-MLP 适配器接收 6 维不变几何增量(gt),并在输入投影前将其投影至 2 维。
- c2: 一个 Token 适配器接收更丰富的 14 维相对状态特征。
- c0(基准): 未提供显式的物体/目标几何信息。
- 基于衰减门的条件化(Decay-Gate Conditioning):
- f0: 将 6 维不变增量(gt)通过一个可学习标量和 tanh 压缩变换,作为偏置项添加到 18 层门控增量网络(GDN)的衰减对数(decay logits)中。
- f0-shuffled: 使用相同的 gt,但在训练期间对时间对齐进行打乱(置换),以测试正确时间对齐的必要性。
- b1(时钟控制): 不使用几何信息,而是向衰减门输入六个归一化的“Token 时钟”通道,以控制是否存在任何时间信号。
实验方案
- 任务: LIBERO-Spatial 中的三个任务。
- 训练: 在每个任务 35 个演示样本上进行行为克隆(behavior cloning)联合训练,并采用动作分块(action chunking, K=8)。
- 评估: 540 个留出测试样本(3 个种子 × 3 个任务 × 10 个初始状态)。
- 鲁棒性测试:
- 坐标系重标记(Frame Relabeling): 在不移动物理场景的情况下,旋转输入位姿的坐标系。
- 物理位移(Physical Displacement): 在桌面平面内将目标物体平移 5 cm 和 10 cm。
关键结果
- 训练时的对齐(Training-Time Alignment): 几何信息的正确时间对齐(f0)并未优于打乱训练(f0-shuffled)。
- f0(正确): 成功率 28.9%(26/90)。
- f0-shuffled(打乱): 成功率 36.7%(33/90)。
- c0(无几何信息): 成功率 24.4%(22/90)。
- 正确几何与打乱几何之间的差异在统计学上并不显著(p=0.28),这表明在此设置下,正确的对齐并没有带来明显的收益。
- Token 路径与门控路径对比:
- Token 适配器 c1(27.8% 成功率)的表现与门控适配器 f0(28.9% 成功率)相似,不同种子间的差异尚无定论。
- 更丰富的 Token 适配器 c2(34.4% 成功率)呈现出优于基准的趋势,但在给定样本量下,该提升在统计学上并不显著(p=0.093)。
- 时钟条件化(Clock Conditioning): 时钟条件 b1 表现较差(11.1% 成功率),且包含一个未收敛的种子,这表明衰减门接口对输入的语义和优化稳定性非常敏感。
- 对坐标变化的鲁棒性:
- 坐标系重标记: 使用相对坐标的状态类策略在旋转 45° 和 90° 时仍能保持 7/10 的成功率,而使用绝对坐标的策略则完全失败。这证实了相对坐标对刚性变换具有不变性。
- 物理位移: 所有测试的视觉策略(包括带有几何条件化的策略)在面对物理位移时均表现崩溃。当位移为 5 cm 时,成功率降至最高 3/20;当位移为 10 cm 时,成功率为 0/20。这表明坐标不变性并不等同于对新物理布局的泛化能力。
意义与主张
本文旨在提供用于解释几何条件化表观收益的控制变量。主要发现是,在所使用的特定适配方案下(冻结 SLM、LoRA、较小的参数预算),训练时的几何对齐并不能可靠地比打乱训练提高性能。
研究强调了坐标不变性(处理旋转坐标系)与物理布局泛化(处理位移物体)之间的关键差距。虽然相对坐标特征成功处理了坐标系重标记,但没有任何策略(无论是否包含几何条件化)能够泛化到物理位移的情况。作者得出结论,本研究识别了在小规模适配预算下几何条件化的局限性,并说明在类似工作中观察到的收益可能高度依赖于几何信号与演示数据的对齐,而非模型具备学习物理因果关系的能力。
局限性
作者指出,基准性能(24.4%)相对较低,因此存在另一种可能性,即更强的训练方案可能会揭示几何条件的收益。此外,由于 Token 适配器存在 2D 瓶颈,匹配输入(c1 对比 f0)的比较受到了限制,且鲁棒性测试是在特定的种子和任务上进行的,这限制了所观察到的失效模式的普适性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。