想象一下,你正试图从架子上拿一个特定的玩具,但一个大盒子挡住了你的视线。如果你只是站在原地盯着架子看,你可能永远也找不到那个玩具。你必须绕着走,从盒子的上方窥视,在伸手去拿之前获得一个更好的角度。
这篇论文介绍了一个名为 See2Act 的机器人大脑,它学习的正是这一点:它学习在移动手部(机械臂)的同时,学习移动它的眼睛(摄像头)。
以下是它的工作原理,通过简单的概念进行分解:
问题所在:“盲目”的机器人
大多数机器人学习方法就像是一个人在尝试解开一个拼图,但却戴着一个只能看到桌面上一个微小方块的眼罩。它们假设它们需要看到的一切都已经就在面前了。但在现实世界中,物体会互相遮挡(遮挡现象)。如果机器人看不见物体,它就无法抓取它。
解决方案:一场“去噪”之舞
作者使用了一种被称为**扩散模型(Diffusion Model)**的 AI 类型。你可以把它想象成一位雕塑家,从一块充满噪声、模糊的黏土开始,慢慢凿掉噪声,从而显现出一尊完美的雕像。
- 旧方法: 机器人在盯着一张固定且模糊的图片时,试图凿掉噪声以找到动作(手该往哪移动)。
- See2Act 方法: 机器人在“凿掉”噪声以寻找动作的同时,也同时移动它的头部(摄像头)。
随着机器人越来越接近搞清楚要做什么,它也同时搞清楚了该往哪看。
- 开始: 机器人看到的是整个桌面宽阔而模糊的视图。因为它看不清,所以它并不确切知道物体在哪里。
- 舞蹈: 当 AI 在“清理”关于手部动作的猜测时,它同时也让摄像头靠近并调整角度,以窥视障碍物后方。
- 结果: 当机器人对手的动作有了清晰的计划时,它也同时将摄像头移动到了一个完美的近距离视角,从而揭示了隐藏的物体。
训练过程:向“数字孪生”学习
机器人并不是通过在现实世界中进行试错来学习的(那样既慢又危险)。相反,研究人员构建了一个数字孪生(Digital Twin)——一个关于该机器人和房间的完美视频游戏版本。
他们向机器人展示了 50 次人类拿起物体的演示。至关重要的一点是,他们不仅教了机器人如何移动手部,还教了它在每一步动作中摄像头应该在哪里。机器人学到了:为了抓取一个隐藏的物体,它必须先移动摄像头才能看到它。
实验结果:眼见为实
他们通过两种方式测试了该机器人:
在视频游戏(模拟器)中:
- 当物体被盒子挡住或放在箱子内时,其他机器人完全失败了(成功率为 0%)。
- See2Act 成功率约为 96%。它学会了如何绕过盒子并窥视箱子内部以寻找目标。
- 它还在标准任务中击败了其他先进的机器人,即使在没有障碍物的情况下,证明了移动摄像头有助于提高精度。
在现实世界中:
- 他们将这个在视频游戏中训练好的机器人安装在一个真实实验室里的金属机械臂上。他们没有针对现实世界对其进行重新训练或调整(这被称为“零样本迁移/zero-shot transfer”)。
- 机器人成功地抓取了隐藏物体,并以极高的精度放置了物体,成功率达 95%。
- 它处理了诸如将底座放入狭窄架槽的任务(其中毫米级的误差都至关重要),通过在插入物体前移动摄像头来获取近距离观察。
核心结论
See2Act 是一个学会了一项非常人类化的技能的机器人:如果你看不见它,就移动你的头直到你能看见为止。 通过将“观察”和“行动”结合成一个单一且连续的过程,该机器人能够解决那些由于受限于固定视点而无法处理问题的其他机器人所面临的问题。
技术摘要:See2Act —— 用于机器人模仿学习中主动感知的扩散模型
问题陈述
目前的视觉运动控制模仿学习(IL)方法通常假设全观测和固定视角,将“观察”与“行动”的能力混为一谈。在现实环境中,物体经常被遮挡,要求机器人必须在进行操作之前,主动寻找与任务相关的视觉信息。现有方法面临一个根本性的限制:演示数据将视角选择与操作动作耦合在一起,但标准的模仿学习将其视为两个独立的环节,或者假设所需的视觉信息已经可见。
- 固定视角策略在任务相关区域被遮挡时会失效。
- 多视角或被动视角选择方法(例如,从预设集合中选择最佳视角)并未教会策略如何通过移动摄像头来动态解决遮挡问题。
- 数据效率低下: 仅仅通过增加额外视角来增强演示数据,会导致数据需求呈组合式爆炸增长,且无法教会策略哪些视角对特定动作是有用的。
核心挑战在于,如何从有限的演示中学习一个能够同时决定“在哪里看”以及“如何做”的策略,特别是在严重的遮挡情况下。
方法论:See2Act
作者提出了 See2Act,这是一个基于扩散模型的模仿学习框架,它将动作去噪与视角细化耦合在单个生成循环中。其核心洞察是:扩散轨迹可以作为动作与视角的共同轨迹。
1. 训练策略
该策略完全在利用数字孪生(Digital Twin)的仿真环境中进行训练,并利用离线操作数据集。
- 关键帧动作: 演示被分解为目标关键帧动作(a0),代表抓取/放置操作中的末端执行器位姿。
- 视角锚定: 动作不是在固定的世界坐标系中表示,而是在相机坐标系中表示。对于每个扩散时间步 t,会生成一个相机位姿 Ct。
- 锚点: 轨迹在广域全局视角(CT)与直接源自关键帧动作 a0 的目标中心视角(C0)之间进行锚定。
- 插值: 中间位姿 Ct 通过位置的线性插值和方向的球面线性插值(SLERP)在 CT 与 C0 之间生成。
- 加噪过程: 将目标动作 a0 转换到相机坐标系 Ct 中,以创建视角相关的目标 a^0。随后加入高斯噪声以创建噪声动作 a^t。
- 目标函数: 训练一个视觉编码器和噪声预测网络,在给定观测值 Ot(由 Ct 渲染)和噪声动作 a^t 的条件下,预测噪声 ϵ。模型通过这种方式学习去噪动作,并隐式地学习相应的具有信息量的视角。
2. 推理:主动视角推理
在测试阶段,该策略执行一个耦合的反向扩散过程:
- 初始化: 从全局视角(CT)和噪声动作估计开始。
- 迭代细化: 在每个去噪步骤 t:
- 获取当前观测值 Ot。
- 预测噪声并更新相机坐标系下的动作估计。
- 将细化后的动作估计转换回世界坐标系。
- 重新定位相机: 基于更新后的动作估计(使用与训练时相同的插值逻辑)计算一个新的、更接近目标的相机位姿 Ct−1。
- 获取新的观测值 Ot−1。
- 执行: 该循环持续进行直到 t=0,最终产生一个最终动作和一系列相机位姿,从而主动解决遮挡问题。策略会选择相机位姿变化方差最小的展开路径(Rollout),以确保稳定性。
核心贡献
- See2Act 框架: 一种视角无关的策略,通过利用数字孪生以及一种相机轨迹完全受动作标签监督的新颖训练策略,学习了视角与动作之间的耦合关系。
- 主动视角推理: 一种测试时机制,能够迭代地同时细化机器人的相机位姿和预测的动作,使机器人能够在无需单独规划阶段或奖励函数的情况下,自主解决遮挡问题。
- 基准测试表现:
- Ravens: 在四个新的重度遮挡任务上实现了 91% 的平均成功率,显著优于固定视角、多视角和仅缩放(Zoom-only)的基准方法。
- RLBench: 在九个任务中实现了 81.1% 的平均成功率,尽管每个步骤仅使用了一个主动重新定位的 2D 视图,但仍优于最先进的 3D 和多视角策略(如 RVT-2, PerAct)。
- 零样本 Sim-to-Real 迁移: 在配备腕部深度相机的物理 UR10 机器人上进行了验证。仅使用从数字孪生中收集的 50 份演示数据,该策略在具有显著遮挡的现实世界抓取与放置任务中达到了 95% 的成功率,且无需任何现实世界的微调。
实验结果
- 遮挡解决能力: 在 Ravens 任务(如 bin-picking、put-within-shelf)中,固定视角基准(Conv-MLP, Diff-MV)失败(成功率为 0%)。被动视角选择(Diff-MV-Entropy)最高达到 64%,但在复杂遮挡下表现挣扎。See2Act 达到了高达 100% 的成功率,证明了迭代式主动细化对于揭示隐藏区域是必要的。
- 搜索行为: 在 bin-search 任务中,See2Act 表现出了涌现的搜索行为,即当当前视图为空时,会自动重新调整相机方向以检查其他料箱,在基准方法得分为 0% 的情况下实现了 100% 的成功率。
- 精密操作: 在需要 1–2mm 公差的现实世界 shelf-kitting 任务中,See2Act 实现了 95% 的成功率,而固定视角方法仅为 25%。在去噪过程中将相机移近目标的能力,提供了高精度插入所需的几何细节。
- 鲁棒性: 该策略对分布外(OOD)的初始相机位姿表现出鲁棒性;当起始视角处于训练分布之外时,性能仅轻微下降(8–10%)。
意义与主张
论文声称 See2Act 通过将操作视为动作细化与视觉证据获取的耦合过程,解决了模仿学习中的一个关键空白。
- 统一学习: 它证明了“在哪里看”和“如何做”可以从离线数据中联合学习,而无需显式的视角标注或针对感知能力的强化学习奖励。
- 高效性: 该方法通过使用深度观测和主动视角细化,实现了在有限数据(50 份演示)下的稳健表现,并实现了零样本向现实世界的迁移,克服了 Sim-to-Real 鸿沟。
- 局限性: 作者承认,在每个去噪步骤中都需要获取新的观测值会引入延迟,使得执行速度比固定视角方法慢。未来的工作建议将该框架扩展到用于灵巧和动态操作的密集轨迹预测。
这项工作确立了:当主动感知直接嵌入到扩散去噪循环中时,它能够解决部分可观测性问题,这是固定视角、多视角及被动选择方法无法实现的。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。