想象一下,你正和机器人朋友一起走在一条茂密、杂乱的森林小径上。突然,一根树枝向你挥来,或者一块石头滚到了你的路径上。机器人是如何知道要停下来的?大多数现代机器人试图通过在完美的虚拟世界(模拟环境)中玩数百万小时的视频游戏来学习这些,并希望它们能将这种能力应用到现实中混乱的世界。但本文的作者说:“还是算了吧。”他们认为,这种“从模拟到现实”(sim-to-real)的方法就像是试图通过只看动画片来学习冲浪;水的感觉是不一样的,波浪的行为也不一样。
相反,这个团队构建了一个跳过了整个“视频游戏”阶段的机器人大脑。他们使用了一个名为 UniDepth 的“预训练”视觉模型。把 UniDepth 想象成一位超级聪明的艺术家,他已经研究过数百万张真实世界的照片,并学会了仅凭一张照片就能猜出物体距离有多远(单目深度估计)。机器人不需要学习如何看东西;它只需要借鉴这位艺术家的知识。
以下是他们的系统运作方式,分步骤详解:
- 眼睛与大脑: 机器人拍摄一段视频。UniDepth 查看每一帧并绘制出一张“深度图”,将平面的 2D 图像转化为 3D 地貌,让机器人确切知道每一个像素点离它有多远。
- 点追踪器: 为了弄清楚是否有物体正在向机器人靠近,他们需要追踪特定的点。他们使用了另外两个工具,SuperPoint 和 SuperGlue,它们就像是一组极其专注的小型侦探。这些侦探会在树木、岩石和灌木丛上找到有趣的特征点(关键点),并在多帧视频中追踪它们。与以往只关注高对比度亮点的旧方法不同,这些侦探可以在任何地方发现点,甚至是在阴影中。
- 数学魔法: 一旦侦探们连续追踪了一个点至少 5 帧,系统就会使用一个名为 XM solver 的高级数学引擎,来平滑该点在 3D 空间中的路径。
- “碰撞时间”(TTC)时钟: 对于机器人追踪的每一个点,它都会计算一个“碰撞时间”。这是一个简单的时钟:如果我按目前的移动速度继续前进,多少秒后会撞上这个点?
- 如果一个点正在远离或保持静止,时钟就不会运行。
- 如果一个点正在靠近,时钟就会开始倒计时。
- 机器人设定了一个安全规则:如果任何一个点的时钟降至 1 秒(这意味着按照机器人的正常速度 1 m/s,它距离目标约 1 米),就必须采取行动。
- 避障动作: 机器人找到 TTC 最低(即最危险)的点。然后,它在地面上画出一个 2D 箭头指向该点的反方向,并向相反方向移动。
他们发现了什么?
团队在 M3ED 数据集 的真实数据上测试了该系统,该数据集包含了一个波士顿动力(Boston Dynamics)Spot 机器人(一种四足机器人)在森林和城市中行走的场景。他们并没有用新数据来训练机器人;他们仅使用了其中一个特定序列("spot-forest-easy-1")中 74 秒 的片段来微调参数(超参数)。
结果呈现出“相当不错”与“仍需改进”并存的状态:
- 好消息: 在测试视频中的 22 个 独特的物理障碍物(如树木和岩石)中,该系统成功识别出了至少一个危险时刻。当它确实发现危险时,判断避障方向的准确率约为 84%。它也非常擅长“不惊慌”;在没有危险的帧中,它引发误报的频率仅为 0.47%。
- 坏消息: 该系统漏掉了很多实际的危险时刻。它仅在碰撞迫在眉睫的帧中正确识别了 38%(召回率为 0.38)。
为什么会漏掉一些?
作者解释说,系统的表现取决于它的“眼睛”和“记忆”。
- 记忆差距: 有时“侦探”(SuperPoint/SuperGlue)会在追踪一个点达到所需的 5 帧 之前就丢失了目标。如果点消失了,机器人就无法计算碰撞时间。
- 视觉误差: 有时“艺术家”(UniDepth)在猜测距离时出现了失误,导致点的 3D 路径发生剧烈跳变。虽然数学引擎(XM solver)试图修复这一点,但如果初始数据本身是错误的,最终的路径仍然会摇摆不定,从而导致错误的 TTC 计算。
底线结论
这篇论文证明了,你不需要通过成千上万小时的数据从头开始训练机器人,也不需要通过模拟一个虚假的世界来让它学会避开障碍物。你可以使用已经了解真实世界样貌的预训练模型。虽然这个特定的机器人目前还不完美——它会错过大约 62% 的即时危险——但它展示了一种高效且节省数据的途径,让机器人能够理解 3D 空间并对障碍做出反应,而无需经历大规模、昂贵的训练营。作者建议,未来的版本可以将“侦探”更换为更优秀的追踪器,以捕捉更多被漏掉的瞬间,但就目前而言,这是让机器人能够在荒野中航行而不至于迷失在“视频游戏”里的坚实一步。
技术摘要:基于碰撞时间(Time-to-Collision)的预训练视觉模型动态避障技术
问题陈述
在非结构化户外环境中,动态避障仍然是自主移动机器人的一个重大挑战。传统方法面临两个主要瓶颈:
- 数据稀缺性: 训练端到端学习模型(如 Robot Transformer)需要收集长达数月、针对特定机器人的大规模数据集,这造成了可扩展性的障碍。
- 仿真与现实的差距(Sim-to-Real Gap): 在仿真中训练的强化学习(RL)策略由于视觉真实感、接触动力学和环境多样性的差异,往往无法成功迁移到现实世界。此外,这些策略通常缺乏可解释性,使其行为在安全至上的场景中难以保证。
此外,虽然 LiDAR 和立体视觉等传感器模态可以提供深度信息,但它们在量程和密度方面与单目视觉相比存在局限性。立体深度在 5–10 米之外会变得不可靠,而 LiDAR 可能会因为稀疏性而遗漏微小或遥远的障碍物。作者提出了一种纯视觉方案,利用基于 RGB 的深度估计所具备的范围和密度优势来解决这些问题,且无需大规模数据采集或仿真训练。
方法论
所提出的系统是一个高效的数据驱动、具有可解释性的流水线,完全基于现实世界数据并利用预训练的视觉基础模型运行。它避免了从头开始训练神经网络,而是依赖于超参数调优。该流水线由以下阶段组成:
1. 深度估计与关键点追踪
- 单目深度: 系统利用基于 Transformer 的预训练模型 UniDepth,从 RGB 视频中生成稠密的度量深度图。选择 UniDepth 是因为它能够在不需要立体对或 LiDAR 的情况下,实现跨领域和跨摄像机配置的泛化。
- 特征对应: 为了追踪运动,系统采用了 SuperPoint(用于关键点检测)和 SuperGlue(用于特征匹配)。不同于倾向于高对比度区域的手工设计方法(如 ORB、SIFT),SuperPoint 在帧内提供均匀的空间分布,确保了在低纹理或黑暗区域也能覆盖障碍物。
- 3D 提升(3D Lifting): 追踪到的 2D 像素坐标通过 UniDepth 预测的度量深度和已知的相机内参(针孔相机模型)投影到 3D 相机坐标系中。
2. 轨迹优化与滤波
- 束调整(Bundle Adjustment): 为确保轨迹精度,系统使用 XM Solver 在过去五帧的滑动窗口内执行缩放束调整(SBA)。
- 噪声抑制: 流水线会过滤掉追踪时长少于五帧的关键点、距离超过 20 米的点(被认为对于即时规避过于遥远)以及帧间位移大于 2 米的点(表明存在深度估计误差)。
- 重初始化: 如果关键点的轨迹因深度不连续而受损,系统会对其进行重初始化,以防止历史误差影响后续计算。
3. 碰撞时间(TTC)计算
- 速度估计: 通过对位置序列进行线性回归,计算每个关键点的 3D 速度。
- TTC 计算: 对于每个关键点,碰撞时间(TTC)计算为度量深度 (d) 与沿光轴相对速度 (v) 的比值:
TTC(i)=max(−v(i),0)d(i)
远离摄像机运动或静止的点会被排除在外。最近点距离(CPA)大于 3 米的关键点会被丢弃,因为它们不构成碰撞风险。
- 运动原语生成: 系统识别出最小 TTC 的关键点。随后,它会在地面平面内生成一个 2D 运动原语,使机器人向该关键点 CPA 方向的反方向移动。
核心贡献
本文概述了三项主要贡献:
- 数据高效型控制: 证明了预训练视觉基础模型能够实现可解释且泛化能力强的机器人控制,而无需进行 sim-to-real 迁移或大规模特定机器人的数据采集。
- 新颖的流水线: 开发了一种基于 TTC 的避障方法,该方法集成了单目深度估计(UniDepth)、束调整(XM Solver)以及关键点对应关系(SuperPoint/SuperGlue)。
- 非结构化环境下的验证: 在 M3ED 数据集(森林和城市场景)上验证了该方法,展示了其检测接近中的障碍物并生成纠正动作的能力。
实验结果
系统在 M3ED 数据集上进行了评估,具体使用了来自波士顿动力 Spot 四足机器人在森林和户外城市环境中的序列。“spot-forest-easy-1”序列用于超参数调优,其他序列用于评估。设定 1 秒的 TTC 阈值(对应于 1 m/s 速度下约 1 米的缓冲距离)来定义碰撞风险。
- 检测性能:
- 精确率(Precision): 0.49(检测到的帧中有 49% 为真阳性)。
- 召回率(Recall): 0.38(在具有地面真值 TTC < 1s 的帧中,有 38% 被检测到)。
- 障碍物覆盖率: 尽管帧级召回率较低,但系统成功识别了测试序列中 22 个唯一物理障碍物中的 20 个 至少包含一个 TTC < 1s 的帧。这表明虽然系统可能会错过特定的帧,但它能可靠地触发针对几乎所有接近障碍物的规避响应。
- 动作准确性:
- 在 185 个真阳性检测中,系统在 84% 的案例 中生成了正确的规避运动方向(与地面真值的点积为正)。
- 数据效率: 该方法无需任何模型训练。仅使用了来自单个序列的 74 秒数据进行超参数调优。
局限性与未来工作
作者承认 0.38 的召回率是一个显著的局限性,主要归因于:
- 追踪失败: SuperPoint 和 SuperGlue 有时无法在连续帧之间维持长期的对应关系。
- 深度误差: UniDepth 的度量深度估计不准确,导致 3D 轨迹不连续,从而强制进行关键点重初始化。
- 优化约束: XM Solver 根据有缺陷的几何约束收敛到数学最优解,导致在挑战性场景中产生物理上不准确的轨迹。
未来的工作旨在通过集成更鲁棒的长期追踪器(例如 DROID-SLAM 特征或卡尔曼滤波器)来提高召回率,并通过在波士顿动力 Spot 平台上进行完整的端到端部署,来验证系统的延迟和实时可行性。
意义
本文认为其核心意义在于绕过了 sim-to-real 差距并消除了对大规模数据采集的需求。通过利用在现实世界数据分布上训练的预训练模型,该方法提供了本质上具有可解释性的“零样本”泛化能力。与黑盒强化学习策略不同,该方法显式地估计 3D 结构和运动,为其避障决策提供了透明的推理过程。实验结果表明,在极少数据(74 秒)的情况下,即可实现高层级的机器人控制,同时在多种不同的非结构化障碍物类型中保持鲁棒性。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。