需要观察世界的机器人和机器通常依赖两种截然不同的“眼睛”。一种类型以我们熟悉的方式观察世界:捕捉稳定、完整的图像,就像标准照相机拍摄照片一样。另一种被称为事件相机(event camera)的类型,则完全不拍照。相反,它像是一个超级敏感的观察者,只注意到变化发生的时候。如果光线保持不变,事件相机就什么也看不见;一旦阴影移动或灯光闪烁,它就会发出信号。这使得事件相机极其快速且高效,非常适合在混乱的环境中捕捉运动。然而,要在单台机器中使用这两类眼睛,工程师必须首先教会它们如何对空间中的位置达成共识。这个过程被称为标定(calibration),一直是一个棘手的难题。通常情况下,这需要移动相机或它们所观察的物体,或者使用复杂且昂贵的设备来完美同步这两个系统。如果没有这种对齐,机器人的两只眼睛就无法协同工作,导致其无法判断深度或安全导航。
来自德国海尔布隆应用技术大学的一个研究小组找到了一种无需移动分毫就能解开这个谜题的方法。他们开发了一种简单的方法,仅利用一个标准的电脑屏幕和一种巧妙的光影技巧,就能对这两种不同类型的相机进行对齐。研究人员没有通过摇晃相机或构建特殊硬件,而是在显示器上展示了一个特定的图案,并让它以一种受控的方式闪烁。这个图案是一个由黑白方块组成的网格,被称为 ChArUco 板,它是教导相机如何观察的标准工具。研究人员对屏幕进行了编程,使其在显示这种清晰锐利的图案与显示一个略微褪色的版本(仿佛混合了一层白漆)之间交替切换。这种快速切换创造了事件相机所需的亮度强度变化,同时屏幕始终保持足够明亮且清晰,使标准相机能够完美地看到网格。
这种方法的精妙之处在于其简洁性以及在一切都保持静止时仍能有效运作的能力。在过去,不涉及移动相机的方法通常需要屏幕在瞬间完全变黑,以触发事件相机。但这会干扰标准相机,使其在那些黑暗时刻失去对目标的视野。新方法通过从不关闭屏幕,而是通过“融合”图像来避免这种情况。这使得两类相机都能持续观察目标,从而消除了对通常用于同步这些系统的精密、昂贵计时设备的需求。研究人员通过将这两个相机放置在机械臂上并移动到数十个不同角度,以及用手拿着相机进行测试,验证了这一设置。他们发现,该方法在各种条件下都能可靠运行,包括不同的屏幕亮度水平,甚至在强光直接照射传感器时也能正常工作。
结果非常精准。与需要移动相机进行操作的最佳现有方法相比,新方法将相机在物体位置一致性上的误差降低了近一半。即使与不要求移动的其他静态方法相比,这项新技术仍然更加准确。团队验证了该系统能够以高度的一致性确定两个相机之间的精确距离以及它们相对于彼此的角度。为了证明这种标定在现实任务中的实用性,他们将其应用于机器人手眼系统。他们成功引导机器人理解其抓取器相对于目标的相对位置,即使在部分视野被遮挡的情况下也是如此。测量结果保持稳定且精确,表明机器人可以信任其获得的对齐数据。
这项工作表明,结合事件相机与标准相机的复杂且昂贵的障碍是可以被消除的。通过使用常见屏幕上的简单融合图案,工程师现在可以快速校准这些先进的传感器系统,且无需专门的硬件。该方法对光照变化和视角变化具有鲁棒性,使其适用于工厂或需要在非受控环境中运行的机器人。研究人员证明,高精度、高速的视觉系统并不需要复杂的设置或不断的运动;它们可以通过一只稳健的手和一块闪烁的屏幕进行对齐,这为开发出能像我们一样清晰观察世界、同时具备闪电般反应速度的更强大、更经济的机器打开了大门。
技术摘要:异构事件-RGB 立体视觉系统的简化跨模态标定
问题陈述
在集成异构立体视觉系统时,事件相机与帧相机之间准确的外参标定仍然是一个显著的瓶颈。现有方法在实际部署中面临着阻碍其应用的问题:
- 基于运动的方法(例如 E2Calib)需要通过物理运动来触发事件。这些方法通常需要计算量巨大的神经图像重建(例如 E2VID),将异步事件流转换为稠密帧,或者依赖复杂的算法来减轻运动模糊。它们还经常要求精确的时间同步。
- 静态(非运动)方法通过调节光强(例如闪烁的 LED 或显示器)来产生事件。然而,这些方法通常依赖于专门的硬件和严格的时间同步。现有静态方法(例如二进制闪烁监视器)的一个关键失效模式是产生了“空白”帧,导致帧相机无法观测到标定目标,从而造成特征跟踪丢失。
方法论
作者提出了一种无运动、跨模态标定框架,该框架利用在标准消费级硬件(显示器、平板电脑、智能手机)上显示的经时间调制且混合处理的 ChArUco 标靶。其核心创新在于覆盖层生成和数据处理流程:
1. 通过混合进行时间调制
该方法并非采用二进制的开/关切换,而是在静态 ChArU Arco 图案 (Ip) 与通过线性插值生成的半混合版本 (Iα) 之间进行交替,其中 Iα 是由均匀白色图像生成的:
Iα(x)=(1−α)Ip(x)+αIw(x)
其中 α 是一个固定的不透明度参数。显示刺激 I(x,t) 以 f=15 Hz(每秒 30 次转换)的频率在两种状态之间切换。
- 事件相机: 离散的切换产生了足够的对数强度变化 (ΔlnI),从而可靠地触发事件。
- 帧相机: 混合状态确保了 ChArUco 几何结构保持持续可见,避免了“空白帧”问题,并消除了对严格硬件级同步的需求。
2. 数据处理与标定
- 粗略同步: 系统使用轻量级的软件对齐方式,以帧相机作为主设备,为事件流提供触发信号。无需强制执行精确的硬件同步。
- 事件帧构建: 异步事件被累积成与 RGB 图像捕获对齐的离散 2 维帧。
- 去噪: 对事件帧应用中值滤波器,以抑制噪声并使稀疏区域稠密化,同时保留几何结构。
- 标定: 在两种模态上分别执行标准的 ChArUco 检测(OpenCV),以求解内参,随后进行立体外参标定。
主要贡献
- 新颖的方法论: 一种基于时间图像混合的跨模态标定方法,它无需专门的硬件、复杂的神经图像重建或严格的同步。
- 实验验证: 通过综合测试证明了该方法在不同显示亮度、外部照明、视角和采集模式(机器人驱动 vs 手持式)下的鲁棒性。
- 实际应用价值: 在机器人眼到手(eye-to-hand)标定案例研究中展示了该框架的应用,证明了即使在部分遮挡的情况下也能实现稳定的几何测量。
实验结果
作者使用 Prophesee EVK4 事件相机和 IDS 帧相机进行了广泛实验,将该方法与基于运动的基准方法(E2Calib 变体)以及静态基准方法(Plasberg 等人)进行了对比。
- 精度: 与最强的运动基准(E2Calib + Kalibr, 0.687 px)相比,所提方法将平均立体重投影误差降低了 44%;与非运动基准(Plasberg 等人, 0.406 px)相比,降低了 6%。虽然 E2Calib + ChArUco 变体的误差较高(1.161 px),但 44% 的降幅是专门针对基于 Kalibr 的运动基准而言的。
- 最优参数: 研究发现不透明度参数 α=0.6 能提供最佳平衡,既能确保 100% 的事件检测,又能维持高水平的帧检测率。
- 鲁棒性:
- 亮度: 在显示亮度为 20% 及以上时即可成功实现标定。
- 视角: 该方法在偏离表面法线达 50° 时仍保持稳定。
- 照明: 系统在强烈的、空间分布不均的人造光照下仍能保持几何完整性,尽管检测率会有轻微波动。
- 重复性: 在 20 次独立运行中,系统在内参和外参估计方面表现出高度的统计稳定性。
- 下游应用: 在手眼标定任务中,系统实现了 0.71 mm 的平均绝对误差(约 1.05% 的相对误差)在目标到 TCP 的距离测量中,证实了变换流水线的稳定性。
意义与主张
论文声称,这种方法通过以下方式显著简化了实际部署中的标定程序:
- 消除了对动态特征触发和复杂时空对齐的依赖。
- 通过利用标准消费级显示器,消除了对专门硬件(如闪烁 LED 阵列)的需求。
- 将同步约束降低到基于触发器的粗略对齐,使设置更加容易实现。
作者将这项工作定位为动态应用场景(如机器人手眼标定)中的实用解决方案,在这些场景中,即使在目标被部分遮挡时,也需要稳健且连续的几何参考。他们也承认了关于显示刷新率(需要 >30 Hz 以获得最佳性能)以及由于离散化异步事件流而引入的固有噪声的局限性,并指出未来的工作可以探索改进的累积技术。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。