← 最新论文
💻 computer science

MotionDLO: Hybrid Event- and Frame-Based Tracking of Deformable Linear Objects

MotionDLO 是一个实时、基于事件与帧混合的跟踪框架,它利用事件相机的极高时间分辨率以及基于帧分割的空间精度,并结合相干点漂移算法(Coherent Point Drift),实现了对用于机器人操作的变形线状物体(deformable linear objects)稳健、时间一致且高精度的跟踪。

原作者: Annalena Hartmann, Priyamvada Ajithkumar, Patrick Bründl, Jörg Franke

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Annalena Hartmann, Priyamvada Ajithkumar, Patrick Bründl, Jörg Franke

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在机器人领域,机器所能看到的与它需要执行的任务之间存在着一种持久的差距。机器人擅长移动沉重、刚性的物体,如金属箱或汽车零件,但它们在处理柔软、灵活或不可预测的物体时却显得力不从心。想象一下汽车工厂中的线束、服务器机房中的电缆,或是医院里的缝合线。这些物体被称为可变形线性物体(deformable linear objects)。它们会发生扭转、弯曲和缠绕,其变化方式是无法通过预先进行完美预测的。为了操控这些物体,机器人必须实时观察它们的运动,每秒钟更新数百次对其形状的理解。传统的摄像机以类似标准电影摄影机的固定频率拍摄图像,对于这项任务来说往往太慢了。当标准摄像机捕捉到快速移动的导线清晰图像时,导线已经移动了,留给机器人的是一张模糊且过时的图片。这种滞后会导致机器人错过目标,或者更糟,完全丢失对物体的追踪。

为了解决这个问题,研究人员开始使用一种不同的传感器,称为事件相机(event camera)。与以固定间隔拍摄完整图像的标准摄像机不同,事件相机的工作原理类似于神经系统。它只报告变化。如果传感器的像素看到光线变化,它会立即发送信号。如果场景保持静止,传感器则保持沉默。这使得相机能够以微秒级的速度对运动做出反应,捕捉移动导线的速度而没有任何模糊。然而,尽管这些相机速度极快,但在精确告知物体具体位置或细节外观方面却表现较差。它们能看到运动,但在定义形状方面却很吃力。工程师面临的挑战在于,如何将事件相机的闪电般反应速度与标准相机的精确、详细视觉相结合,从而创造出一个既快速又足够精准的系统,使机器人能够处理精细的任务。

一个研究小组开发了一种名为 MotionDLO 的新系统来弥补这一差距。他们的工作重点是追踪这些灵活的线缆和电缆在运动时的状态,确保机器人时刻清楚物体的每一个部分都在哪里。该系统通过同时使用两只“眼睛”来工作。一只眼睛是标准的高分辨率相机,通过拍摄照片来获取导线形状的清晰、详细视图。另一只眼睛是事件相机,负责监测任何运动。研究人员设计了软件,根据导线的动作在两种视图之间进行切换。当导线静止时,系统依赖标准相机来构建一个完美的、详细的形状图谱。一旦导线开始移动,系统会立即切换到事件相机。由于事件相机的反应速度极快,它可以实时追踪导线的运动,每 12 毫秒就更新一次机器人对导线位置的理解。

该系统的精妙之处在于它如何让这两股不同的信息流协同工作而不产生混乱。研究人员发现,如果仅依赖快速的事件相机,机器人可能会丢失追踪目标的导线,尤其是在场景中有多条导线时。如果仅依赖标准相机,机器人则会因为跟不上快速运动而反应迟钝。MotionDLO 通过使用标准相机建立一个稳固、准确的起点并确认物体的身份来解决这个问题。然后,随着物体的移动,事件相机接管工作,提供连续的更新流,使机器人的知识保持新鲜。该系统足够智能,能够识别物体何时停止运动,并切换回详细相机以修正运动过程中可能产生的任何微小误差。这创造了一个无缝的循环,无论物体移动得有多快,机器人都不会丢失对目标的视线。

团队在现实的工业环境中测试了他们的系统,使用机械臂抓取并移动不同类型的电缆和管子。他们使用了三种特定类型的物体:用于气压的塑料管、屏蔽通信电缆和一根细电源线。机器人以各种速度移动这些物体,包括那些会导致标准相机只能看到模糊影像的极快运动。结果显示,MotionDLO 能够以惊人的精度追踪这些物体。即使当机器人移动电缆的速度高达每秒 2,255 毫米时,系统仍能保持小于 0.5 毫米的平均误差。这种水平的准确性至关重要,因为这意味着机器人可以在不损坏或不掉落导线的情况下进行操作。相比之下,其他依赖标准相机或简单事件追踪的方法在这些条件下均告失败。它们要么完全丢失了对物体的追踪,要么犯下的错误大到导致机器人无法完成任务。

其中一个最重要的发现是,即使在单根移动导线与其它静止导线缠绕在一起的情况下,系统仍能保持追踪。在拥有多条电缆的拥挤场景中,其他追踪方法经常会产生混淆,搞不清哪条是哪条,或者完全丢失正在移动的那条。然而,MotionDLO 利用了事件相机仅观察运动部分的独特能力。由于静止的导线不会触发事件相机,系统可以将移动的导线从背景杂乱中分离出来,并稳定地跟随。这种在时间上维持一致身份的能力是一个重大进步,因为它允许机器人在执行复杂任务时,无需分心或丢失进度。

研究人员还展示了该系统无需针对特定类型的导线进行训练即可工作。许多现代机器人视觉系统需要数千小时的训练数据来学习如何识别特定物体。如果机器人遇到从未见过的电缆类型,通常会失败。MotionDLO 通过使用“零样本”(zero-shot)方法避免了这个问题。它使用一个通用模型,该模型可以基于简单的描述来理解导线的样子,而不是通过记忆特定的实例。这意味着该系统可以部署在配备新类型电缆的工厂中并立即开始工作,无需漫长的训练期。这种灵活性使其在材料和工具频繁变化的现实工业应用中更加实用。

在实验中,团队测量了系统处理每次更新所需的时间。他们发现,从观察到运动到更新机器人计划的整个过程仅耗时 12 毫秒。这个速度足以让机器人实时做出反应,在导线移动时调整其抓取或路径。该系统在测试的所有三种电缆(从粗塑料管到极细的电源线)中都能保持这种性能。即使在导线快速移动时,准确度依然很高,证明了这种混合方法成功结合了基于事件感知的速度与标准成像的精度。

这项工作的意义不仅限于移动导线。实时追踪柔性物体的能力为机器人处理更广泛的任务打开了大门。未来,这项技术可用于自动化汽车复杂线束的组装、在狭窄的服务器机架中布线,甚至辅助进行如缝合等精细的医疗手术。研究人员指出,虽然目前的系统是在二维空间内工作的,但下一步将是增加深度感知,使机器人能够理解物体的完整三维形状。他们还计划在不断变化的光照环境(如焊接或激光切割车间)中测试该系统,以确保其在所有工业设置中都保持鲁棒性。

MotionDLO 的成功表明,机器人感知的未来不在于在速度与精度之间做选择,而在于结合不同技术的优势。通过倾听事件相机的快速信号,同时保持标准相机的稳定注视,该系统实现了两者单独工作都无法达到的性能水平。这种方法为长期困扰柔性材料自动化的任务提供了一个切实可行的解决方案。随着机器人越来越普遍地出现在工厂和家庭中,处理不可预测和精细事物的能力将与搬运重物的能力同样重要。MotionDLO 为那个未来指明了清晰的路径,表明通过正确的传感器与软件组合,机器人终于可以学会处理真实的世界:一个混乱、运动且充满灵活事物的世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →