← 最新论文
💻 computer science

GUIDER: Evaluating Goal-Free Human Intent Inference for Teleoperated Manipulation on Real-Robot Data

本文评估了 GUIDER,一种用于遥操作机器人操控中人类意图推理的无目标概率框架,该框架通过使用真实机器人数据,在多种辅助场景下成功展示了高预测精度、稳定性和实时性能。

原作者: Nicholas Kenny, Cesar Alan Contreras, Basile Ouedraogo, Rustam Stolkin, Manolis Chiou, Maria Kyrarini

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicholas Kenny, Cesar Alan Contreras, Basile Ouedraogo, Rustam Stolkin, Manolis Chiou, Maria Kyrarini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一名人类操作员坐在远离危险或困难环境的安全室内,试图控制一个机械臂来执行一项精细的任务。操作员无法直接看到机器人,只能通过屏幕上的视频流进行观察。为了移动机器人,他们必须不断将自己的高层意图(例如“拿起那个药瓶”)转化为底层的摇杆指令,同时还要努力追踪机器人的位置及其正在进行的操作。这种精神上的多重任务处理非常耗费精力,并且会减慢工作速度,尤其是在核清理或医疗辅助等高风险情况下。科学家们长期以来一直在寻求一种分享负担的方法:一个能够猜出人类下一步意图并提供帮助的系统,但前提是该系统必须足够确定以确保安全。核心挑战在于如何教会机器人在没有预先告知目标的情况下,仅通过人类手的运动和来自摄像头的视角,来读懂人类的思想,从而判断人类正伸手去拿哪个物体。

研究团队通过在一个真实的物理机器人上测试一个名为 GUIDER 的系统,在实现这种共享控制方面迈出了重要的一步。虽然该系统此前已在计算机模拟中进行了测试,但本研究标志着其首次在实际硬件上进行评估,使用的是人类操作员控制机械臂执行日常任务(如泡茶、取药和处理各种家用物品)的记录数据。研究人员想要了解,当面对现实世界中混乱且不可预测的特性时——例如摄像头的噪声以及物体外观与完美的数字模型不同时——该系统的意图推断能力是否依然有效。他们将该系统部署在一个配备了能观察三维世界的立体深度摄像头的 Franka Emika Panda 机械臂上,并要求人类操作员在没有任何自动化辅助的情况下完成一系列操作任务。机器人只是简单地观察并记录了每一次动作和每一帧视频。

一旦数据收集完毕,研究人员就通过 GUIDER 系统对其进行回放,同时保留原始动作的精确时序。该系统的任务是观察视频并结合机器人的运动历史,来预测人类试图抓取的物体。为了使这一过程在现实世界中奏效,团队增加了几项实际性的改进。他们教导系统忽略桌面本身,只关注真正放置在桌面上的物体。他们还引入了一个“抓取模式”,该模式将系统的关注点从单纯识别物体转向寻找物体上机器人手部可以实际抓握的具体位置。系统不再仅仅是猜测茶包的中心,而是学会了寻找夹具可以抓取的边缘。这种区别至关重要,因为知道一个物体是什么并不总是能告诉机器人如何与其交互。

结果显示,该系统在“读心”方面表现得异常出色。在三种不同场景下的二十个步骤中,系统在每一个案例中都正确识别了目标物体。更重要的是,它识别出的时间足以发挥作用。平均而言,系统在动作开始后的 3.7 秒内就能对人类的目标做出自信的预测。在许多情况下,甚至在人类尝试抓取物体前的近五十秒,系统就已经做出了判断。这种时间差至关重要;这意味着如果一个共享自主系统处于激活状态,它可以在人类伸手抓取之前,就提供协助或稳定机器人的运动。系统在预测方面保持了高度稳定性,在第一次做出自信猜测后,其预测正确率保持在 96.4%。即使在最困难的场景中(即机器人需要拿起体积小且视觉特征相似的茶包时),系统也始终将正确的目标保留在候选列表中,尽管这导致其最终确定答案的时间稍长。

这项研究还揭示了系统的优势所在及面临的挑战。当物体较大且特征明显(如水壶或药瓶)时,系统反应迅速且充满信心。然而,当物体较小、杂乱或彼此看起来非常相似时,系统处理视觉信息的时间就会变长。最耗时的部分并非用于猜测意图的数学运算,而是识别物体及其形状所需的计算机视觉工作。系统花费了大量时间分析摄像机画面,以将物体从背景中分离出来,而当物体靠得很近或颜色相近时,这项任务本质上是非常困难的。尽管存在这些挑战,系统从未丢失过正确的目标,这证明了其底层逻辑能够在从干净的模拟环境向嘈杂的现实环境过渡的过程中得以生存。

这项工作证明,构建一个无需被明确告知目标即可实时理解人类意图的机器人是可能的。通过将机器人所见的景象与人类移动机械臂的方式相结合,该系统可以高精度地预测下一步行动。研究人员发现,只要摄像头经过仔细校准且机器人以安全的速度移动,该系统就能在物理硬件上可靠运行。虽然本研究并未测试一个主动协助人类的系统,但数据表明,构建这样一个系统是可行的。观察到的时间余量——在某些情况下接近五十秒——表明机器人可以在不夺取人类控制权的前提下,介入以使任务变得更容易或更安全。未来的路径在于将这种预测能力与实际的辅助行为相连接,确保当机器人猜中人类意图时,它能根据这一猜测采取行动,从而使坐在椅子上的操作员的工作更加顺畅、不再那么疲劳。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →