想象一个机器人不再只是在空荡荡的房间里独自从事任务的孤独工作者,而是与人类一起进行忙碌、混乱之舞的伙伴的世界。长期以来,科学家们一直在教机器人如何通过“视觉-语言-动作”(Vision-Language-Action)模型来抓取、抬起和移动物体。可以将这些模型想象成机器人的大脑,它能看到一个物体,读到像“拿起杯子”这样的指令,并弄清楚如何移动手臂去完成它。这些机器人在单人表演方面做得相当出色,就像魔术师独自在舞台上表演一个戏法。但在现实生活中,这不是一场单人表演,而是一场双人舞。在现实世界中,机器人需要与人“协作”,这意味着它们必须理解人类在想什么,等待合适的时机移动,并在人类挡路时立即停止。研究人员提出的重大问题是:一个擅长移动物体的机器人,是否也能成为优秀的协作伙伴,还是会在人类开始起舞时陷入僵局?
这正是名为 HRIBench 的一项新研究旨在调查的内容。来自中国人民大学和北京师范大学的研究团队意识到,虽然我们有很多测试机器人能否捡起积木的方法,但我们缺乏好的方法来测试机器人能否与人类协作。为了解决这个问题,他们为机器人建造了一个新的“健身房”,叫做 HRIBench。HRIBench 不仅仅是观察机器人尝试移动一个物体,而是将机器人置于一个剧本中,由人类扮演特定的角色。有时人类是老师(通过手势向机器人展示该做什么),有时是伙伴(共同协助拿着一个物体),有时则是闯入者(意外地挡在路中间,以观察机器人是否会惊慌或保持安全)。
该团队创建了 13 个不同的场景,包含 650 多个不同的“片段”,用以测试顶尖的机器人大脑,如 GR00T、π0.5 和 ACT。结果却是一个令人警醒的信号。尽管这些机器人在独自移动物体方面表现得极其强大,但当被要求进行协作时,它们却显得力不从心。当人类仅仅是老师时,机器人的成功率约为 53%。当它们必须作为伙伴协作时,成功率降至 50%。但当人类扮演“闯入者”并干扰任务时,机器人的成功率骤降至仅 10%。它们经常在不安全的情况下,或者在人类已经改变计划的情况下,仍然继续尝试执行任务。
然而,故事并未以失败告终。研究人员发现,通过专门针对他们新开发的 HRIBench 健身房中的数据对机器人进行训练,机器人在与人类协作方面变得好多了。在一次使用物理机械臂的真实世界测试中,经过 HRIBench 模拟训练后,任务的成功率从 10%(仅使用真实人类数据训练时)跃升至 43%。这表明,虽然今天的机器人仍然是笨拙的舞伴,但通过在模拟世界中进行这种特定类型的练习,可以帮助它们学会与我们同步律动,将单人表演转化为成功的协作。
技术摘要:HRIBench —— 衡量以交互为中心的人机协作基准
问题陈述
目前的视觉-语言-动作(VLA)基准测试主要评估孤立的操作技能(例如,取放、物体操作),其隐含假设是机器人独立运行。然而,现实世界中的人机协作(HRC)从根本上需要基于共享代理(shared agency)的协调能力。现有的评估未能建模底层的交互结构,导致关键能力无法得到测试:意图理解、时间同步、协议遵循以及动态环境下的安全交互。因此,一个策略可能在孤立状态下表现出强大的操纵能力,但在面对协作者的伸手动作时无法做出反应,或违反协调时序,亦或在受到破坏性人为干预后仍继续执行任务。这一差距凸显了操纵能力与协作智能之间的脱节。
方法论
为了解决这一问题,作者引入了 HRIBench,这是一个旨在通过可执行的交互场景来评估具备意图感知能力的人机协作的诊断性基准。
场景脚本(Scenario Scripts): 核心抽象是“场景脚本”,即一种结构化的、可执行的协作情节表示。这些脚本明确建模了:
- 智能体角色与语义目标。
- 时间依赖关系与因果约束。
- 人类运动分布。
- 奖励函数与成功条件。
这种抽象将协作的“需求”与策略如何“执行”分离,从而实现了连接高层需求与仿真环境的可解释语义层。
交互角色(Interaction Roles): 该基准围绕三种基本的人机交互模式组织行为:
- 指导者(Instructor): 机器人必须从人类的演示或手势中推断出预期的动作。
- 协作者(Collaborator): 机器人必须参与同步的多智能体协调(例如,物体交接、共同操作),这需要精确的时序和响应能力。
- 入侵者(Intruder): 机器人必须在受到破坏性人为干预(例如,阻挡路径、无效干扰)时,保持安全性并进行在线执行调整。
生成流水线(Generation Pipeline): HRIBench 使用了一个四阶段流水线:
- 脚本编写: 语言模型根据任务元数据生成场景脚本。
- 场景实例化: 环境通过多样化的物体和布局进行编译。
- 运动合成: 人类轨迹使用 HY-Motion-1.0 进行合成,并通过任务感知约束(如手部稳定性、接近方向)进行精细化处理,并在每个任务中变化出 50 多种轨迹变体。
- 仿真验证: 生成的情节经过过滤,以确保可达性、有效性和语义正确性。最终基准包含 13 个基于角色条件的任务,拥有超过 650 个可执行的评估情节。
评估指标: 除了二元任务成功率外,HRIBench 还引入了以交互为中心的指标:
- 有效性: 协作成功率(CSR)、完成时间、空闲率。
- 协调性: 时间同步性、响应延迟、顺序合规性。
- 安全性与鲁棒性: 无碰撞率、人体接触安全性、矛盾指令识别、破坏成功率。
核心贡献
- HRIBench 基准: 一个诊断性框架,将交互评估重新定义为可执行的协调建模,具有涵盖指导执行、协作协调和干预下鲁棒性的 13 个任务。
- 场景脚本: 一种结构化的、可执行的表示方法,明确建模了智能体角色、时间依赖性和人类行为分布,从而能够生成可重复的交互情节。
- 以交互为中心的评估协议: 一个多维度的指标套件(同步性、响应性、协议合规性、安全性),允许对现代机器人基础模型的协作失效模式进行解耦分析。
实验结果
作者在统一协议下评估了基于 GR00T N1.5、π0.5 和 ACT 的适配策略。
意义与主张
本文声称 HRIBench 提供了一个必要的诊断工具,用以揭示当前具身基座模型在协作环境中的局限性。作者认为,二元任务成功不足以评估协作智能;机器人可能会在完成物体级目标的同时,违反时间协调或安全协议。
通过将焦点从孤立的操纵转向“可执行的协调”,HRIBench 揭示了当前策略缺乏稳健的意图感知行为和时间协调能力。该基准证明,虽然操纵能力是前提条件,但对于协作而言并不充分。作者谦虚地主张,通过提供一个结构化框架来诊断特定的协调缺陷(如意图接地、时序、安全恢复),并生成能有效改善数据稀缺场景下物理适配的数据,其工作推动了以交互为中心的机器人学习。他们也承认了局限性,指出作为一个仿真基准,它无法完全捕捉现实世界的人类多样性,也无法作为物理部署的独立安全性评估。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。