← 最新论文
🤖 AI

Assistax: A Multi-Agent Hardware-Accelerated Reinforcement Learning Benchmark for Assistive Robotics

Assistax 是一个用于辅助机器人的开源多智能体强化学习基准测试,它利用 JAX 硬件加速技术实现了比基于 CPU 的替代方案快达 370 倍的训练速度,同时评估机器人智能体与多样化人类伙伴之间的零样本协作能力。

原作者: Leonard Hinckeldey, Elliot Fosong, Rimvydas Rubavicius, Elle Miller, Trevor McInroe, Fan Zhang, Patricia Wollstadt, Stefano V. Albrecht, Subramanian Ramamoorthy

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Leonard Hinckeldey, Elliot Fosong, Rimvydas Rubavicius, Elle Miller, Trevor McInroe, Fan Zhang, Patricia Wollstadt, Stefano V. Albrecht, Subramanian Ramamoorthy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何协助人类完成日常任务,比如刷牙或起床。在过去,训练这些机器人就像是在用一台缓慢、陈旧的计算机教狗玩接球游戏:既费时又漫长,而且“模拟”(练习过程)往往过于简单,无法产生实际用途。

这篇论文介绍了一个名为 Assistax 的新工具,它是一个超快速的训练场。你可以把它想象成一个专门为学习如何与人类协作的机器人设计的高速视频游戏模拟器

以下是该论文实际内容的拆解,使用了简单的类比:

1. “涡轮增压”式的训练健身房

大多数机器人的训练发生在标准的中央处理器(CPU)上,这就像是一个人在跑马拉松。而 Assistax 运行在 GPU(通常用于视频游戏的强大芯片)上,并使用了一个名为 JAX 的特殊工具。

  • 类比: 如果说标准的训练过程是一个人跑一英里,那么 Assistax 就像是 412 个人同时在跑同一英里
  • 结果: 曾经需要数小时或数天才能完成的模拟任务,现在只需几分钟即可完成。这使得研究人员可以快速进行数千次实验,以观察哪种方案效果最好。

2. “舞伴”问题(多智能体学习)

在许多机器人模拟中,人类只是一个按照脚本移动的雕塑或木偶。但在现实生活中,人类是积极的合作伙伴,他们可能会做出意想不到的动作,或者有不同的行为方式。

  • 类比: 想象你在教机器人跳舞。在旧的模拟器中,人类舞伴是一个从不移动的模特。而在 Assistax 中,人类是一个鲜活的、有呼吸的舞伴,他也在学习并做出反应。
  • 设置: 该系统同时训练两个智能体:机器人类人实体(数字人)。它们必须学会相互配合,就像一对舞伴一样,共同完成诸如抓挠痒痒、刷牙或喂食等任务。

3. “陌生访客”测试(即时协作/Ad-Hoc Teamwork)

论文指出,机器人不应该仅仅擅长与某一个特定的、练习了数月的伙伴跳舞。它需要能够与遇到的任何初次见面的人一起跳舞。这被称为即时协作(Ad-Hoc Teamwork)

  • 类比: 想象你和特定的舞伴练习了一年的舞蹈。然后,你被扔到了舞台上,要和一个从未见过的陌生人一起跳舞。你还能在不摔个狗吃屎的情况下完成舞蹈吗?
  • 实验: 研究人员使用一组特定的“人类”伙伴对机器人进行了训练。随后,他们让机器人面对全新的、未见过的“人类”伙伴,这些伙伴拥有不同的习惯和偏好(例如,有人喜欢动作快,有人喜欢动作慢)。
  • 发现: 论文发现了一个“协作差距”。当机器人遇到一个风格完全不同的“陌生人”时,它会表现得手忙脚乱。它能和练习对象配合得很好,但面对“陌生访客”时却显得笨拙。这凸显了一个现实的挑战:机器人需要提高瞬间适应陌生人的能力。

4. “个性化”的规则

真实的人类都有自己的偏好。有些人喜欢刷牙时力度大一点,有些人则喜欢轻柔一点;有些人喜欢动作快,有些人则喜欢慢节奏。

  • 类比: 把机器人想象成一名新员工。“任务”是工作内容(如刷牙),而“偏好”则是老板的具体指令(例如,“不要太重”、“动作要慢”)。
  • 系统: Assistax 让研究人员可以编写成千上万个不同的“老板”(人类伙伴),并赋予他们不同的规则。机器人必须学会通过观察,在没有明确指令的情况下,弄清楚老板想要什么。

5. 五个“游戏”

论文提供了五个具体的场景(任务)来测试这些功能,这些场景都使用简单的形状(如方块和胶囊体)构建,以保持模拟的高速运行,而不是使用极其逼真但渲染缓慢的皮肤和织物。

  1. 抓挠: 机器人必须在人类的手臂上找到一个位置并轻轻抓挠。
  2. 刷牙: 机器人必须引导牙刷进入人类的口腔并正确刷牙。
  3. 喂食: 机器人必须引导勺子进入嘴里而不洒出食物。
  4. 擦浴: 机器人必须用海绵擦拭人类的手臂,覆盖特定区域。
  5. 手臂辅助: 机器人必须将人类无力的手臂抬起到特定位置。

总结

Assistax 是一个全新的、极速的游乐场,在这里,机器人和数字人类学习如何协同工作。它证明了虽然我们可以训练机器人与特定伙伴配合得很好,但当它们必须与从未谋面的陌生人合作时,仍然会感到困难。这篇论文提供了这些工具(快速的模拟器和“陌生人”伙伴),供其他科学家尝试解决这种“陌生人危险”问题,从而提升机器人辅助能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →