WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform
本文介绍了 WorldArena 2.0,这是一个扩展后的基准测试,旨在通过三个新维度——视触多模态、用于策略优化的交互功能以及多样化的真实世界与模拟平台——对具身世界模型进行系统性评估,以解决现有仅依赖视觉和基于模拟器的评估方法的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何做家务,比如倒水或擦桌子。为了安全且有效地完成这些任务,机器人需要一个“世界模型”。将世界模型想象成机器人的内部造梦机器。它是机器人脑内的一种模拟环境,机器人可以在其中“想象”如果以某种方式移动手臂会发生什么,而无需真正冒着打碎花瓶或打翻饮料的风险。
长期以来,科学家们一直在测试这些造梦机器,但他们的测试方式有点像仅通过观察飞机的二维平面图纸来评判飞行员的技能。他们只检查机器人能否清晰地“看见”未来,却忽略了其他感官、机器人实际学习“飞行”的能力,以及它能否应对真实的风雨。
WorldArena 2.0 是一个全新的、更为严苛的“飞行模拟器”,用于测试这些机器人“大脑”。来自清华大学及众多顶尖机构的研究人员从三个方面升级了这项测试:
1. 增加“触觉”(模态)
旧方式: 此前,机器人的造梦机器只有“眼睛”。它能预测移动物体的视频画面会是什么样子,但无法“感受”任何东西。
新方式: WorldArena 2.0 赋予了机器人眼睛和双手。它测试机器人能否不仅预测视频画面,还能预测触觉反馈(压力、滑动或纹理的感觉)。
- 类比: 想象你试图仅通过观看别人杂耍的视频来学习杂耍。你可能知道球看起来会飞向哪里,但你不知道接球时需要用多大的力。WorldArena 2.0 迫使机器人去想象球击中手的感觉,这对于插入 USB 线缆(需要感觉到“咔哒”声)或拿起瓶子而不将其捏碎等任务至关重要。
2. 将造梦机器转变为“训练健身房”(功能性)
旧方式: 以前,研究人员会让机器人“梦”一个未来,然后检查这个梦境是否逼真。这是一条单行道:机器人做梦,人类给画面打分。
新方式: 现在,机器人的造梦机器充当虚拟训练健身房。机器人可以在梦境内部练习技能、犯错、从中学习并变得更好,而无需接触真实世界。
- 类比: 机器人不再只是观看足球运动员的电影,而是进入一款电子游戏,在那里它可以实际练习踢球。测试会检查:“如果我们让机器人在这个梦境中训练 10 小时,当它踏上真实球场时,是否会成为更好的球员?”
3. 在“现实世界”中进行测试(平台)
旧方式: 大多数测试完全在计算机模拟中进行。这就像仅在电子游戏中一条完美平滑、平坦的赛道上测试汽车。
新方式: WorldArena 2.0 在三种不同的环境中测试机器人:
- RoboTwin 2.0: 一个包含随机障碍物的复杂计算机模拟环境。
- LIBERO: 一个用于测试特定类型学习的结构化模拟环境。
- AgileX ALOHA: 位于真实房间中的真实物理机器人。
- 类比: 这就像是在电子游戏中测试汽车、在测试赛道上测试汽车,最后将其开上颠簸且下雨的城市街道之间的区别。研究人员发现,虽然许多机器人在电子游戏层面表现出色,但当它们必须在真实、混乱的街道上行驶时,往往表现不佳。这凸显了“完美做梦”与“完美做事”之间的巨大差距。
他们发现了什么?
研究人员利用这些新规则测试了 12 种不同的机器人“造梦机器”。
- 好消息: 一些模型学会了相当好地“感受”世界。例如,一个模型(Wan 2.2)在预测触觉方面非常出色,以至于它在模拟环境中 100% 成功地完成了一项精细任务(插入 HDMI 线缆)。
- 坏消息: 模拟与现实之间仍存在巨大差距。一个在计算机模拟中看起来像天才的机器人,当被要求在真实桌子上倒水时往往会失败。目前的“梦境”还不足以应对真实世界混乱的物理规律。
核心结论
WorldArena 2.0 是一份更诚实、更全面的机器人智能成绩单。它让我们不再仅仅欣赏漂亮的机器人视频,而是开始提出棘手的问题:机器人能感知吗?它能在自己的思维内部学习吗?当它置身于现实世界时,真的能完成任务吗?
该论文总结道,虽然我们正在取得进展,但在机器人能够可靠地从自己的“梦境”中学习并将其应用于现实任务之前,我们还有很长的路要走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。