想象一场规模宏大、 stakes 极高的电子竞技锦标赛,但参赛选手并非在游玩《马里奥赛车》或《FIFA》,而是在尝试教导一个数字机器人像人类运动员一样进行体育运动。这就是MyoChallenge 2025的故事。
以下是事件的拆解,辅以简单的类比。
核心难题:“肌肉”鸿沟
将当前的机器人想象成配备极其僵硬、简单引擎的汽车。它们能够移动,但缺乏“肌肉”。真正的人类拥有数千块微小的肌肉,它们以复杂的方式拉动骨骼、拉伸和收缩,使我们具备敏捷性。
科学家们一直试图构建拥有这些逼真肌肉的人类身体“数字孪生”(完美的计算机复制品)。但在此之前,这就像试图用玩具车教幼儿打职业网球。计算机模型过于简单,而物理引擎的速度也太慢,无法处理真实人类运动的复杂性。
解决方案:数字肌肉的“奥运会”
为了解决这一问题,一组研究人员创建了MyoChallenge 2025。你可以将其视为人工智能的奥运会,但运动员是计算机程序,比赛项目包括:
- 乒乓球:机械臂和躯干必须来回击打乒乓球。
- 足球点球:全身机器人必须助跑并将足球踢入球门(有时守门员会试图阻挡)。
目标不仅仅是让机器人动起来,而是要让它展现出类人的敏捷性和肌肉协调能力。
比赛规则
比赛使用了一个名为MyoSuite的特殊游戏引擎。该引擎就像一个超先进的物理模拟器。
- 身体构造:机器人并非简单的方块。它们是详细的模型,乒乓球选手拥有273 块肌肉,足球选手拥有290 块肌肉。
- 挑战:机器人必须通过试错来学习。它们不能仅仅被指令“这样移动你的腿”。它们必须弄清楚如何同时协调数百块肌肉以保持平衡、奔跑并击球。
两个比赛项目
1. 乒乓球对打(上半身)
- 设置:一个手持球拍的机械臂和躯干。
- 任务:球以不同的速度和角度飞来。机器人必须完美地将球击回。
- 难度:这不仅仅是击中球的问题;还在于保持球拍稳定、移动躯干以维持平衡,并做出即时反应。
- 获胜者(ActingAI):他们并没有让机器人盲目猜测。他们为机器人配备了一位“教练”(物理规划器),用于预测球的去向。随后,他们使用了一个巧妙的技巧来简化数学计算,将复杂的“肌肉”问题转化为更简单的“关节”问题,使其更容易学习。
2. 足球点球(全身)
- 设置:一个完整的机器人身体(腿部和躯干,无手臂)面对足球。
- 任务:助跑并将球踢入球门,即使有守门员在场。
- 难度:这极其困难。机器人必须单腿站立保持平衡,摆动另一条腿,并精准把握踢球时机,同时还要管理 290 块肌肉。
- 获胜者(Servette MyoClub):他们并非从零开始。他们利用了一个已经学会行走的机器人(就像人类婴儿学习走路一样),并对其进行额外训练以学会踢球。这就像让一名专业跑步者学习如何射门,而不是试图同时教会新生儿这两项技能。
比赛结果:谁赢了?
- 参与情况:来自全球的近70 支团队参赛,包括学生、医生和人工智能专家。
- 得分:
- 在乒乓球项目中,获胜团队在简单回合中100%成功将球击回,在困难回合中成功率为64%。
- 在足球项目中,获胜团队在困难回合中的进球率为32%。
- 差距:虽然机器人表现良好,但它们仍不如精英人类运动员。论文指出,机器人缺乏真实人类所拥有的“爆发力”和完美时机把握,这主要是因为与真实生活相比,计算机模拟仍然有些缓慢和笨拙。
核心启示
该论文声称,这次比赛证明了我们终于能够利用逼真的肌肉模拟复杂的体育运动。然而,它也突显了一个主要瓶颈:计算能力。
- 类比:训练这些机器人就像试图在一台缓慢、老旧的笔记本电脑上运行超复杂的模拟。获胜的足球队花了14 天时间训练他们的机器人。
- 未来:作者表示,下一步是将这些模拟迁移到**超高速图形处理器(GPU)**上。这就像从自行车升级到赛车,将使研究人员能够更快、更逼真地训练这些数字运动员。
一句话总结
MyoChallenge 2025 是一场全球竞赛,旨在检验人工智能能否利用逼真的人类肌肉学习体育运动。获胜者表明,通过结合聪明的数学技巧和利用预训练的“行走”技能,机器人可以学会打乒乓球和踢足球。但要让它们真正成为人类水平的运动员,我们需要更快的计算机来处理所需的庞大肌肉数学计算。
技术摘要:MyoChallenge 2025:人类运动智能的新基准
问题陈述
人类运动表现代表了感觉运动智能的巅峰,要求在动态变化的环境中进行快速决策、精确控制和协调执行。在人工智能和机器人领域复现这种能力仍然难以企及,因为当前的框架通常依赖于简化的执行器和动力学模型,无法捕捉基于肌肉系统的生物复杂性(非线性、延迟和耦合特性)。此外,由于难以在活体中测量复杂的肌肉协调,对生物掌握机制的理解受到阻碍。虽然先前的研究集中于孤立的动能表现或部分身体片段,但目前极度缺乏将高保真全身肌肉骨骼(MSk)模型、交互式物理模拟运动环境以及先进机器学习算法整合在一起的公共基准。
方法论
MyoChallenge 2025 通过在 MyoSuite 开源框架内建立基准来解决这一空白,该框架由 MuJoCo 物理引擎驱动。比赛设有两个不同的赛道,旨在测试运动控制智能在体育中的应用:
- 乒乓球赛道:智能体控制一个生物力学上肢(MyoArm:27 个自由度,63 块肌肉)和躯干(MyoTorso:18 个自由度,210 个执行器)来击回 incoming 球。骨盆在 x/y 方向上被驱动以模拟横向移动。该任务需要一个能够处理不同球路和速度的通用策略。
- 足球点球赛道:智能体控制一个全身模型(包括 MyoLeg:28 个自由度,80 块肌肉,以及 MyoTorso)来执行点球射门,对抗守门员。该任务需要协调 290 块肌肉,同时管理运动、姿态稳定性和精确的弹道打击。
模拟与评估:
- 模型:MSk 模型的复杂度几乎是先前版本的三倍,具有高保真的肌肉 - 肌腱单元。
- 阶段:比赛包括开幕阶段(静态环境)和季后赛阶段(引入显著的环境变化,如质量、摩擦力、球路和守门员行为),以测试鲁棒性。
- 指标:团队主要根据成功率(成功回球或进球)进行排名。在季后赛阶段,平局通过“肌肉激活努力”(均方激活)打破,以此奖励能量效率。
- 数据:不需要预先收集的训练数据集;策略应通过交互进行学习。然而,提供了一个自定义机器人来生成模仿学习数据,并鼓励使用公共数据集(AMASS, BONES-SEED)作为先验。
主要贡献与获胜方案
比赛吸引了 69 支团队和 562 份提交。获胜方案显示出从纯端到端学习向结合物理先验和分层结构的混合方法的转变。
乒乓球赛道
- 第 1 名(ActingAI 团队):提出了 Diff-Muscle,这是一个利用 微分平坦性 的分层框架。他们证明了系统的状态和控制可以通过关节配置(平坦输出)代数确定。这使得他们能够将动作空间从高维肌肉激活(R273)压缩到低维关节空间(R32)。该框架使用基于物理的规划器来预测球路并计算目标球拍状态,使用基于 PPO 的强化学习策略进行关节控制,并使用基于运动学的肌肉驱动控制器(K-MAC)将关节映射回肌肉。
- 第 2 名(BioSyn 团队):采用了受人类运动皮层启发的 结构化强化学习 方法。他们将控制分解为专注于特定身体区域(手、臂、躯干、骨盆)的“协同子网络”。探索由这些协同作用加权的多元高斯噪声引导,减少了拮抗共激活并提高了能量效率。
- 第 3 名(LNSGroup 团队):将 物理先验 与 CrossQ 算法和 高斯过程分类器(GPC) 相结合。物理模型预测球路以创建密集几何跟踪奖励。GPC 根据置信度动态将 incoming 球路由到专门的子策略(正手/反手),有效处理了季后赛阶段扩大的球路分布。
足球点球赛道
- 第 1 名(Servette MyoClub 团队):通过利用 预训练的运动先验(KINESIS)而非从头训练取得成功。他们采用了两阶段流程:
- 教师策略:将 KINESIS 运动模仿策略(在人类运动数据上训练)微调为目标到达策略,然后微调为踢球策略。
- 重定向:通过离线轨迹收集、学生预训练(行为克隆)和在线策略行为克隆(OBC/DAgger)来处理观测空间不匹配,将教师策略转移到 MyoChallenge 环境。最后,应用 PPO 微调以提高能量效率。
结果
- 参与度:来自 10 多个国家的 69 支团队,共 562 份提交。63% 的参赛团队完全由学生组成。
- 乒乓球表现:获胜团队(ActingAI)在阶段 1 实现了 100% 的成功率,在阶段 2 实现了 64%,努力得分为 0.1306。前三名团队在最终评分中的成功率差异仅为 5%。
- 足球表现:由于极高的复杂性(290 块肌肉),只有一支团队超越了基线。Servette MyoClub 在阶段 1 实现了 100% 的成功率,在阶段 2 实现了 32%,努力值为 1.3174。
- 计算瓶颈:训练时间凸显了严重的 CPU 瓶颈。获胜的足球策略需要约 14 天的训练,而乒乓球策略需要约 51 小时,这强调了 GPU 加速模拟流程的必要性。
意义与主张
该论文声称,MyoChallenge 2025 建立了 首个使用高保真 MSk 模拟的运动敏捷性基准,弥合了当前最先进模型与真正人类运动智能之间的差距。
- 跨学科影响:该活动团结了医生、神经科学家和机器学习专家的多元化社区,为生物力学、运动科学和神经科学的研究提供了一个可复现的试验台。
- 方法论转变:结果表明,对于高维动态任务,纯端到端学习往往是不够的。成功的策略越来越依赖于 基于物理的先验、分层规划、肌肉协同 以及从专家策略的 行为克隆。
- 未来方向:该论文指出,缺乏端到端的 GPU 加速是一个关键障碍。它认为该领域必须转向完全 GPU 加速的流程(例如 MuJoCo-Warp),以实现可扩展的全身肌肉骨骼控制,为生物力学模拟的数据驱动时代铺平道路。
- 局限性:作者谦逊地指出,与精英人类运动员相比仍存在性能差距。当前的奖励公式最大化向前速度,但并未明确捕捉优化的动能链序列或拉伸 - 缩短周期,导致模拟的踢球缺乏人类表现的峰值速度和灵活精度。
比赛套件仍保留在 MyoSuite 仓库中公开可用,以促进进一步的研究,并开发用于康复和辅助技术的现实、可泛化的数字孪生。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。