人类运动是一个长期困扰着试图构建人体数字孪生的科学家的谜题。为了理解我们如何奔跑、跳跃或行走,研究人员创建了模拟真实人类骨骼、关节和肌肉的计算机模型。其目标是预测性模拟:构建一个能够自主理解如何运动的虚拟身体,而不仅仅是复制一段人类运动员的视频。挑战在于人类机器极其复杂的程度。我们的腿部由数十块肌肉驱动,远多于它们所移动的机械关节。这产生了一个“选择过多”的问题。如果计算机试图通过随机猜测每一毫秒内每块肌肉拉动的力度来学习跑步,它就会迷失在无数种可能性之中。这些随机的猜测往往会相互抵消,导致虚拟身体陷入停滞或踉跄,无法找到向前移动所需的协调模式。多年来,这种低效意味着教计算机跑步需要大量的时间、复杂的捷径或预设的规则,而这些规则限制了机器自主发现的能力。
首尔大学的一个研究小组通过改变计算机提出的问题,找到了突破这种复杂性的方法。该系统不再命令肌肉以特定的力量拉动,而是为每块肌肉设定一个目标长度,这一概念植根于人类神经系统的运作方式。他们称之为“λ-保持”(lambda-hold)控制器。在这种方法中,计算机决定一个肌肉的具体长度阈值,并在短时间内保持该目标长度稳定。一种内置的安全机制——类似于医生敲击膝盖时产生的膝跳反射——会根据肌肉与该目标长度的偏差自动调整肌肉的出力。如果肌肉拉伸过长,它就会向后拉;如果缩得太短,它就会放松。这个简单的规则意味着计算机不需要微观管理每一次抽搐。它设定一个目标,然后由身体自身的物理特性处理余下的部分,从而在肌肉之间创造出一种几乎不可能通过人工编程实现的自然协调。
这种方法的成果令人瞩目。当研究人员仅使用“尽可能快地向前移动”这一基本指令来训练他们的虚拟模型进行冲刺时,系统在大约一小时内就学会了跑步。对于如此精细的肌肉驱动模型来说,这种学习速度在以前是无法达到的。虚拟跑者展现出了平滑且具有人类特征的步态,双腿以协调的节奏摆动,双脚以真实的力度着地,而这一切都是在没有展示任何人类跑步视频或给出复杂规则列表的情况下完成的。该系统通过比以往方法更高效地探索可能的运动空间实现了这一点。由于控制器在更新之间保持决策稳定,虚拟身体可以测试整个运动序列,而不仅仅是孤立的瞬间,这使其能够更快地发现正确的跑步方式。
研究还表明,这种控制方法不仅是一个聪明的工程技巧,也是对生物系统运作方式的一种反映。通过依赖“平衡点假设”(即大脑通过设定肌肉的目标长度而非计算力量来控制运动),研究人员弥合了高层决策与底层肌肉动作之间的鸿沟。虚拟跑者通过在步幅的特定时刻(如足部着地或离地时)调整这些目标长度来学习平衡和冲刺。这种间歇性更新镜像了人类运动控制的运作方式,即大脑发送稀疏的指令,并让身体自然的反射机制填补空白。由此产生的模拟产生了看起来和动起来都像人类的跑者,速度达到了大约每秒4.7米,尽管尚未达到顶尖人类短跑运动员的速度。研究人员指出,这一限制是由于模拟肌肉的物理特性以及缺乏辅助身体平衡的手臂,而非控制方法本身的缺陷。
这项工作的意义在于,它解决了拥有过多运动部件的系统如何高效学习运动的问题。以前的尝试通常依赖于模仿人类数据或使用僵化的数学规则,这阻碍了系统发现新方案。相比之下,这种新的控制器允许虚拟身体从零开始发现自己的跑步方式。模拟中的肌肉活动与真实的人类测量值相当吻合,特别是在推动身体前进的肌肉方面,这表明控制器的底层逻辑是合理的。虽然模拟并非人类的完美复制品,但它证明了简单的、受生物启发的规则可以释放复杂模型的潜力。这为创建可适应不同任务的数字模型打开了大门,例如帮助医生规划手术,或设计动作如生物般流畅的机器人。核心见解在于,通过信任身体自身的力学结构来处理细节,大脑——或者在这种情况下是计算机程序——可以专注于宏观图景,从而实现既高效又极具人类特征的运动。
技术摘要:用于预测模拟中实现类人运动的 λ-Hold 控制器
1. 问题陈述
本文探讨了通过强化学习(RL)训练肌肉骨骼模型以生成类人运动这一根本性挑战。人类肌肉骨骼系统是高度过度驱动的,下肢的肌肉数量远多于机械自由度。这种冗余为强化学习带来了两个主要障碍:
- 维度灾难: 动作空间需要每秒数百次地指定约 90 块肌肉的激发向量。
- 低效探索: 标准的 RL 智能体通过独立扰动肌肉激发(例如通过高斯噪声)进行探索。由于从肌肉激活到关节运动的映射是多对一的,这些不相关的扰动在关节空间中往往会相互抵消。因此,智能体在进行高维激发空间的探索时,无法有效地探索低维的关节空间,导致学习极其缓慢或失败。
现有的缓解方法包括固定的反射规则、塑造的探索噪声、自组织信号(如 DEP-RL)或固定的肌肉协同(synergies)。然而,这些方法要么通过固定结构或外部噪声外部性地施加协调,要么依赖于参考运动模仿,而非从极简奖励中学习。
2. 方法论:λ-hold 控制器
作者提出了 λ-hold 控制器,这是一种新型控制架构,它将 平衡点(Equilibrium-Point, EP)假设 与 间歇控制(intermittent control) 相结合,以解决探索效率低下的问题。
2.1 控制变量:阈值长度 (λ)
策略不再直接指挥肌肉激发量 (ei),而是指挥每个肌肉的 阈值长度 (λi)。该变量代表了肌肉开始被招募的平衡点,这一概念基于 Feldman 的 EP 假设。
2.2 拉伸反射招募律
一个固定的、具有生理学依据的定律将指令 λi 转换为肌肉激发量 ei,该定律基于肌肉当前的长度 (ℓi) 和速度 (vi):
ei=[Gtonic(ℓi−λi)+Gphasic[vi]+]01
- Gtonic (50): 实现静态拉伸反射(长度反馈)。
- Gphasic (0.1): 实现动态拉伸反射(速度反馈),并进行整流,使其仅在拉伸期间增加驱动。
- 涌现的协调性: 虽然该定律本身不包含显式的耦合项,但机械骨架将肌肉耦合在一起。由于骨骼动力学原因而同时拉长的肌肉会被同时招募。因此,λ 空间中的独立扰动自然地产生了协调的、类似协同(synergy-like)的激发,而无需预定义的协同矩阵。
2.3 间歇控制与“保持”(Holding)
策略不会在每个模拟步长都更新 λ。相反:
- 决策点: 新的 λ 值仅在特定的 地面反作用力(GRF)事件(足跟着地和脚尖离地)以及每个步态阶段的一个中间“子点”处发布。
- 保持间隔: 在决策点之间,当前的 λ 保持不变。反射定律根据不断变化的肌肉状态持续更新激发量。
- 益处: 这极大地降低了相对于模拟步长的策略查询频率(决策步),缩短了信用分配链并降低了计算成本。至关重要的是,在保持间隔内,激发量通过反射环路持续动态变化,这与简单的“动作重复”(action repeat)有着本质区别。
2.4 强化学习设置
- 算法: 使用带有广义状态相关探索(gSDE)的软行为者-评论家算法(Soft Actor-Critic, SAC)。
- 奖励: 使用 极简奖励,仅由前向速度 (vx) 组成,并伴随对中轴侧摆动 (vz) 的惩罚。未使用参考运动、姿态约束或对称性奖励。
- 观测值: 432 维,包括肌肉长度/速度、关节角度/速度、GRF 以及当前 λ 的传出副本(efference copy)。
3. 关键结果
3.1 学习效率
- 速度: λ-hold 控制器在单台工作站上仅需 一小时 的墙钟训练时间即可学会冲刺(达到约 4.0 m/s)。
- 对比:
- 普通 SAC(直接激发控制)和 协同(Synergy) 基准模型无法收敛,通常在几步之后就会摔倒在地。
- DEP-RL 学习缓慢,仅能达到约 2.6 m/s 的速度,且步态笨拙且不对称。
- 激发保持(Excitation-Hold)(直接保持激发量而不使用反射)比普通 SAC 有所改进,但仍比 λ-hold 慢一个数量级。这隔离了其收益来源:增益来自于将控制变量改为 λ(从而实现了机械协调),而不仅仅是来自保持指令。
- 探索: λ-hold 在关节速度空间中实现了显著更高的熵,并且比所有基准模型更快地覆盖了状态空间。
3.2 涌现类人冲刺
仅使用极简的前向速度奖励,控制器自发生成了:
- 协调、对称的冲刺,具有清晰的摆动肢体屈曲。
- 矢状面关节运动学和垂直地面反作用力(GRF)在不同速度下(2.5–4.5 m/s)与人类跑步机跑步数据高度匹配。
- 肌肉激活模式显示,对于推进型肌肉(如比目鱼肌、腓肠肌),其与测得的表面肌电图(EMG)具有中等至强度的相关性,尽管在摆动期肌肉(如胫骨前肌)方面存在一些差异。
4. 贡献与意义
该论文声称有三个主要贡献:
- 从极简奖励中实现类人冲刺: 作者认为,这是据其所知,第一个肌肉驱动的骨骼模型仅通过前向速度奖励,在没有参考运动模仿、努力最小化或人工调优反射增益的情况下,学习到协调的、类人冲刺行为的实例。
- 解决了低效探索问题: λ-hold 控制器证明了将控制变量更改为具有生理学依据的阈值长度,并结合间歇更新,可以高效地探索关节空间。这使得学习速度达到了可以在一天内完成测试批量运动控制假设的水平。
- 具有生理学依据的机制: 该方法并非一种工程技巧,而是整合了 EP 假设和间歇控制。它弥合了高层最优反馈控制(优化 λ 的策略)与底层反射动力学(生成 e 的定律)之间的鸿沟,表明这些框架可以在分层架构中并存。
5. 局限性与范围
作者谦虚地指出,涌现的冲刺并未达到人类顶尖的速度(~10–12 m/s)。他们将其归因于:
- 肌肉力-速度特性: 在向心式摆动驱动期间,髋屈肌处于完全激活状态,但由于其缩短速度过快,力-速度关系将它们的力 削减至其等长收缩值的四分之一到三分之一之间(这意味着它们仅保留了 25%–33% 的潜在力量)。
- 模型约束: 模型缺少手臂,而手臂在高速奔跑中对角动量平衡有重要贡献。
本文将该工作定位为迈向“可学习的人类运动控制器模型”的一步,强调该架构是一个建模演示,展示了如何将阈值控制嵌入到一个学习系统中,而非关于人类神经系统精确计算实现的最终定论。未来的工作建议测试其在平衡、跳跃和行走方面的泛化能力。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。