← 最新论文
💻 computer science

Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning

本文介绍了 ROGER,这是一种能够根据具身交互惩罚在线自动调整奖励权重增益的方法,旨在实现近乎零的约束违反以及在仿真和真实世界四足机器人中卓越的运动性能,从而有效地消除了对手动奖励调优的需求。

原作者: Arthicha Srisuchinnawong, Poramate Manoonpong

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Arthicha Srisuchinnawong, Poramate Manoonpong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

问题:机器人训练中的“金发姑娘”困境(适度原则)

想象一下,你正在教一只机器狗走路。你希望它跑得快(奖励/Reward),但你也需要确保它不会摔倒或折断腿(约束/Constraints)。

在传统的机器人训练中,你必须扮演一个严格且过度亢奋的教练,手动设定规则。你必须去猜测“快跑!”与“别摔倒!”之间的完美平衡点。这被称为增益调优(tuning the gains)。

  • 如果你把“快跑!”的声音喊得太大,它会冲刺并立即翻车。
  • 如果你把“别摔倒!”的声音喊得太大,它会因为太害怕移动而永远站在原地不动。

寻找这种完美的平衡通常需要经过数小时的试错。如果你判断错误,机器人在训练过程中可能会摔倒数百次,这对于真实的硬件设备来说既危险又昂贵。

解决方案:ROGER(智能反射)

该论文的作者提出了一种名为 ROGER(基于具身调节的奖励导向增益)的新方法。

不要把 ROGER 仅仅看作是一个大声喊指令的教练,而要把它看作是内置在机器人大脑中的一套智能反射系统。机器人不再是由你手动设定规则,而是实时倾听自己的身体和地面反馈。

它是这样工作的:

  1. 当机器人处于安全状态时: 如果机器人在平地上走得很稳,ROGER 会说:“太棒了!你离危险边缘还很远。让我们专注于跑得更快吧!”它会调高“快跑”奖励的音量。
  2. 当机器人变得摇晃时: 如果机器人开始向侧面倾斜(接近摔倒),ROGER 会立刻感知到这一点。它会瞬间调低“快跑”的音量,并调高“停止并稳定”的音量。
  3. 结果: 机器人只会在安全时学习快走。如果它接近摔倒,它会自动减速以自救,并在恢复稳定后再次加速。

“红绿灯”类比

想象机器人正在开车。

  • 旧方法(固定增益): 红绿灯被固定在一个设置上。如果灯是绿色的,汽车就会加速,即使有行人正在过马路。如果灯是红色的,汽车就会停止,即使路上空无一人。你必须在路况变化时手动更改灯的设置。
  • ROGER 方法: 红绿灯变得聪明了。它们观察路面情况。如果路面畅通,它们就变绿灯让车快速通行。如果有人迈步过马路,灯会瞬间变红以让车停下。机器人不需要人类来改变灯光,环境本身控制了规则。

他们实际测试了什么(实验结果)

研究人员不仅在模拟器中进行了测试,还在一台真实的重型机器狗(60公斤,大约相当于一个成年人大小)上进行了测试。

  1. 学习过程中没有摔倒: 在其他方法导致机器人在训练期间摔倒或违反安全限制数百次时,ROGER 保持了机器人的安全。在一项测试中,它实现了近乎零违规。
  2. 学习速度更快: 因为机器人没有浪费时间在摔倒和恢复上,它学会了走得更快。它比其他先进方法实现了高达 50% 的速度提升。
  3. 现实世界中的成功: 研究人员从零开始(从没有任何知识开始)训练了一台物理机器狗,仅用了约 一小时。机器人学会了在湿滑的地板、松散的碎石甚至携带重物的情况下行走,且一次都没有摔倒。
  4. 无需“调优”: 研究人员不需要花费数天时间去猜测正确的数值。他们只需设置一个简单的“安全阈值”(例如“倾斜角度不超过10度”),ROGER 就会自动处理其余的一切。

核心结论

这篇论文声称,我们不需要成为“增益调优师”(即手动调整复杂数学设置的人)来教会机器人安全移动。相反,我们可以让机器人与世界的交互过程自动调整自身的学习优先级。

  • 安全? 跑快点。
  • 不安全? 慢下来并稳住。

这使得机器人能够在现实世界中快速且安全地学习复杂的动作,而无需承担在学习过程中损坏自身的风险。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →