← 最新论文
💻 computer science

ECo-MoE: Embodiment-Conditioned Mixture of Experts Increases the Evolvability of Robots

本文介绍了 ECo-MoE,这是一个可扩展的框架,它协同优化机器人形态与门控控制专家混合模型,以实现高效的模块化进化,其中祖先知识得以保留,且新设计可通过“演示驱动进化”过程由预策略引导。

原作者: Yibin Wang, Muhan Li, Zihan Guo, Sam Kriegman

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yibin Wang, Muhan Li, Zihan Guo, Sam Kriegman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一整家人形机器人如何行走,但家族中的每个机器人都有略微不同的身体形状。有的又高又瘦,有的又矮又宽,还有的拥有额外的腿。

在过去,科学家们面临一个艰难的选择:

  1. “一刀切”方法:训练一个巨大且超级复杂的“大脑”来控制所有机器人。问题在于:这个“大脑”会变得“保守”。它倾向于求稳,导致机器人动作缓慢且笨拙,因为它试图找到一个对所有人都适用但无人精通的中间方案。
  2. “定制大脑”方法:为每一个机器人单独训练一个全新的定制“大脑”。问题在于:这极其缓慢且昂贵,就像为庞大学校里的每个学生都聘请一名私人导师。

本文介绍了一种巧妙的折中方案,称为ECo-MoE(基于具身条件的专家混合模型)。你可以将其想象为一个由专业教练组成的协作团队。

“教练团队”类比

与其使用一个巨大的大脑或成千上万个定制大脑,不如让机器人拥有一个由四个“专家”神经网络(即教练)组成的小团队。

  • 专家 1擅长控制细长、蛇形的身体。
  • 专家 2擅长控制短小、粗胖的身体。
  • 专家 3和专家 4则拥有各自的专长。

但其中的妙处在于:机器人并非只挑选一位教练。它拥有一位智能管理者(称为“门控网络”)。这位管理者会观察机器人的身体形状(即其“基因型”或蓝图),并决定在多大程度上听取每位教练的意见。

  • 如果机器人又长又瘦,管理者会说:“90% 听从专家 1,10% 听从专家 2。”
  • 如果机器人又矮又宽,管理者会说:“80% 听从专家 3。”

这使得系统能够在不破坏“大脑”的前提下演化出新的身体形状。如果演化出一种新的、奇特的身体形状,管理者只需微调教练的组合来处理它,而无需丢弃教练们已经学到的知识。

“演示驱动演化”:从蓝图中学习

本文还引入了一项名为**“演示驱动演化”**(Evolution by Demo)的功能。

想象你有一个非常喜欢的特定机器人设计(即“演示”),比如一个完美的四足行走者。通常,演化是随机的;这就像在黑暗中扔飞镖,希望能击中靶心。

  • 旧方法:你可能要等待很长时间,让演化偶然发现那个完美的形状。
  • ECo-MoE 方法:你可以利用那个完美设计,专门针对它训练其中一位“专家教练”,然后冻结该教练的“大脑”。接着,你告诉演化过程:“嘿,如果新机器人看起来有点像我们的完美演示,就多听听这位专家的意见。”

这就像一个磁铁。它温和地将随机的演化过程拉向你想要的形状,引导机器人演化为你心中设想的具体、理想的形态,而不仅仅是随机形状。

他们发现了什么?

研究人员在模拟世界中用三个挑战测试了该方法:

  1. 平地:在平滑地板上行走。(在此场景下,新方法的表现与旧的“一刀切”方法相当。简单任务不需要复杂的教练团队。)
  2. 直立行走:像人类一样保持直立行走。(新方法表现好得多。它演化出了能够更有效地站立和行走的机器人。)
  3. 坑洼路面:在崎岖不平的地面上行走。(同样,新方法表现好得多。教练团队比单一的巨大大脑能更快地适应粗糙地形。)

宏观视角

主要结论是,通过利用一个适应机器人身体的模块化专家团队,机器人可以更快地演化并学习更优的行为,尤其是在任务变难或环境变得混乱时。这就像从一位过度劳累的单一将军,升级为一个灵活、专业的指挥中心,能够应对自然(或演化)抛出的任何身体类型。

论文还指出,虽然这在计算机模拟中效果极佳,但机器人目前才刚刚开始被制造出来,下一步是验证该方法是否能在物理机器上生效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →