← 最新论文
💬 NLP

When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills

本文介绍了 Auto-Robotist,这是一种自进化大语言模型智能体,通过将搜索轨迹提炼为显式、可检查的自然语言技能库,将无记忆的进化机器人设计转化为可迁移的过程,从而显著提高了搜索效率,并实现了在不同设计空间之间的成功知识迁移。

原作者: Yunfei Wang, Xiaohao Xu, Yang Li, Xiaonan Huang

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunfei Wang, Xiaohao Xu, Yang Li, Xiaonan Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试发明一种新型行走机器。你拥有一个计算机模拟器,允许你用类似乐高积木的模块构建不同形状的机器人。每构建一个机器人,你都必须运行一次漫长且昂贵的测试,以查看它能否行走、搬运箱子或跳跃。

旧方法(“无记忆”方法)
传统上,科学家使用一种称为“遗传算法”的方法。这就像是自然选择的数字版本:

  1. 你构建 25 个随机机器人。
  2. 你测试它们全部。
  3. 你保留表现最好的 5 个,丢弃其余的。
  4. 你将这 5 个优胜者进行混合和变异,以创造下一代。

问题: 这种方法非常“健忘”。它保留了获胜的机器人,却丢弃了失败者为何失败的“故事”。机器人是因为腿太细而摔倒的吗?是因为太滑而打滑的吗?旧系统忘记了这些教训。每当它尝试新任务或更大的机器人时,都必须从头重新学习。

新方法:AUTO-ROBOTIST
本文介绍了一个名为 AUTO-ROBOTIST 的新系统。把它想象成一个拥有笔记本(即“技能库”)且从不丢弃的机器人设计师。

以下是其工作原理,使用一个简单的类比:

1. 技能的“笔记本”

AUTO-ROBOTIST 不仅仅保留最好的机器人,而是根据所学内容写下规则

  • 原型(理念): 它识别出一种模式,例如“门式框架”(一种看起来像门口的形状)。
  • 规则(建议): 它写下具体的建议,例如:
    • 好规则: “如果你中间有一个重型电机,就在其周围放置一个刚性框架。”
    • 坏规则: “永远不要将底部腿部留空,否则机器人会坍塌。”
  • 证据(证明): 它保存了证明这些规则有效(或无效)的具体机器人设计。

2. 在做中学(搜索过程)

当系统尝试设计机器人时,它不会仅仅随机猜测。

  • 它打开笔记本,寻找与当前任务相匹配的规则(例如,“我需要搬运一个重箱子”)。
  • 它请求一个智能人工智能(大型语言模型)利用这些规则作为指导,对上一轮中最好的机器人进行调整。
  • 为了保险起见,它仍会进行一些随机猜测(就像旧方法那样),但它的大部分时间都花在遵循已经学到的“规则”上。

3. 更新笔记本

测试完成后,系统不仅仅挑选获胜者,而是更新其笔记本

  • 添加: 如果发现一种新的有效模式,它就写下一条新规则。
  • 诊断: 如果机器人失败了,它会找出原因,并添加一条“不要这样做”的规则。
  • 合并: 如果它拥有两条表达相同意思的规则,它就会将它们合并,以保持笔记本整洁。

为何这很重要:“扩展”测试

研究人员在名为 EVOGYM 的模拟器上测试了这一点。他们主要做了两件事:

  1. 冷启动: 他们从一个空笔记本和一个小型机器人(5x5 个积木块)开始。即使没有任何先验知识,系统也能在过程中学习规则,并比旧的“健忘”方法更快地找到更好的机器人。
  2. 巨大飞跃: 然后,他们尝试为相同的任务设计一个更大的机器人(10x10 个积木块)。
    • 旧方法: 必须从头开始,重新学习一切。
    • AUTO-ROBOTIST: 打开其笔记本,查看从小型机器人那里学到的规则(例如“刚性框架有助于稳定性”),并将它们应用于大型机器人。

结果: AUTO-ROBOTIST 在设计大型机器人方面表现更好。它不仅仅是复制小型机器人并将其放大(这通常会导致机器人损坏);它理解了构建稳定机器人的原理,并将这些原理应用到了新的、更大的尺寸上。

简而言之

  • 旧方法: “我发现了一个获胜的机器人。让我们尝试做一个略有不同的。哦不,它失败了。让我们再试一次。”(重复错误)。
  • AUTO-ROBOTIST: “我发现了一个获胜的机器人。我学到了‘刚性框架有帮助’。让我们把它记下来。现在,对于下一个机器人,我会确保使用刚性框架。如果它失败了,我会记下原因,以便我不会再犯同样的错误。”

该论文声称,通过将昂贵的计算机测试转化为可重用的“技能库”,可以更高效地设计机器人,并且从小型机器人那里获得的知识可以帮助构建更好、更大的机器人,而无需从头开始。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →