PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft
PEAM 是一个面向《我的世界》具身智能体的新颖框架,它利用慢速审慎推理与快速反射执行的双系统架构,将记忆从推理时检索转化为参数驻留技能,其中失败作为对比学习的关键训练信号,且一种自触发机制自主决定何时内化经验,从而在避免灾难性遗忘的同时实现持续学习。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人玩《我的世界》(Minecraft)。目前,大多数机器人的学习方式就像一个从不记忆任何东西的学生。每次它们面对僵尸或需要建造熔炉时,都必须停下来,打开一本记录过往经验的巨大笔记本,搜索类似的故事,阅读它,然后尝试弄清楚该做什么。这既缓慢,又消耗大量“大脑空间”(计算机内存),而且如果笔记本变得太大,它们就会感到困惑。
PEAM(参数化具身智能体记忆)是一种改变游戏规则的机器人学习新方法。它不再仅仅依靠一本笔记本,而是帮助机器人将其经验内化。它将“我记得我是怎么做到的”转变为“我知道该怎么做”。
以下是其工作原理,分解为简单的概念:
1. 双脑系统:思考者与执行者
PEAM 使用一个“慢速”和一个“快速”的大脑协同工作:
- 慢速思考者(深思熟虑的大语言模型): 这是专家级规划者。它深入思考、编写代码、规划复杂步骤,并尝试解决难题。如果失败,它会找出原因并再次尝试。
- 快速执行者(参数化技能): 这是反射性的肌肉记忆。一旦慢速思考者解决了一个问题(例如合成一把剑),它不会仅仅保存这个故事,而是直接将这项技能传授给快速执行者。下次,快速执行者可以立即完成,无需询问慢速思考者。
2. “内化”过程:从笔记本到肌肉记忆
想象一下学习骑自行车。起初,你必须思考如何保持平衡、踩踏踏板和转向(慢速思考者)。最终,你无需思考就能做到(快速执行者)。PEAM 为机器人自动化了这一过程。
- 从失败中学习: 大多数机器人会忽略错误,或者仅仅将它们作为文本笔记记录下来。PEAM 将失败视为训练信号。它查看“失败尝试”以及修正它的“纠正措施”。它教导机器人:“不要做 X(失败);要做 Y(纠正)。”这就像教练说:“你摔倒是因为向左倾斜太多;下次要向右倾斜。”
- “值得性”评分: 机器人不会学习一切。它有一个过滤器(称为参数化值得性),会问:“这项技能是否足够有用值得记忆?它是否稳定?是否是我们经常做的事情?”如果答案是肯定的,它就会被内化。如果只是一次性的偶然事件,它就留在笔记本中。
3. “专用健身房”(隔离适配器)
这是该论文防止“遗忘”的最大创新。
想象一个拥有不同房间的健身房:一个合成室、一个战斗室和一个耕种室。
- 在旧系统中,学习战斗可能会意外覆盖机器人对合成的掌握(就像弄混了你的健身衣物)。
- 在 PEAM 中,机器人拥有物理隔离的房间(称为适配器)。当它学习战斗时,只更新“战斗室”。“合成室”保持原样。这意味着机器人可以永远学习新技能而不会忘记旧技能。
4. 自我触发的闹钟
机器人如何知道何时停止练习并开始记忆?
- 旧方法: “让我们练习 100 次,然后记忆。”(这很僵化,可能会过早或过晚记忆。)
- PEAM 方法: 机器人拥有一个自我触发的闹钟。它观察自己的失败率。如果它在特定任务上的失败频率高于平时,闹钟就会响起:“嘿,我们在这个问题上遇到了困难。让我们停下来,立即内化解决方案。”无论任务是什么,这都能发挥作用,无需人类设定具体的数字。
为什么这更好?
该论文在《我的世界》中测试了这种方法,发现了三个主要优势:
- 速度: 因为机器人不必每次都搜索笔记本,它的行动速度快得多(在测试中快了约 40%)。
- 效率: 它使用的计算资源少得多(需要处理的“文本”减少了约 85%),因为它不需要重读旧故事。
- 不遗忘: 由于“专用房间”的存在,学习一个新的战斗动作并没有让机器人忘记如何建造房屋。
总结
PEAM 就像是将一个依赖教科书回答每一个问题的学生,转变为一个真正掌握了技能的专家。它通过实践学习,从错误中学习,将不同技能分开以保持不混淆,并确切知道何时停止练习并开始记忆。其结果是一个更快、更聪明且不会忘记所学内容的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。