Continual Field-Adaptive Models (CFAMs) for Post-Deployment Physical AI
本文介绍了持续场自适应模型(Continually Field-Adaptive Models, CFAMs),这是一种互补的学习架构,其特征在于一个冻结的慢学习组件和一个快速学习的胶囊场(Capsule Field),使各种物理机器人能够通过自主、无梯度的更新,在保持原有能力的条件下,高效地获取新技能并适应现场中经过验证的新型近分布外(near-OOD)场景。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一个机器人被派往一个危险且未知的场所:坍塌的矿井、充满辐射的反应堆,或是深海海底。它的任务是清理碎片、检查结构或取回物体。在现实世界中,环境是不可预测的。地面可能是松散的碎石而非坚实的混凝土;沉重的负载可能会意外移动;门口可能比地图上标注的要窄。对于一台机器而言,若要取得成功,它不能仅仅遵循实验室里编写好的剧本。它必须能够从其周围环境中学习,在新的情况出现时立即进行适应,而无需人类发送新指令,也不需要超级计算机来重新训练它的“大脑”。这就是物理人工智能(Physical AI)的圣杯:一台能够踏入危险区域、即时解决问题,并在学习新技能的同时不忘初心、不丢失原有能力的机器。
多年来,构建这些机器的标准方法是向它们喂入大量受控环境下的数据,在它们离开实验室之前,教给它们成千上型的任务变体。但在国防或灾难响应等关键任务领域,这类数据并不存在。这些环境过于危险,无法进行仪器化监测;而发生的情况又过于独特,无法预见。如果机器人遇到从未见过的情况,传统模型往往会失败,或者更糟——它会试图通过覆盖旧知识来进行“学习”,从而导致它忘记如何执行基本职责。这产生了一个困境:如何构建一台既足够聪明以应对未知,又足够稳定以至于在面对未知时不会“丧失理智”的机器?
一组研究人员提出了一种名为“持续场自适应模型”(Continual Field-Adaptive Models,简称 CFAMs)的解决方案。他们的研究在五种不同类型的机器人(从机器狗、无人机到类人手臂和越野车)上进行了测试,表明了一种让机器在部署后变得更加聪明的新方法。CFAMs 并不试图在每次看到新事物时都重新训练机器人的整个大脑,而是将机器人的“慢速”知识与“快速”学习分离。负责处理感知和决策等繁重任务的“慢速”部分在实验室初始训练完成后会被冻结,作为一个稳定的基础。而“快速”部分则是一个专门的记忆库,机器人在此存储在实地遇到的特定新经验。
其核心思想是,机器人不需要在每次地面移动或物体移动时都重新学习如何行走或如何抓取物体。相反,它存储的是一个“能力胶囊”(competence capsule),即一条关于特定成功的精简记录。可以将其想象为在庞大的知识库中添加的一条精确笔记。当机器人遇到与其已知情况略有不同的情况时(例如,负载变重或表面变滑),它会检查自己的记忆。如果它发现了一条足够接近的已存储经验,它就会利用这条经验来调整动作。如果成功了,它会将一条略有不同的新经验写入其记忆库,从而有效地扩展了它能处理的情况范围。这个过程完全在机器人自身的计算机上运行,无需人类监督,也无需对主脑进行复杂的数学重训。
研究人员首先通过仅有的少量演示,在实验室中教会了机器人一些任务。随后,他们将机器人送入模拟及真实的各种环境中,其中的环境条件与训练数据略有不同。结果令人瞩目。虽然那些试图通过重训主脑来进行适应的标准机器人往往会失败或丢失原有技能,但 CFAM 机器人却变得越来越好。在一组测试中,机器人仅通过捕捉并存储这些微小的、经过验证的成功案例,其成功率就提升了近 14 个百分点。它们学会了处理更重的负载、穿越更茂密的植被以及从打滑中恢复,同时仍能完美执行原始任务。
至关重要的是,该系统被设计为是安全且有界的。它只从与已知情况非常接近的情境中学习,确保它不会尝试发明可能导致危险的全新行为。它还内置了一个清理机制,可以将相似的经验合并在一起,以免记忆库过载。研究人员发现,这种方法使机器人的学习效率极高,仅需使用标准机器人通常所需数据的 40%,就能在实地实现自主且持续的成长。
这项研究证实,构建一种在训练结束后仍能持续学习的物理人工智能是可能的。通过将机器人的稳定通用知识与其针对新体验的快速灵活记忆相分离,研究人员创造了一个能够适应物理世界混乱且不可预测性的系统。这不是一台每天都要从零开始学习的机器;而是一台能够基于已有知识进行构建,并在行进过程中不断增加微小且经过验证的改进经验的机器。对于人类无法到达的任务,这种受限且自主的成长模式提供了一条前进的路径:一种能够踏入未知、从错误与成功中学习,并在保持自我特性的同时不断前行的机器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。