← 最新论文
🤖 machine learning

A Compositional Paradigm for Foundation Models: Towards Smarter Robotic Agents

本文提出将持续学习与组合性原理集成到基础模型中,以克服其在适应动态现实场景方面的局限性,从而实现更具灵活性、高效性和智能性的机器人智能体的开发。

原作者: Luigi Quarantiello, Elia Piccoli, Jack Bell, Malio Li, Giacomo Carfì, Eric Nuertey Coleman, Gerlando Gramaglia, Lanpei Li, Mauro Madeddu, Irene Testa, Vincenzo Lomonaco

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Luigi Quarantiello, Elia Piccoli, Jack Bell, Malio Li, Giacomo Carfì, Eric Nuertey Coleman, Gerlando Gramaglia, Lanpei Li, Mauro Madeddu, Irene Testa, Vincenzo Lomonaco

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人做从烤面包到修理漏水水龙头的一切事情。长期以来,实现这一目标的最佳方法是为机器人构建一个“超级大脑”——一个经过数个太字节(terabytes)数据训练的、无所不知的海量模型。这就像雇佣了一位读遍了图书馆里每一本书、看遍了互联网上每一个视频的天才。这些“基础模型”(Foundation Models)极其聪明;它们可以像人类一样聊天,识别图片,甚至控制机械臂。但问题在于:它们就像一个巨大的、沉重的背包。一旦你背上了它,就很难进行更改。如果机器人需要学习一项全新的技能,比如打开某种特定类型的罐子,你通常必须脱掉整个背包,从头开始重新训练这位天才,然后再把它背回去。这既耗时又耗电,而且如果机器人在学习如何开罐子时忘记了如何烤面包,那就是一个被称为“灾难性遗忘”的问题。

为了解决这个问题,科学家们正在研究两种不同的思路:持续学习(Continual Learning)和组合性(Compositionality)。持续学习就像是一个永不停歇学习的学生;他们不断向大脑中添加新知识,而不会忘记旧知识。组合性则像是用乐高积木进行搭建。与其使用一个巨大的、单一的塑料块,不如使用许多小的、专门的积木。你可以通过不同的方式将它们拼接在一起,构建出城堡、汽车或宇宙飞船。如果你需要把宇宙飞船变成潜水艇,你只需要更换几个积木,而不是把整个东西熔化掉。一个大问题是:我们能否利用这些像乐高一样的构建模块,让机器人变得比今天的巨型背包模型更聪明、更快、且更容易更新?

这篇题为《基础模型的组合范式:迈向更智能的机器人智能体》(A Compositional Paradigm for Foundation Models: Towards Smarter Robotic Agents)的论文指出,答案是肯定的。作者认为,仅仅让 AI 模型变得越来越大正在撞上一堵墙。他们提议,与其训练一个庞大且僵化的模型,不如构建一个结合了较小的、专业化部分的系统。他们在两个截然不同的领域测试了这个想法:图像识别和机器人手臂控制。

首先,他们观察了图像分类。想象一下,给计算机展示一系列不同类型的图片,比如鸟类、汽车和花朵,一个接一个地出现。作者没有在每种新类型的图片出现时都重新训练整个计算机视觉系统,而是采用了“乐高”方法。他们为每个新任务训练了小的、独立的模块(称为 LoRA 适配器),然后使用一种智能合并过程将这些模块拼接在一起。他们发现,这种方法不仅更准确,而且训练速度更快。在对一个包含 50 个不同任务的数据集进行的测试中,他们的“乐高”方法达到了 55.17% 的准确率,击败了仅能达到 47.56% 或 36.02% 的其他方法。更棒的是,它仅用了 170.61 秒进行训练,而竞争对手则花费了超过 300 秒。

接下来,他们将这个想法带入了真实的机器人世界。他们想要看看机器人是否可以在不需要超级计算机的情况下学习操作物体。他们构建了一个系统,该系统使用小型、预训练的“适配器”来微调机器人的现有大脑,使其能够即时适应新的环境。结果令人瞩目。在一项机器人操控任务中,他们这种轻量级的方法实现了 0.91 的成功率(意味着成功率为 91%),并且每步获得了 0.60 的奖励。相比之下,像 OpenVLA 和 InstructRL 这样复杂且著名的模型完全失败了,成功率为 0.0。当那些重型模型需要训练 40 到 92 小时时,作者的方法仅用了 14 小时就完成了工作。

论文总结道,为了让机器人真正成为能够处理混乱、多变的现实世界的智能体,它们需要停止成为静态的巨人,转而成为灵活的技能集合体。通过结合这些小型、高效的部分,我们可以创造出能够学习新事物而不忘记旧事物的智能体,同时消耗更少的能量和时间。这是一种转变:从构建一个单一、不可更改的超级大脑,转向组建一支由专业专家组成的团队,让他们能够协同工作、即时适应,并以一种旧方法根本无法匹配的灵活性来解决问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →