Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
本文介绍了 Macaron-V1,这是一个旨在在真实环境中进行持续学习和自我改进的开放式智能体模型家族,其特点是采用了一种混合 LoRA(Mixture-of-LoRA)架构,该架构在冻结基础模型的同时动态组合专家适配器,并辅以一个递归的模型-工具设计(Model-Harness Co-design)框架以及用于递归适应与评估的支持性基础设施。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
不断成长的学习机器
想象一下,你有一个才华横溢的新朋友,他了解直到你遇见他那天为止的世界的一切。他很聪明,但如果你问他关于昨天发布的一款新应用,或者你上周养成的一个个人习惯,他就会卡壳。他无法从你的特定对话中学习,因为他的大脑在时间中是“冻结”的。这就是目前大多数人工智能的局限性:它们被训练一次,然后被发布出去,接着只是重复已知的内容,无法从日常经验中真正成长。
试图解决这个问题的计算机科学领域被称为持续学习(Continual Learning)。把它想象成试图教导一个永不停学的一名学生。一个真正的智能体不应该只是背诵教科书并参加期末考试,它需要从每一次交互、每一个错误以及它掌握的每一个新工具中学习,同时还要记住它是谁以及它擅长什么。研究人员提出的重大问题是:我们如何构建一个不仅仅是“知道”事物,而是能真正“体验”事物,并随着时间的推移在担任个人助手方面变得越来越好的 AI?
这就是 Macaron-V1 登场的地方。这是一个全新的 AI 模型家族,旨在具有“体验性”,这意味着它们能从现实生活的交互中学习,并在部署后不断改进。其背后的研究人员 Mind Lab 意识到,要让 AI 真正聪明,不能只是向一个巨大的大脑中倾倒更多数据。你需要一个能够调整其环境并与专业化的助手协作的系统。他们构建了一个系统,将 AI 不视为一个单一、静态的大脑,而是一个灵活的团队,可以更换工具并在自我改进的循环中优化自身的指令。
Macaron-V1 团队:一个冻结的大脑和一个可更换的工具包
想象一个庞大、超级聪明的图书馆(“基础模型”),它的书籍永远不会改变。它如此宏大且组织有序,以至于几乎无所不知。但,图书馆仅仅是一个图书馆;它并不知道如何针对性地帮助你。为了让它变得有用,Macaron-V1 在这个图书馆之上添加了一层“专家适配器”。你可以把这些适配器想象成不同款式的眼镜或工具包,你可以将它们扣在图书馆的头上。
一副眼镜用于聊天(L0),另一副用于作为智能体执行任务(L1),第三副用于编程(L2),第四副用于设计用户界面(L3)。这种设置被称为混合 LoRA(Mixture-of-LoRA, MoL)。每当你想要它学习一项新技能时,你不需要重新训练整个庞大的图书馆,只需更换一副眼镜或微调现有的眼镜即可。主图书馆保持冻结和安全,而专家们则负责繁重的任务。这意味着 AI 这一分钟可以拥有“聊天”人格,下一分钟可以切换到“编程”人格,而不会感到困惑或忘记其核心知识。
该系统使用一个聪明的“代理”(就像一名接待员)来决定调用哪位专家。当你提出问题时,接待员会阅读你的问题,判断你需要的是程序员、设计师还是仅仅是一个聊天伙伴,并立即切换到合适的专家。这个过程非常快,以至于你几乎察觉不到切换。论文显示,该系统在选择正确专家的准确率极高——约为 99%,并且不会显著降低速度,仅增加了一点点延迟。
自我改进循环:调整指令,而非大脑
Macaron-V1 的真正魔力不仅在于拥有这些专家,还在于系统如何优化其性能。研究人员构建了一个名为 MindForge 的系统,它运行着一个“递归自我改进”循环。想象一款电子游戏,AI 玩过一个关卡后失败了,然后游戏会自动重写规则或给 AI 一个新的策略指南,让它再次尝试。
其工作原理如下:
- 发现(Discovery): AI 查看自己目前还不能做到的事情,并为自己创造更难的挑战。
- 扩展(Expansion): 它尝试在模拟环境(如沙盒)中解决这些挑战。如果失败了,系统不会仅仅说“错误”。它会分析为什么失败。是指令不清晰?还是缺少工具?
- 更新(Update): 如果 AI 通过改变指令或工具(即“支架/harness”)找到了成功的方法,它会记录下来。如果它需要提高实际技能,它会训练一个新版本的专家适配器。
论文在 122 个基础 AI 完全无法解决的困难任务集上测试了这一点。在报告中描述的一个特定实验中,模型的脑部保持完全冻结——没有任何内部权重发生变化。相反,系统使用了配置搜索(configuration search)来寻找指令、工具和设置的最佳组合。通过仅仅微调这些外部指令和工具,他们成功找到了一个配置,使系统能够通过100% 的任务(122 项中的 122 项)。
至关重要的一点是,这个实验证明了什么:它证明了该系统可以在这些任务上实现完全的配置搜索覆盖。这意味着 AI 已经具备了解决这些问题的潜在能力,但它需要正确的环境或提示词来解锁它。该实验隔离了这一“扩展”阶段,以展示改变设置确实有效,但它并未证明模型以一种能在没有这些特定指令的情况下进行泛化的方式“学习”了这项技能,也没有测试完整的自我改进循环(即模型实际权重被更新的情况)。
“活的”基准测试:测试现实世界的智慧
为了观察 Macaron-V1 是否真的擅长担任个人助手,研究人员创建了新的测试,称为 Macaron ChatBench 和 Macaron LivingBench。这些不仅仅是多选题。
- ChatBench 测试 AI 是否能进行自然的、富有同理心的对话,使其感觉是在与真人交谈,而不是机器人。它检查 AI 是否理解你的情绪、保持诚实,并推动对话向前发展。
- LivingBench 是现实生活的模拟。想象 AI 是你的个人助理,正在尝试规划一次旅行。它的“世界”在周围发生变化:航班延误、价格上涨,你突然改变了主意。测试观察 AI 是否能在变化中即时调整计划、验证信息并让你保持冷静。
在这些测试中,Macaron-V1-Venti(大型 744B 版本)表现出色,在个人智能和编程方面击败了数个顶尖模型。例如,它在 UI4A-Bench(设计界面)上得分 87.8,而排名第二的得分约为 75.9。它在复杂工具使用测试 PinchBench 上也获得了 94.0 的高分。
结果:我们已知与未知之谜
结果是令人期待的,但论文也谨慎地没有过度夸大。该系统在测试内容方面表现出色:
- 适应性: 它成功通过改变指令和工具找到了通过 100% 困难任务的配置(配置搜索),证明了寻找正确的设置是提升性能的一种强大方式,而无需重新训练大脑。
- 协作性: “混合 LoRA”方法行之有效。AI 可以有效地在聊天、编程和设计模式之间切换,而不会失去逻辑。
- 效率: 通过保持主脑冻结并仅加载小型专家工具,该系统节省了大量的计算内存(比运行四个独立的巨型模型节省了约 74%)。
然而,论文也指出了它目前尚不了解的部分。
- 长期学习: 虽然系统可以在循环中改进,但论文并未证明它能否在不降低旧任务表现能力的情况下永久进行此过程(这是一个被称为“灾难性遗忘”的问题)。我们衡量了通过配置搜索实现改进的潜力,但参数持续更新的长期稳定性仍是一个开放性问题。
- 集体智能: 该系统使用的是由同一团队训练的专家。让来自不同团队或用户的专家协同工作(例如来自一家公司的聊天机器人与来自另一家公司的编程机器人合作)是一个未来的目标,而非本次测试的内容。
- 现实世界部署: 测试是在受控模拟环境中进行的。我们尚不知道它在面对混乱的互联网或拥有独特需求的数百万不同用户时会如何表现。
总结
Macaron-V1 是迈向“不仅‘知道’事物,而且能‘体验’事物”的 AI 的大胆一步。通过将一个冻结、稳定的脑部与可更换的专家工具,以及一个不断重写自身指令以解决问题的系统相结合,研究人员构建了一个比以往任何时候都更具适应性的模型。这就像是给 AI 一个瑞士军刀,并赋予它随时发明新工具的能力。
论文表明这种方法是有效的:它解决了困难任务,设计了更好的界面,并比许多当前的领先模型更好地处理了复杂的对话。但它也提醒我们,这仅仅是个开始。创造一个能从每一次交互中学习、永不停歇且永不遗忘的 AI 的梦想,仍然是一个正在完善的过程。“马卡龙”已经烤好,但实现真正、无尽学习的配方仍在不断完善之中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。