SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning
该论文提出了 SAME,一种用于多模态持续指令微调的稳定混合专家(Mixture-of-Experts)框架,该框架通过正交子空间路由、曲率感知缩放和自适应专家激活来缓解路由器和专家的漂移,并在一个新的长序列基准测试上实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一位学生:他极其擅长解决数学题,但一旦被要求读一首诗,就会突然忘记如何计数。这正是现代人工智能系统——多模态大语言模型(multimodal large language models)所面临的核心挑战。这些强大的计算机能够看懂图像并阅读文本,通过学习海量数据来学习如何回答有关世界的问题。它们被训练用来遵循指令,例如“描述照片中的猫”或“解决这个物理问题”。然而在现实世界中,这些系统并不是一次性学完所有知识的。相反,它们会一个接一个地遇到不同类型的任务,就像一名学生从数学课转到历史课,然后再转到艺术课一样。问题在于,当这些模型学习新技能时,它们往往会忘记旧的技能,科学家将这种现象称为“灾难性遗忘”(catastrophic forgetting)。为了保持这些模型的实用性,研究人员需要一种方法,能在教给它们新事物的同时,不抹除它们已经掌握的知识。
在一段时间内,专家们一直试图通过给模型配备一个专门的助手团队来解决这个问题,这种结构被称为“混合专家模型”(mixture of experts)。可以将该模型想象成一个大型办公室,不同的工作人员,即“专家”,负责处理不同类型的任务。当一个问题进来时,一个被称为“路由”(router)的经理会决定哪位员工最适合回答它。如果问题是关于图表的,经理会将它发送给数据分析师;如果是关于诗歌的,它会被发送给作家。当任务相对稳定时,这套系统运作良好,但研究人员发现,当模型必须学习一系列新的任务序列时,就会出现缺陷。随着模型学习新技能,经理开始犯错,将旧类型的任务发送给了错误的员工。与此同时,员工本身也开始发生变化,失去了他们之前为早期任务所开发的特定技能。这种双重失败意味着,模型不仅会将问题发错人,而且那些人也会忘记自己原本应该胜任的工作。
一支研究团队现在提出了一种名为 SAME 的新方法来解决这些问题。他们发现,经理的困惑和员工的记忆丧失是两个需要不同解决方案的独立问题。为了防止经理感到困惑,研究人员设计了一个能够仔细追踪模型观察世界方式的系统。他们并没有让经理随着每一节新课而完全改变其想法,而是限制了其关注点的偏移程度。他们允许经理学习新的分类方式,但保护了对处理先前任务至关重要的旧有分类方式。这确保了即使在模型学习了地图阅读或化学问题之后,关于医学图像的问题仍能继续被发送给医学专家。
为了防止员工忘记他们的工作,研究人员引入了一种衡量员工的新学习可能会对旧技能造成多少伤害的方法。他们观察了员工过去接触过的数据类型,并利用这段历史来减缓那些会破坏旧有技能的变化。这就像是在告诉一名员工:“你可以学习这项新技能,但要以一种不会抹除你以前修理旧机器的方式来进行。”通过这样做,模型在保留从早期任务中获得的特定能力的同时,仍能适应新的任务。此外,研究人员发现,并非每个员工在每节课中都需要处于活跃状态。他们制定了一条规则,暂时暂停当前任务不需要的员工,这既节省了能源,也防止了他们被无关信息意外改变。
该团队在包括一组模仿现实世界复杂多样性的新任务在内的挑战性基准测试中测试了这种新方法。这个新测试包含了十种不同类型的任务,范围从阅读医学文档、分析科学图表,到理解复杂的道路场景和化学公式。结果表明,他们的 SAME 方法在记忆旧任务方面明显优于以往的方法。在涉及长达八个任务序列的一个特定测试中,与其他方法相比,该新方法在处理第一个任务时保持了更高的准确度。它还证明了更高的效率,因为只需更新必要的员工,因此在训练时所需的时间和计算机内存更少。
或许最重要的一点是,研究人员观察到,他们的方法防止了一种微妙但常见的失败情况,即模型给出了正确的答案,但格式错误。例如,如果一项任务要求用大写字母回答,在学习了使用小写字母的新任务后,模型可能会开始给出小写字母的答案。新系统保持了模型的一致性,确保它遵循每个任务特定的格式规则,而不会被下一个任务的风格所干扰。通过稳定“谁来回答问题”的决策以及“回答问题的人”的记忆,这项工作为人工智能提供了更可靠的持续学习方式,在扩展其能力的同时,不会丢失已有的基础。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。