← 最新论文
🤖 machine learning

AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

AlphaWiSE 是一种事后权重插值方法,它通过在样本记忆上拟合单个标量系数,自适应地结合两个冻结的检查点,从而在不增加推理时间或模型规模的情况下,改进持续多模态表示学习。

原作者: Sarthak Jain, Qiran Hu, Zhen Zhu, Yaoyao Liu

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Sarthak Jain, Qiran Hu, Zhen Zhu, Yaoyao Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人通过它的眼睛、耳朵和声音来理解世界。这个基于“多模态”学习构建的机器人已经学会了如何将一张狗的照片与“狗”这个词以及吠叫声联系起来。它生活在一个感官完美连接的共享精神空间中。但现实世界并未停止运转;新的声音、新的图像和新的词汇每天都在到来。这种“持续学习”的挑战在于:如何教这个机器人吸收新课,而不忘记旧课。这是一个微妙的平衡:如果机器人学得太用力,它可能会忘记如何识别猫;如果它太小心翼翼,它就永远学不会新花样。科学家们一直试图为这个机器人寻找完美的“甜点位”,但通常,他们最终只能得到一个单一的、最终版本的脑回路,而这个脑回路必须在记住过去和学习未来之间做一个单一且永久的妥协。

这篇题为 AlphaWiSE 的论文正是针对这一问题展开研究的。作者提出,与其强迫机器人只选择一个“完美”的大脑,不如观察它在训练过程中创建的两个不同的“大脑”:一个擅长记住旧事物但学习新事物较慢,另一个学习很快但容易遗忘。论文提出了一种巧妙的方法来将这两个大脑融合在一起,不是像制作奶昔那样简单地取平均值,而是通过仔细融合它们各自特定的神经连接部分。结果是,我们得到了一个全新的、功能增强的机器人,它既能像那个谨慎的大脑一样完美地记住旧课,又能像那个热衷学习的大脑一样快速掌握新知识。作者在一种连接音频、图像和文本的系统中测试了这一点,发现这种“混搭”方法始终优于单大脑版本,创造出了一个更鲁棒、更具适应性的人工智能。

问题所在:“一刀切”的陷阱

把训练 AI 比作训练一名学生参加一系列考试。首先,他们学习历史;然后,他们学习数学;接着,学习科学。在 AI 的世界里,当一个模型学习新学科(比如一组新的声音或图像)时,它往往会“忘记”之前的学科。这被称为灾难性遗忘

为了阻止这种情况,科学家们开发了不同的学习策略。有些策略,比如 EWCLwF,就像是一个害怕不及格的学生。他们紧紧抓着旧笔记不放,对大脑进行非常微小、谨慎的修改,以免丢失已有的知识。这些学生很擅长记住历史,但在快速学习新的数学概念方面可能会遇到困难。

其他策略,比如标准的微调(fine-tuning),则像是直接扎进新材料中的学生。他们学数学的速度极快,但在过程中,他们可能会不小心擦掉自己的历史笔记。

问题在于,在现实世界中,我们需要一个两者兼顾的学生。但传统方法迫使我们在两者之间做出选择。我们必须在“稳健型”或“快速型”之间二选一。如果我们选择稳健型,就会错失新知识;如果我们选择快速型,就会失去过去。论文认为,这种“二选一”的做法是错误的。

解决方案:“智能搅拌器”(AlphaWiSE)

本文的作者 Sarthak Jain, Qiran Hu, Zhen Zhu 和 Yaoyao Liu 提出了一个名为 AlphaWiSE(自适应权重插值)的新想法。他们没有选择其中一个学生,而是决定将“稳健型”学生和“快速型”学生同时“冻结”在时间中。他们不想把两个大脑混合成一团混乱的平均值,而是想通过提取各自最优秀的特质来构建一个全新的学生。

想象一下,你有两份不同的蛋糕食谱。食谱 A 的巧克力风味完美,但口感偏干;食谱 B 虽然湿润,但缺乏巧克力味。AlphaWiSE 不会盲目地将两种面糊混合在一起,而是像一位大师级厨师那样,逐层观察蛋糕:

  • 对于巧克力豆(处理特定声音的大脑部分),厨师可能会说:“让我们从食谱 A 中提取 90% 的巧克力。”
  • 对于湿润度(处理新学习的部分),厨师可能会说:“让我们从食谱 B 中提取 80% 的水分。”

这就是 AlphaWiSE 的核心:张量级插值(Tensor-wise interpolation)。用 AI 的语言来说,“大脑”是由许多不同的层和部分(称为张量)组成的。AlphaWiSE 并不是使用一个单一的旋钮来混合两个大脑,而是为大脑的每一个具体部分都学习了一个微小的、特定的“混合旋钮”(系数)。

其运作方式如下:

  1. 设置: 研究人员获取两个被冻结的模型。一个是标准的“快速学习者”(顺序微调模型),另一个是“安全守护者”(使用 EWC、LwF 或 iCaRL 等方法训练的模型)。
  2. 记忆: 他们使用一个仅包含 840 个样本(混合了声音、图像和文本)的微型“记忆库”来教授混合过程。他们不需要整个互联网的历史,只需要一个小样本。
  3. 学习: 系统观察这些 840 个样本,并询问:“对于大脑的这个特定部分,我们需要多少‘快速’模型和多少‘安全’模型才能获得最佳结果?”它不断调整混合旋钮,直到新的组合模型在这些样本上表现完美。
  4. 结果: 最终的模型是一个统一的大脑。它的大小和运行速度与原始模型完全一致,因此不会增加运行负担。但它更聪明,因为它从两位“父母”那里精挑细选了最好的特质。

他们的发现:更好的平衡

团队在名为 AudioCLIP 的系统上进行了测试,该系统连接了音频、图像和文本。他们模拟了一个 AI 必须随着时间推移学习新类别声音的世界,且每次只能学习一个阶段,期间不允许再次查看旧数据(除了那 840 个样本)。

结果令人振奋。论文表明,AlphaWiSE 始终优于单模型策略。

  • 音频到文本: 当将快速学习者与“EWC”(安全型)模型结合时,AlphaWiSE 将准确率从 0.2900 提升到了 0.3037(以 R@1,即检索的标准得分衡量)。
  • 图像到文本: 在这个方向上的改进更为显著,表现最好的 AlphaWiSE 组合达到了 0.4225,明显高于单个基准模型。
  • 图像到音频: 这个方向的得分从 EWC 单独使用的 0.1988 跳升至 AlphaWiSE 的 0.2309

作者发现,“最佳”混合比例取决于机器人在做什么。有时,“安全”模型对大脑的音频部分贡献更多,而“快速”模型对图像部分贡献更多。这证明了大脑的不同部分受益于不同类型的学习。

为什么这很重要

论文指出,我们不应将不同的训练方法视为竞争对手,认为只能有一个胜出。相反,它们就像厨房里的不同食材。 “安全”方法保留了共享空间的几何结构(保持图像与文本之间关系的稳定),而“快速”方法则适应新数据。通过使用 AlphaWiSE,我们可以将这些食材组合成一道比任何单一食材都更佳的佳肴。

作者还发现了一些关于“混合是如何发生”的有趣现象。他们发现“混合旋钮”并非随机生成的。系统倾向于保留“安全”模型的主要结构权重(负责重活的部分),但会大量借鉴“快速”模型的归一化缩放与偏置(normalization scales and biases)(即微调旋钮)。这表明,“安全”模型提供了坚实的基石,而“快速”模型提供了应对新数据所需的精细调节。

总结

AlphaWiSE 并没有发明一种全新的训练机器人方法。相反,它提供了一个巧妙的“训练后技巧”:取出两个你已经训练好的不同版本的机器人,将其冻结,然后利用极少量的数据来学习如何精确地将它们融合。其结果是一个运行速度与原模型一样快,但在学习未来的同时能更好地记住过去的模型。

论文表明,这种方法可以成为构建需要持续适应变化世界的 AI 系统的强大工具——无论是识别新的声音、理解新的俚语,还是识别新的物体——且无需丢失已获得的知识。它将“遗忘问题”转化为了“混合机会”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →