← 最新论文
💻 computer science

Mamba-FSCIL: Dynamic Adaptation with Selective State Space Model for Few-Shot Class-Incremental Learning

本文介绍了 Mamba-FSCIL,这是一种用于小样本类增量学习(Few-Shot Class-Incremental Learning)的新颖方法,它利用选择性状态空间模型(SSMs)中与输入相关的参数来动态适应新类,而无需扩展模型架构,从而通过双选择性投影器和类敏感扫描机制,有效地平衡了旧知识的保留与新概念的学习。

原作者: Xiaojie Li, Yibo Yang, Jianlong Wu, Yue Yu, Ming-Hsuan Yang, Liqiang Nie, Min Zhang

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaojie Li, Yibo Yang, Jianlong Wu, Yue Yu, Ming-Hsuan Yang, Liqiang Nie, Min Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位大师级厨师,多年来致力于完善一道经典菜肴(我们称之为“基础类”)。你对每一种香料、每种温度和每种质地都了如指掌。这时,一位新顾客走进店里,只用他们带来的几种食材,向你索要一道全新的菜肴(“新颖类”)。

挑战在于?你需要学习这道新食谱,同时又不能忘记旧的食谱;而且你不能每来一位新顾客就去雇佣新的厨师或建造新的厨房(那会变得非常昂贵且混乱)。

这正是 Mamba-FSCIL 所解决的问题。这是一种让计算机程序(特别是 AI 模型)能够随着时间推移学习新事物,而不会“忘记”已知事物,即使在只能看到极少数新事物示例的情况下也能如此的方法。

以下是该论文如何通过简单的概念来解释其解决方案:

1. 问题:“静态”与“扩张”的困境

在此之前,AI 在学习新事物时面临两个糟糕的选择:

  • 静态厨师(静态适配): 厨师对每道菜都使用同一套固定的工具和规则。当他们试图学习新食谱时,会不小心覆盖掉旧的食谱。结果?他们忘记了经典菜肴。
  • 扩张厨房(动态适配): 每当有新菜品需求时,厨师就会建造一个新的厨房侧翼和新的工具。虽然这保护了旧食谱,但厨房最终会变成一个巨大、昂贵且难以管理的迷宫。

2. 解决方案:一位“聪明且能变形”的厨师

作者引入了 Mamba-FSCIL,它使用了一种被称为*选择性状态空间模型(Selective State Space Models, SSMs)*的技术。你可以把它想象成一位不需要新厨房或新工具的厨师。相反,他们的双手*和大脑*会根据正在烹饪的内容瞬间改变形状。

  • 依赖输入的魔法: 通常,厨师用同样的刀处理所有东西。Mamba 则不同:如果你递给它一块牛排,它的“刀”会自动变锋利以应对肉类;如果你递给它一条娇嫩的鱼,它的“刀”会瞬间变成精细的片鱼工具。它会根据手中持有的特定食材(输入)来改变行为,而无需购买新设备。

3. 双分支策略(“双选择性 SSM 投影器”)

为了确保厨师不会产生混乱,系统将工作分成了两个专门的团队(分支):

  • “稳定性锚点”(冻结的基础分支):
    这个团队负责记住经典食谱。他们在旧菜品上接受训练,然后被“冻结”(停止学习)。然而,他们依然很“聪明”。尽管他们不再学习新事物,但他们仍利用自身的变形能力来观察食物并判断:“啊,这是一道经典菜;我会像往常一样处理它。”这确保了旧知识的安全与稳定。

  • “塑性赋能者”(动态增量分支):
    这个团队负责学习新食谱。他们是唯一被允许发生变化的部分。当出现奇怪的新食材时,这个团队会介入。因为他们使用了具有“变形”能力的 Mamba 技术,他们可以仅通过调整使用工具的“方式”,就能用现有的工具烹饪出新菜。他们不需要新厨房,只需要调整技巧。

4. “类别敏感”规则(选择性扫描机制)

我们如何确保“新团队”不会意外破坏“旧团队”的工作?论文引入了两个特定的规则(损失函数)来引导他们:

  • “保持沉默”规则(抑制损失/Suppression Loss):
    如果“新团队”看到了经典菜品,他们被告知要保持沉默。他们不得尝试改变任何东西,而是让“稳定性锚点”承担所有的工作。这防止了新学习过程覆盖旧记忆。

  • “脱颖而出”规则(分离损失/Separation Loss):
    如果“新团队”看到了新菜品,他们被告知要表现得截然不同。他们必须使用一种与旧菜品完全不同的烹饪风格。这确保了新食谱是清晰且独特的,而不是与旧食谱混淆在一起。

5. 结果

论文在三场不同的烹饪比赛(数据集:miniImageNet, CIFAR-100, 和 CUB-200)中测试了这位“聪明厨师”。

  • 结果: Mamba-FSCIL 比以往任何方法都能更好地学习新菜品,且对旧菜品的遗忘程度更低。
  • 效率: 与“扩张厨房”类的方法不同,Mamba-FSCIL 不需要增加任何新的房间或工具。它保持了厨房规模不变,但让厨师变得更加聪明。

总结

简而言之,Mamba-FSCIL 是一种通过使用“变形”机制,让 AI 能从极少数示例中学习新类别的算法。它通过冻结一个专门的“记忆分支”,同时利用一个灵活的“学习分支”来适应新事物,从而在保持旧知识安全的同时,无需构建更复杂的模型。这就像拥有一位既能瞬间切换为传统大师,又能成为创新先锋,且能让厨房规模始终保持不变的厨师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →