← 最新论文
🤖 machine learning

Unlocking Compositional Generalization in Continual Few-Shot Learning

本文提出了一种新颖的持续小样本学习框架,该框架利用自监督视觉 Transformer 的补丁级几何特性,将表征学习与组合推理解耦,通过在训练期间优化槽位表征以捕捉整体类身份,并在推理阶段动态组合这些表征以应对新概念,从而在最小化灾难性遗忘的同时实现最先进的泛化能力。

原作者: Phu-Quy Nguyen-Lam, Phu-Hoa Pham, Dao Sy Duy Minh, Chi-Nguyen Tran, Huynh Trung Kiet, Long Tran-Thanh

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Phu-Quy Nguyen-Lam, Phu-Hoa Pham, Dao Sy Duy Minh, Chi-Nguyen Tran, Huynh Trung Kiet, Long Tran-Thanh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《解锁持续少样本学习中的组合泛化》(介绍 COMPOSE 框架)的解读,将其拆解为简单概念、日常类比以及作者提出的核心主张。

宏观图景:“永无止境的考试”难题

想象一名学生正在参加一系列考试。

  1. 挑战:每周,老师都会引入一个全新的科目(例如:第 1 周:鸟类,第 2 周:汽车,第 3 周:抽象艺术)。
  2. 限制:学生每种新科目只能看到五张图片
  3. 陷阱:学生必须在学习新科目的同时不遗忘旧科目,且关键在于,他们必须能够识别从未见过的全新组合(例如:如果学生学会了“红色的汽车”和“蓝色的鸟”,他们能否在不曾见过“红色的鸟”或“蓝色的汽车”的情况下识别出它们?)。

大多数当前的 AI 模型在此方面表现失败。它们要么遗忘旧科目(灾难性遗忘),要么陷入死记硬背所见的五张图片,无法理解构成物体的组成部分

核心理念:用乐高积木搭建

作者认为,要解决这个问题,AI 不应将图片视为一个巨大、模糊的团块,而应将其分解为独立的乐高积木(物体)。

  • 旧方法:AI 看到“红色的汽车”并记忆整个形状。如果它看到“蓝色的汽车”,它会因为颜色不对而惊慌失措。
  • 新方法(COMPOSE):AI 学会分别识别“汽车”积木和“红色”积木。随后,当它看到“蓝色的汽车”时,它能识别出“汽车”积木和“蓝色”积木,即使它从未见过这种特定组合。

两大误区(以及 COMPOSE 如何修正它们)

论文指出了以往尝试这种“乐高方法”失败的两个具体原因,并提出了一种名为COMPOSE的两步解决方案。

误区一:“脏透镜”(表征污染)

问题:为了找到乐高积木,AI 使用了一个预训练的“眼睛”(视觉 Transformer)。然而,旧方法试图利用复杂的内部记忆(称为 GRU)来“清理”图像。作者发现,这种内部记忆因过多的噪声而变得“脏乱”,混淆了积木。这就像试图透过一扇模糊、污损的窗户来分拣乐高积木。

修正停止清理,开始读取。
作者意识到,预训练的“眼睛”(特别是那种在无人类标签情况下训练的,称为自监督 ViT)已经能清晰地看清世界。它自然地将属于同一物体的像素分组。

  • 类比:与其试图用笨拙的手重新分拣积木,不如直接拍摄积木在桌上自然摆放的照片。他们完全跳过了混乱的内部记忆步骤。这保持了“乐高积木”的纯净和清晰。

误区二:“准备过度的学生”(组合陷阱)

问题:在训练 AI 时,旧方法试图通过直接匹配部件来教导它。“这块红色区域必须与训练集中的红色区域匹配。”

  • 结果:AI 变成了一只“鹦鹉”。它死记硬背红色区域在特定汽车上的确切位置。如果红色区域稍微移动,或者汽车是不同型号,AI 就会困惑。它学习了部件的特定角色(例如:“插槽 1 永远是轮子”,“插槽 2 永远是车门”),而不是学习“轮子”或“车门”的通用概念。

修正整体训练,组合测试。
这是论文最巧妙的技巧。他们将过程分为两个完全不同的阶段:

  1. 阶段 1(训练):“大合影”方法。

    • AI 被展示一张图片,并被要求识别整个物体(例如:“这是一辆汽车”)。
    • 不被允许查看单个部件或将它们与特定的训练样本进行匹配。
    • 原因:这迫使 AI 学习对“汽车”整体外观的通用、灵活的理解,而不会将特定部件锁定在僵化的角色中。这保持了“乐高积木”的灵活性。
  2. 阶段 2(测试):“拼图求解者”方法。

    • 现在,AI 被展示一张新的、奇怪的图片(例如:“红色的鸟”)。
    • 被允许将图像分解为部件,并逐块与它所学的内容进行匹配。
    • 原因:因为部件在阶段 1 中被训练为具有灵活性,AI 现在可以成功组装“红色”积木和“鸟”积木,即使它从未见过它们在一起。

结果:为何重要

作者在标准基准测试上测试了该方法(例如在合成网格和自然照片中识别物体)。

  • 主张:COMPOSE 在识别全新概念方面取得了有史以来最好的结果(在最难的测试中准确率达到 94.14%)。
  • 效率:它在几乎不增加额外计算资源的情况下做到了这一点。它不需要重新训练巨大的“眼睛”(骨干网络);只需添加一个微小的、轻量级的“路由器”(约占总量的 0.7%)来管理部件。
  • 对比:其他试图微调整个系统的方法耗时数小时,仍无法识别新的组合。COMPOSE 仅需数分钟便取得了成功。

一句话总结

COMPOSE 教导 AI 首先学会在不纠结于细节的情况下清晰地看清整体画面,然后允许它像拼乐高积木一样组装这些清晰的部件,从而解决它从未见过的谜题。

论文声称的内容

  • 它不声称这适用于医疗诊断或临床用途。
  • 它不声称这解决了所有 AI 问题,仅解决这种特定类型的学习(持续少样本学习)。
  • 它不声称 AI 具有“意识”或“理解”世界;它只是比以前的方法更好地识别模式。
  • 它明确指出,如果底层的“眼睛”(预训练模型)在观察物体形状方面表现不佳,该方法也会遇到困难。“乐高积木”的质量取决于它们来自的“盒子”的质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →