想象一下,你正在运营一所针对新型动物分类的学校。你拥有一本教科书,里面有你已知动物的图片和名称(例如狗和猫)。然而,你同时也有一大堆来自野生动物园的未解照片。这些照片中有些是你已知的动物,但许多是全新的、未知的动物(例如水母或袋鼠),它们并不在你的教科书中。
你的目标是教导一名学生(即 AI 模型),使其能够查看任何照片并立即说出:“那是狗”、“那是袋鼠”或“那是水母”,使用主列表中的正确名称。
问题:旧方法的“猜谜游戏”
以往的方法试图解决这一问题,但它们玩的是一个被操纵的游戏。
- 训练阶段:它们过于专注于已知动物(教科书)的视觉细节,从而忽略了那些未解动物。
- 测试阶段:当学生看到一张袋鼠的照片时,他们可能会猜测“动物 #3"。由于老师不知道“动物 #3"意味着什么,他们使用了一种称为匈牙利匹配的技巧。这就像一场“抢椅子”游戏,在测试结束后,你重新排列答案以使分数看起来完美。
- 示例:学生将袋鼠的照片猜测为“动物 #3"。老师说:“好吧,让我们假装‘动物 #3'实际上意味着‘袋鼠’。”
- 缺陷:在现实世界中,你无法在事后重新排列答案。你需要学生立即知道实际名称(“袋鼠”)。旧方法本质上是在将动物聚类成组,却不知道这些组的名称是什么。
解决方案:SECOS(“语义翻译器”)
作者创建了一个名为SECOS(面向开放世界半监督学习的语义捕获)的新系统。SECOS 不再仅仅猜测数字,而是充当一个翻译器,直接将图片与文字连接起来。
以下是 SECOS 的工作原理,分为三个简单步骤:
1. “自信猜测”(新类别语义补偿)
由于学生没有新动物的教科书,SECOS 利用一位超级智能的预训练老师(一个已经了解世界的庞大 AI)来快速浏览这些未解照片。
- 老师说:“我有 90% 的把握这看起来像袋鼠。”
- SECOS 仅选取老师非常自信的照片,为新动物创建一本迷你教科书。这平衡了学习过程,使学生不会仅仅忽略新动物。
2. “双重检查”(批次级语义重捕获)
有时,一张照片很棘手。它是狗还是狼?
- SECOS 一次性查看整批照片。它检查两件事:
- 这张照片看起来像某种特定动物吗?(实例到类别)
- 该批次中的其他照片看起来也像这种动物吗?(类别到实例)
- 如果一张照片通过了这两项检查(例如,它看起来像袋鼠,且组内其他照片看起来也像袋鼠),SECOS 就会给它颁发“金星”并赋予一个可靠的标签。这过滤掉了令人困惑的、模糊的猜测,只保留清晰、高质量的示例。
3. “桥梁”(用于语义特征对齐的适配器)
现在,学生拥有一堆图片和一堆名称,但它们说着不同的语言(像素 vs. 文字)。
- SECOS 在大脑的图片部分和文字部分之间构建了一座特殊桥梁(称为适配器)。
- 这座桥梁学会了说:“当我看到这些特定的像素模式时,它意味着‘袋鼠’这个词。”
- 关键在于,这座桥梁允许模型直接输出单词“袋鼠”,而不是像“类别 5"这样的随机数字。
为什么这很重要
该论文声称,SECOS 是首个真正解决“严谨分类”问题的方法。
- 无需重排:它不需要在测试后重新排列答案以获得高分。它能在第一次尝试中就获得正确的名称。
- 更好的结果:即使与那些被允许使用“抢椅子”技巧(匈牙利匹配)来提升分数的旧方法相比,SECOS 仍然以显著优势(高达 5.4%)击败它们。
- 面向现实世界:因为它预测的是实际名称,所以它适用于那些无法事后修正标签的真实场景。
核心结论
可以将旧方法想象成一个能将一堆混乱的玩具整理成整齐堆叠,却无法告诉你这些玩具叫什么名字的学生。SECOS 则是一个既能整理玩具,又能立即大声喊出正确名称(“球!”、“泰迪熊!”、“机器人!”)的学生,无需作弊条或二次猜测。它通过利用一位聪明的老师来填补空白,并利用一座特殊桥梁将图片与文字连接起来,从而实现了这一目标。
以下是论文《SECOS:面向开放世界半监督学习的严格分类语义捕获》的详细技术总结。
1. 问题定义:开放世界半监督学习(OWSSL)中的差距
背景:
开放世界半监督学习(OWSSL),也称为广义类发现(GCD),涉及利用来自“已知”类别的标注数据,以及包含“已知”和“新颖”(先前未见)类别的未标注数据来训练模型。
核心局限:
现有的 OWSSL 方法无法执行严格分类(RC-OWSSL)。
- 缺乏语义基础: 现有方法过度关注视觉特征聚类,而忽略了将视觉特征与语言意义联系起来的潜在语义信息。
- 事后匹配依赖: 在评估过程中,现有方法依赖匈牙利匹配(Hungarian matching)将预测的聚类 ID 与真实类别名称对齐。这是一个后处理步骤,通过重新分配标签以最大化重叠来人为地提高准确率,而不管模型是否真正学到了正确的语义对应关系。
- 实际不可行性: 在现实部署中,无法获得用于匈牙利匹配的标注测试集。因此,现有方法无法直接预测新颖样本的正确文本标签(例如“狗”或“猫”);它们仅输出聚类索引。
目标:
本文定义了RC-OWSSL,即模型必须直接从候选集(已知 + 新颖)中预测语义最相关的文本标签,而无需任何事后标签重分配。
2. 方法论:SECOS 框架
作者提出了SECOS(面向开放世界半监督学习的语义捕获),这是一个利用外部知识(CLIP)来弥合视觉特征与文本语义之间差距的框架。SECOS 包含三个核心模块:
A. 新颖类语义补偿(全局层面)
- 问题: 监督严重不平衡;已知类别有标签,而新颖类别没有,导致对已知类别产生强烈偏差。
- 解决方案: 构建全局伪标注新颖数据集(DN)。
- 冻结的“教师”CLIP 模型为未标注数据分配硬伪标签。
- 根据这些伪标签对样本进行分组。
- 选择每个新颖类中置信度最高的前 ϕ% 样本以形成 DN。
- 语义增强: 大型语言模型(LLM)为类名生成描述性提示,以创建更丰富的语义表示,用于优化伪标签过程。
- 结果: 这在全局范围内平衡了已知类和新颖类之间的监督强度。
B. 批次语义重捕获(局部/实例层面)
- 问题: 全局补偿是粗粒度的;它忽略了特定批次和已知类别内部的细粒度语义细微差别。
- 解决方案: 对未标注数据批次(B)应用双视角置信度过滤机制。
- 实例内: 对于特定样本,累积各类别的置信度分数,直到达到阈值(τ)。
- 实例间: 对于特定类别,根据批次中所有样本的置信度分布确定阈值(θ)。
- 选择: 仅当样本同时满足这两个标准,且候选标签的交集恰好产生一个标签时,该样本才被选为高质量的伪标注实例。
- 结果: 这过滤掉了模糊样本,捕获了细粒度语义信息,提供了高精度的监督信号。
C. 用于语义特征对齐的适配器
- 问题: 即使有了伪标签,模型仍需将其视觉特征空间与文本标签的语义空间对齐,以执行直接分类。
- 解决方案: 在冻结的 CLIP 视觉编码器中插入轻量级**适配器(Adapter)**机制。
- 架构: 并行适配器插入到视觉编码器的注意力块之后。文本编码器保持冻结。
- 对齐: 模型计算经过适配器处理的视觉特征与候选文本标签的语义特征(由类描述生成)之间的相似度。
- 训练: 仅更新适配器和投影器的参数。损失函数是预测 Logit 与伪标签(或真实标签)之间的标准交叉熵损失。
- 结果: 模型学习将视觉输入直接映射到文本标签,从而在不使用匈牙利匹配的情况下实现严格分类。
3. 主要贡献
- RC-OWSSL 的定义: 本文正式指出了现有 OWSSL(聚类)与实际严格分类需求(直接文本预测)之间的内在偏差,强调了现有方法未能实现语义基础的缺陷。
- SECOS 框架: 提出了一种新颖框架,利用外部知识(CLIP + LLM)提取和对齐语义表示。它通过全局补偿和批次重捕获,独特地解决了新颖类缺乏监督的问题。
- 卓越性能: 证明了 SECOS 优于最先进(SOTA)方法,即使那些方法是在宽松的“事后匹配”设置下评估的,而 SECOS 则在更严格的“直接分类”设置下运行。
4. 实验结果
数据集:
在 7 个数据集上进行了评估:3 个通用数据集(CIFAR-10、CIFAR-100、ImageNet-100)和 4 个细粒度数据集(CUB、Stanford Cars、Oxford Flowers、Oxford Pets)。
性能亮点:
- 直接比较: 尽管 SECOS 未使用匈牙利匹配,但其性能仍显著优于 SOTA 方法(如 TextGCD、TP-OWSSL、SimGCD)。
- 定量提升:
- 在通用数据集上,与现有最佳方法相比,SECOS 将新颖类准确率提高了高达7.37%,整体准确率提高了5.35%。
- 在细粒度数据集上,相比 TP-OWSSL,新颖类和整体准确率分别提升了1.78%和1.95%。
- 总体而言,在严格分类指标上,SECOS 超越现有方法高达5.4%。
- 消融研究:
- 移除全局补偿或批次重捕获模块中的任何一个都会导致新颖类准确率急剧下降(例如,在 CIFAR-100 上,没有任何语义捕获时,准确率从 82.6% 降至 14.4%)。
- 该方法对批次大小变化和适配器下采样维度具有鲁棒性。
- 自学习: 即使没有单独的“教师”模型(使用 EMA 更新的“学生”模型),SECOS 也能有效运行,性能仅轻微下降(约 0.83%),同时仍优于依赖教师的基线方法。
5. 意义与影响
- 范式转变: 本文挑战社区从基于“聚类”的评估(匈牙利匹配)转向基于“分类”的评估,这是现实部署中唯一可行的方法,因为在现实场景中,新颖类别的真实标签是未知的。
- 语义基础: 它确立了成功的 OWSSL 需要视觉结构与语言语义之间的显式对齐,而不仅仅是视觉特征聚类。
- 实际适用性: 通过实现直接文本预测,SECOS 使开放世界学习适用于现实场景(如自动驾驶、医疗诊断),在这些场景中,模型必须在不重新标注测试集的情况下即时识别并命名新类别。
- 效率: 轻量级适配器的使用使模型能够利用强大的预训练 CLIP 知识,而无需全量微调的计算成本。
总之,SECOS通过引入一种“捕获”潜在语义的机制,解决了开放世界学习中的关键瓶颈,使模型能够直接将新颖对象严格分类到其正确的文本类别中。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。