← 最新论文
💻 computer science

SECOS: Semantic Capture for Rigorous Classification in Open-World Semi-Supervised Learning

本文介绍了 SECOS,这是一种新颖的开放世界半监督学习方法,它利用外部知识提取并对齐语义表示,使模型能够直接为已知类别和新颖类别预测语义相关的文本标签而无需后处理,从而超越现有方法。

原作者: Hezhao Liu, Jiacheng Yang, Junlong Gao, Mengke Li, Yiqun Zhang, Shreyank N Gowda, Yang Lu

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Hezhao Liu, Jiacheng Yang, Junlong Gao, Mengke Li, Yiqun Zhang, Shreyank N Gowda, Yang Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在运营一所针对新型动物分类的学校。你拥有一本教科书,里面有你已知动物的图片和名称(例如)。然而,你同时也有一大堆来自野生动物园的未解照片。这些照片中有些是你已知的动物,但许多是全新的、未知的动物(例如水母袋鼠),它们并不在你的教科书中。

你的目标是教导一名学生(即 AI 模型),使其能够查看任何照片并立即说出:“那是狗”、“那是袋鼠”或“那是水母”,使用主列表中的正确名称。

问题:旧方法的“猜谜游戏”

以往的方法试图解决这一问题,但它们玩的是一个被操纵的游戏。

  • 训练阶段:它们过于专注于已知动物(教科书)的视觉细节,从而忽略了那些未解动物。
  • 测试阶段:当学生看到一张袋鼠的照片时,他们可能会猜测“动物 #3"。由于老师不知道“动物 #3"意味着什么,他们使用了一种称为匈牙利匹配的技巧。这就像一场“抢椅子”游戏,在测试结束后,你重新排列答案以使分数看起来完美。
    • 示例:学生将袋鼠的照片猜测为“动物 #3"。老师说:“好吧,让我们假装‘动物 #3'实际上意味着‘袋鼠’。”
    • 缺陷:在现实世界中,你无法在事后重新排列答案。你需要学生立即知道实际名称(“袋鼠”)。旧方法本质上是在将动物聚类成组,却不知道这些组的名称是什么。

解决方案:SECOS(“语义翻译器”)

作者创建了一个名为SECOS(面向开放世界半监督学习的语义捕获)的新系统。SECOS 不再仅仅猜测数字,而是充当一个翻译器,直接将图片与文字连接起来。

以下是 SECOS 的工作原理,分为三个简单步骤:

1. “自信猜测”(新类别语义补偿)

由于学生没有新动物的教科书,SECOS 利用一位超级智能的预训练老师(一个已经了解世界的庞大 AI)来快速浏览这些未解照片。

  • 老师说:“我有 90% 的把握这看起来像袋鼠。”
  • SECOS 仅选取老师非常自信的照片,为新动物创建一本迷你教科书。这平衡了学习过程,使学生不会仅仅忽略新动物。

2. “双重检查”(批次级语义重捕获)

有时,一张照片很棘手。它是狗还是狼?

  • SECOS 一次性查看整批照片。它检查两件事:
    1. 这张照片看起来像某种特定动物吗?(实例到类别)
    2. 该批次中的其他照片看起来也像这种动物吗?(类别到实例)
  • 如果一张照片通过了这两项检查(例如,它看起来像袋鼠,且组内其他照片看起来也像袋鼠),SECOS 就会给它颁发“金星”并赋予一个可靠的标签。这过滤掉了令人困惑的、模糊的猜测,只保留清晰、高质量的示例。

3. “桥梁”(用于语义特征对齐的适配器)

现在,学生拥有一堆图片和一堆名称,但它们说着不同的语言(像素 vs. 文字)。

  • SECOS 在大脑的图片部分和文字部分之间构建了一座特殊桥梁(称为适配器)。
  • 这座桥梁学会了说:“当我看到这些特定的像素模式时,它意味着‘袋鼠’这个词。”
  • 关键在于,这座桥梁允许模型直接输出单词“袋鼠”,而不是像“类别 5"这样的随机数字。

为什么这很重要

该论文声称,SECOS 是首个真正解决“严谨分类”问题的方法。

  • 无需重排:它不需要在测试后重新排列答案以获得高分。它能在第一次尝试中就获得正确的名称。
  • 更好的结果:即使与那些被允许使用“抢椅子”技巧(匈牙利匹配)来提升分数的旧方法相比,SECOS 仍然以显著优势(高达 5.4%)击败它们。
  • 面向现实世界:因为它预测的是实际名称,所以它适用于那些无法事后修正标签的真实场景。

核心结论

可以将旧方法想象成一个能将一堆混乱的玩具整理成整齐堆叠,却无法告诉你这些玩具叫什么名字的学生。SECOS 则是一个既能整理玩具,又能立即大声喊出正确名称(“球!”、“泰迪熊!”、“机器人!”)的学生,无需作弊条或二次猜测。它通过利用一位聪明的老师来填补空白,并利用一座特殊桥梁将图片与文字连接起来,从而实现了这一目标。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →