← 最新论文
🤖 machine learning

Beyond Flat Labels: Level-Restricted Contrastive Learning for Hierarchical Fine-Grained Vision Classification

本文提出了一种具有组平衡设计的层级限制对比学习框架,旨在解决层次化细粒度视觉分类中的分类学不一致问题,从而显著提升了在 iNaturalist 2021 等基准测试中多个层级的层次一致性和零样本准确率。

原作者: Zhiyuan Tao, Srikumar Sastry, Matthew J Thompson, Elizabeth G Campolongo, Net Zhang, Ziheng Zhang, Hilmar Lapp, Yu Su, Tanya Berger-Wolf, Nathan Jacobs, Wei-Lun Chao, Jianyang Gu

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiyuan Tao, Srikumar Sastry, Matthew J Thompson, Elizabeth G Campolongo, Net Zhang, Ziheng Zhang, Hilmar Lapp, Yu Su, Tanya Berger-Wolf, Nathan Jacobs, Wei-Lun Chao, Jianyang Gu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一台计算机识别照片中的动物。你给它看了一张狮子的照片。

在一个标准的“扁平化”学习系统中,计算机看到“狮子”这个词,并试图将其与图片进行匹配。但它同时也会看到“狼”、“老虎”和“植物”这些词。对计算机而言,“狼”和“植物”一样都是错误的答案,因为它们都不是“狮子”。

问题所在:“错误负例”之误
这篇论文指出这种逻辑中的一个缺陷。虽然狼不是狮子,但它们都是食肉动物。它们是动物家族树上的亲戚。如果计算机被告知“狼”对于狮子的图片是一个“坏答案”,它就会学会在大脑中将“狼”和“狮子”推得尽可能远。但随后,如果你要求它识别“食肉动物”这一类别,它会感到困惑,因为它被教导狮子和狼是完全不同的敌人,而不是亲戚。

这造成了**“家族树混乱”**。计算机可能正确猜出动物是“狮子”,但随后却无法猜出它属于“猫科”家族;或者它可能会猜成“狗”,因为它认为猫和狗太相似了。这就像一个学生记住了“苹果”和“橙子”是不同的,却无法意识到它们都是“水果”。

解决方案:“等级受限”的课堂
作者提出了一种新的教学方式,称之为等级受限对比学习(Level-Restricted Contrastive Learning)

想象一个由老师按细节等级组织课程的教室:

  1. 大局层面: 每个人学习区分“哺乳动物”、“鸟类”和“爬行动物”。
  2. 家族层面: 每个人学习区分“猫科”、“犬科”和“狼科”。
  3. 物种层面: 每个人学习区分“狮子”、“老虎”和“家猫”。

在这个新教室里,老师绝不会混淆这些等级

  • 在教授“家族”层面时,计算机仅将“狮子”与“老虎”和“家猫”进行比较。它不允许将“狮子”与“橡树”或“老鹰”进行比较。
  • 当教授“物种”层面时,它仅将“狮子”与其他的特定猫科动物进行比较。

通过让所有的比较都保持在“同一条赛道”内,计算机就不会感到困惑。它学会了狮子和老虎是不同的物种,但它们仍然是猫科动物。这防止了那种认为两个亲戚是敌人的“错误负例”错误。

“组均衡”型老师
论文还提到了一个“组均衡”设计。在普通的班级里,如果你有100张狮子的照片,而只有1张稀有狐狸的照片,老师可能会过度关注狮子而忽略狐狸。

这种新方法就像一位严格的老师,确保家族树的每个层级都能得到平等的关注。无论是宏观的“界”层面,还是微观的“物种”层面,计算机都会获得相同量的练习时间。这确保了它不仅能擅长猜测“动物”,也不会在猜测“狮子”时失败。

结果:更完美的家族树
研究人员在包含地球生命的大规模数据集(TreeOfLife-10M)和多个动物基准测试上对其进行了测试。

  • 一致性: 计算机变得更加具有一致性。如果它猜出了“狮子”,它几乎可以肯定也会猜出“猫科”和“哺乳动物”。不再有矛盾。
  • 准确性: 它不仅变得更一致,而且变得更聪明了。在一次主要的测试(iNaturalist 2021)中,他们的方法比之前的模型平均准确率提高了超过 30%
  • 视觉证明: 当他们观察计算机如何“看待”这些词汇时,新方法将它们组织成了整齐、有结构的集群(就像真实的家族树),而旧方法看起来则像是一堆杂乱无章、互不相关的词汇。

总结
论文认为,要教计算机理解复杂的层级结构(如生物学),你不能只是把所有标签扔进一个大桶里。你必须循序渐进、逐层教学,确保它理解每个特定深度的关系。通过这样做,计算机能够建立起一个更清晰、更准确且更一致的对自然界的理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →