← 最新论文
💻 computer science

CRoFT: Robust Fine-Tuning with Concurrent Optimization for OOD Generalization and Open-Set OOD Detection

本文提出了 CRoFT,这是一个用于视觉 - 语言预训练模型的统一微调框架,它通过最小化能量分数的梯度幅值以实现域一致的 Hessian 矩阵,从而同时优化分布外泛化能力和开放集检测能力。

原作者: Lin Zhu, Yifeng Yang, Qinying Gu, Xinbing Wang, Chenghu Zhou, Nanyang Ye

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Lin Zhu, Yifeng Yang, Qinying Gu, Xinbing Wang, Chenghu Zhou, Nanyang Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明、博览群书的图书管理员,名叫CLIP。这位管理员读过数百万本书,看过数百万张图片。因此,他们极其擅长识别曾经见过的东西,比如“狗”或“汽车”,即使图片有点模糊或拍摄角度怪异。

然而,现实世界是混乱的。有时,当你请这位管理员帮你整理新照片时,他们会面临两个具体问题:

  1. “风格偏移”问题(协变量偏移): 你给管理员看一张狗的图片,但它是素描风格,或者是黑白照片,或者是在雨中拍摄的。管理员知道那是狗,但因为风格与他们学习过的书籍截然不同,他们感到困惑,可能会说:“我不确定。”
  2. “未知动物”问题(开放集分布外检测): 你给管理员看一张熊猫的图片。他们在训练书籍中从未见过熊猫。他们不会说“我不知道这是什么”,而是试图将其强行归入他们已知的类别,比如:“哦,那一定是只熊!”或者“那是只狗!”这很危险,因为系统会自信地犯错。

大多数以前的方法试图解决其中一个问题,却破坏了另一个。如果你教管理员更好地处理素描,他们识别未知动物的能力可能会变差。如果你教他们识别未知动物,他们可能会忘记如何处理素描。

解决方案:CRoFT(“双重检查”图书管理员)

这篇论文介绍了一种名为CRoFT的新方法。将 CRoFT 想象成一个特殊的培训项目,它教导管理员同时这两件事而不感到困惑。

以下是其工作原理,使用简单的类比:

1. “能量分数”(置信度计)

论文使用了一个名为“能量分数”的概念。想象管理员每次看一张图片时,都有一个“置信度计”。

  • 低能量: “我非常确信这是一只狗。”
  • 高能量: “这感觉不对劲。我不确定。”

目标是对管理员已知的事物(狗)让计量表显示能量,对他们未知的事物(熊猫)显示能量。

2. 秘密技巧:“抚平山丘”

作者发现了一个巧妙的数学技巧。他们意识到,如果你教导管理员使其“置信度计”非常稳定(在数学上,这意味着最小化“梯度幅值”或使“海森矩阵”保持一致),就会同时发生两件神奇的事情:

  • 技巧 A: 管理员在识别“怪异”图片(开放集检测)方面变得更强。对于熊猫,计量表会清晰地飙升。
  • 技巧 B: 管理员对风格变化(分布外泛化)变得更加稳健。因为他们对世界的内部“地图”更平滑、更一致,所以狗的素描在他们看来仍然像狗。

这就像教导一名徒步者走在平坦、平滑的小径上。如果小径是平坦的,他们就不会被小石头(风格变化)绊倒,同时也能够清楚地看到悬崖边缘是否即将到来(未知动物)。

3. “对抗性训练”(压力测试)

为了确保管理员真正为现实世界做好准备,CRoFT 创建了一个“压力测试”。

  • 想象管理员正在研究一张狗的照片。
  • CRoFT 生成该照片的一个“幻觉”版本,该版本略有失真(如非常糟糕的素描或奇怪的滤镜),但看起来仍然像狗。
  • 然后强制管理员练习识别这张“糟糕”的照片。
  • 通过在这些“最坏情况”下练习,管理员变得超级坚韧。他们学会了,即使照片看起来很奇怪,狗的概念依然存在。

结果

论文声称,通过使用这种“双重检查”方法(抚平能量景观 + 压力测试),管理员(AI 模型)变得:

  1. 更擅长发现未知: 它不再猜测熊猫是狗。它会说:“我不认识这个。”
  2. 更擅长处理怪异风格: 它识别狗的素描与识别狗的照片一样好。

在他们的测试中,这种方法显著优于以前的方法。它将识别未知动物的能力提高了多达20%,并减少了模型因风格变化而困惑的次数。

简而言之: CRoFT 是一种训练方法,它教导 AI 模型既灵活(处理不同风格)又诚实(承认看到从未见过的东西),这一切都是通过平滑模型“思考”世界的方式来实现的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →