← 最新论文
🤖 machine learning

ΔEnergy\Delta \mathrm{Energy}: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization

本文介绍了Δ\DeltaEnergy,这是一种受视觉 - 语言对齐过程中的能量变化启发的新颖分布外(OOD)评分,以及一个相应的微调框架(EBM),该框架能同时提升视觉 - 语言模型的分布外检测能力和泛化能力,从而在现有方法的基础上实现显著的性能提升。

原作者: Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明、见多识广的向导(一个视觉 - 语言模型),它从海量的书籍和照片库中学习,能够识别成千上万种物体。这位向导非常擅长识别它曾经见过的东西,比如“金毛寻回犬”或“红色跑车”。

然而,当这位向导走进现实世界时,它会面临两个棘手的情况:

  1. “变装”问题(协变量偏移): 它看到一只金毛寻回犬,但这只狗是素描画出来的,或者是雨中拍摄的照片,或者是一幅油画。狗还是那只狗,但风格变了。向导可能会感到困惑,心想:“这还是一只狗吗?”
  2. “外星”问题(语义偏移): 它看到一种全新的生物,比如一只“闪闪发光的独角兽”,这种生物从未出现在它的训练库中。向导需要意识到:“我不知道这是什么”,而不是自信地猜测:“那是一匹马!”

这篇论文介绍了一种名为Δ\DeltaEnergy(Delta Energy,即 Delta 能量)的新方法,以及一种名为EBM的训练技术,旨在帮助向导同时应对这两个问题。

核心理念:“沉默”测试

要理解其工作原理,想象向导正在观察一张图片,并大声喊出它对不同标签的置信度。

  • 如果它看到一张狗的照片,它可能会大喊:“狗!(99% 置信度)猫!(1%)鸟!(0.1%)。”
  • 如果它看到一只“闪闪发光的独角兽”,它可能会大喊:“马!(40%)猫!(30%)狗!(20%)。”它感到困惑,将赌注分散到了各处。

Δ\DeltaEnergy 技巧:
研究人员要求向导做一个奇怪的实验:“如果我强迫你对你最可能的猜测保持完全沉默,会发生什么?”

他们取向导的最可能猜测(例如“狗”),将其置信度设为零。然后问道:“好吧,既然你不能说‘狗’了,你的整体‘能量’(或总置信度)会下降多少?”

  • 对于真实的狗(分布内数据): 向导非常确定那是只狗。当你让那个答案沉默时,向导会惊慌失措。它的总置信度会崩溃。能量的“下降”幅度巨大
  • 对于外星/未知物体(分布外数据): 向导原本就不确定,将赌注分散在许多选项上。让最可能的猜测沉默并不会改变太多,因为它并不仅仅依赖一个答案。能量的“下降”幅度很小

通过测量这种能量变化Δ\DeltaEnergy),系统可以轻松区分“风格奇特的狗”(大幅下降)和“完全陌生的生物”(小幅下降)。

训练升级:EBM(能量边界最大化)

知道如何区分差异固然很好,但论文还教导向导在学习过程中如何变得更强。

他们引入了一条名为EBM的训练规则。想象向导正在研究一张狗的照片。

  1. 向导观察整张照片。
  2. 然后,研究人员在照片的一部分上盖上一个“遮罩”(比如遮住狗的脸或背景),并让向导再次观察。
  3. 目标是训练向导,使其即使在有遮罩的情况下,感受到的“能量”变化仍与观察完整照片时相同。

隐喻:
这就像学习识别朋友的声音。

  • 旧方法: 你在安静的房间里完美地记住了他们的声音。如果他们在嘈杂的咖啡馆说话(协变量偏移),你可能认不出他们。
  • EBM 方法: 你练习在他们耳语、大喊或通过墙壁说话时识别他们。你学习的是他们声音的核心,而不仅仅是完美条件下的声音。

通过迫使模型在训练期间处理这些数据的“遮罩”或“裁剪”版本,它学会了能够抵御风格变化(如雨景或素描),同时仍能识别完全新的事物。

结果:一位超级可靠的向导

该论文在大规模数据集(如包含数千张图像的 ImageNet)上测试了这种方法。

  • 更好的检测能力: 与之前的方法相比,新方法在识别“外星”(未知物体)方面表现更好。在某些测试中,它将误报率降低了显著幅度(提高了 10%–25%)。
  • 更好的泛化能力: 它在识别“变装”狗(新风格中的物体)方面也变得更加出色,且没有忘记它们是什么。

总结

这篇论文提出了一个简单而有力的想法:测量当模型的最可能猜测被沉默时,其置信度发生了多大变化。

  • 如果置信度崩溃,那很可能是一个新风格下的已知物体。
  • 如果置信度保持稳定,那很可能是一个全新的物体。

随后,他们利用这一见解来训练模型,使其更加稳健,从而创建一个既能更好地充当侦探(发现未知事物),又能更好地充当通才(在新情境中识别已知事物)的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →