From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model
本文提出了 \algname,这是一个统一的视觉-语言模型测试时自适应(Test-Time Adaptation)框架,它通过将零样本分类建模为 Wasserstein 最优传输问题来生成鲁棒的伪标签,从而将推理与自适应衔接起来,并利用在理论上对齐的 InfoNCE 对比损失,在分布偏移下实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的世界里,计算机已经学会了以惊人的流利度进行视觉观察和文本阅读。被称为视觉-语言模型的系统可以观察一张照片并进行描述,或者阅读一个句子并找到匹配的图像,而无需针对该特定任务进行显式教学。它们通过学习将图片和文字转化为一种共享的数学语言来实现这一点——这是一个共同的空间,在那里,一张猫的照片和“猫”这个词紧挨在一起。这种能力使它们能够识别从未见过的物体,这种技能被称为零样本学习(zero-shot learning)。然而,这些模型是脆弱的。当现实世界发生变化时——例如照片模糊、拍摄于恶劣天气或受到数字噪声干扰时——这种共享语言就会崩溃。图像与单词之间的联系会变得松散,模型的置信度也会随之瓦解,从而导致在自动驾驶或医疗诊断等关键应用中产生危险的错误。
研究人员曾试图通过让模型在工作时进行即时学习来解决这个问题,这一过程被称为测试时自适应(test-time adaptation)。其核心思想很简单:随着模型遇到新的、混乱的图像,它应该调整其内部设置以理解这些图像。但以往的尝试都受挫于一个根本性的问题。为了学习,模型需要知道它正在看什么,但在这些现实场景中,没有人提供正确答案。模型必须猜测自己的标签,而这些猜测往往是错误的。当模型试图从自己错误的猜测中学习时,它会放大噪声,使情况变得更糟。此外,旧的方法试图通过观察宏观类别来平滑这些误差,将组内的每张图像视为同类。这种粗略的方法忽略了单张图片的独特细节,阻碍了模型真正理解特定图像与其描述之间关系的可能。
现在,一组研究人员提出了一种解决此问题的新方法,他们称之为 ORIGIN。与其依赖模型原始的、往往是混乱的猜测,他们将该问题视为一个必须用全局逻辑来解决的匹配游戏。想象一下,一个房间里坐满了人,另一个房间里坐满了名字;目标是将每个人与正确的名字配对。如果你只看每个个体,你可能会犯错。但如果你同时观察整个房间,你可以利用“每个名字必须被使用且仅使用一次”这一事实来纠正你的错误。研究人员使用一种称为最优传输(optimal transport)的数学框架来实现这一点。它迫使模型同时观察整批图像和文本描述,寻找最符合逻辑的配对方式。这种全局视角过滤掉了噪声,并产生了关于图像内容更可靠的猜测。
一旦模型拥有了这些可靠的猜测,它就会利用它们来自我教学。研究人员发现,学习这些新的、多噪图像的最佳方式是使用一种在很大程度上模仿模型最初训练方式的方法。他们引导模型调整其内部设置,使得它正在观察的特定图像在那个共享的数学空间中向其正确的描述靠近,同时远离错误的描述。这是一种细粒度的方法;它关注每一张图片的独特细节,而不是仅仅关注某个组的平均水平。通过这样做,模型学会了重新调整自身以适应变化的世界,即使在图像受损的情况下也能恢复清晰的视觉能力。
这种新方法的精妙之处在于它统一了两个此前被视为截然不同的步骤。研究人员表明,用于生成初始猜测的逻辑与用于学习这些猜测的逻辑实际上是同一枚硬币的两面。寻找最佳匹配对的方法在数学上与教导模型改进的方法是完全一致的。这意味着猜测的过程与学习的过程并不是在互相博弈,而是在互相成就。更好的猜测带来了更好的学习,而更好的学习则带来了更准确的未来猜测。这创造了一个持续改进的循环,使模型随着每一步的迭代而变得更加聪明和稳健。
在通过故意加入噪声、模糊和天气效应来扭曲图像的标准基准测试中,这种新方法被证明比以往任何方法都有效得多。在一个小型、低分辨率图像的数据集上,与现有最先进的方法相比,它将模型的准确率提高了多达 7.4%。在一个包含更复杂图像的大型数据集中,它依然大幅领先于竞争对手。或许同样重要的是,它并没有减慢系统的速度。寻找最佳匹配所需的额外计算非常高效,几乎没有增加任何延迟。模型可以实时进行自适应,在保持高性能的同时跟上数据流的速度。
研究人员还通过拆解系统的不同部分,探索了为什么这种方法如此奏效。他们发现,使用全局匹配逻辑来生成初始猜测至关重要;如果没有它,模型很难从噪声数据中学习。他们还发现,使用专注于单个图像-文本对的细粒度学习方法,远优于仅关注宏观类别的旧方法。当他们将这两个元素结合起来时,结果始终是最好的。该系统不仅在分布偏移中生存了下来,而且在其中蓬勃发展,证明了通过将模型的思考方式与学习方式相统一,我们可以构建出真正能够应对现实世界多变且不可预测性的智能系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。