← 最新论文
🤖 machine learning

KALE: Kernel Alignment with Loss Equilibration for Stable CLIP-DINOv2 Alignment at Web Scale

本文介绍了 KALE,一种自适应损失均衡控制器,它通过动态重新缩放对齐项,克服了固定权重核对齐在噪声网络规模数据上的失效问题,从而实现了稳定的 CLIP-DINOv2 训练,在显著提升零样本性能的同时保留了文本编码器的兼容性。

原作者: Michał Pawłowicz

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Michał Pawłowicz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何观察世界。你有两位截然不同的老师。第一位,我们称之为“Chat”,他是一位语言专家,读遍了整个互联网。他非常擅长理解文字并将文字与图像联系起来,但如果你让他辨别某种特定叶子的细微差别或微妙的纹理,他可能会错过,因为他的注意力太集中在大局上了。第二位,“Vision”,是一位沉默的艺术家,他研究了数百万张图像,却从未读过一个字。他能看到每一个微小的细节、每一道阴影和每一个图案,但他无法用语言描述他所见之物。

长期以来,科学家们一直试图通过向 Chat 展示更多的图片来让他变得更好。但最近,他们尝试了一个不同的技巧:他们要求 Chat 模仿 Vision 的观察方式。他们想要将 Chat 理解语言的能力与 Vision 捕捉精细细节的能力融合在一起。当使用整洁、有序的图像库(比如博物馆目录)时,这个方法效果极佳。但当他们尝试在充满混乱、噪声且杂乱无章的真实互联网数据上进行同样的操作时,这个技巧失效了。机器人感到困惑,“模仿”的信号变得如此微弱以至于消失了,训练也因此停止了。这篇论文讲述了研究人员是如何修复这个混乱局面的,从而让机器人能够在不丢失说话能力的前提下,从混乱的互联网中学习。

问题所在:飓风中的耳语

研究人员最初使用了一种名为 KUEA 的方法,这就像一位严厉的老师告诉机器人:“模仿 Vision 的风格,但不要忘记你原本的声音。”在干净的数据集上,这运行得非常完美。但当他们尝试在一个名为 CC12M 的大规模、高噪声数据集(包含从网络抓取的 1200 万张图像)上进行实验时,奇怪的事情发生了。

想象一下,你正试图在站在一台轰鸣的喷气发动机旁边时,去听一段耳语(即要求模仿 Vision 的“对齐”指令)。在干净的数据集上,喷气发动机的声音很小,所以耳语清晰可见。但在嘈杂的网络数据上,喷气发动机变得异常响亮,以至于耳语被完全淹没了。数学计算显示,这段“耳语”对总噪声的贡献还不到 0.2%。它实际上已经处于失声状态。如果你在这个新数据上仍使用旧的指令(固定的权重),机器人就会忽略这位新老师,保持原样,不再学习任何新知识。

解决方案:KALE 控制器

为了解决这个问题,作者引入了一个名为 KALE(核对齐与损失均衡,Kernel Alignment with Loss Equilibration)的新系统。可以将 KALE 想象成一个超级智能的音量旋钮,它可以实时自动调节。

KALE 不仅仅是设定一次音量然后就置之不理,它会同时倾听耳语和轰鸣声。如果它听到耳语相对于轰鸣声变得太小声了,它就会调大耳语的音量。如果耳语变得太大声,开始盖过原本的声音,它就会调低音量。

结果非常显著。为了达到平衡,该系统将音量旋钮调高了大约 47,000 倍,才达到了旧设置的效果。一个固定的数值根本无法做到这一点;它需要一个能够对混乱数据做出反应的动态控制器。

结果:一种新型机器人

一旦开启 KALE 控制器并在 330 万张图像上训练机器人,结果令人印象深刻。这个新机器人不仅学会了更好地观察,还学会了以一种比以前更好的方式进行观察与表达。

  • 它保留了自己的声音: 机器人并没有失去理解文本或将图像与文字匹配的能力(图文检索)。
  • 它变得更敏锐了: 在标准的视觉任务测试中,机器人的“零样本”(zero-shot)性能(即在没有预先训练的情况下猜测所见物体的能力)在 11 项不同测试中平均提升了 +2.00%。这优于之前的最佳方法,后者仅提升了 +1.29%。
  • 它更擅长细节了: 在一项名为 SVTN(涉及阅读街标上的数字)的特定测试中,机器人的准确率跃升了 +5.73%,打破了纪录。

然而,作者在陈述观点时非常谨慎。他们指出,虽然某些测试结果非常稳固,但其他测试(如在复杂场景中计数物体)则有些“波动”,这意味着每次运行实验时结果都会略有变化。因此,他们将最终结论集中在那些稳定且一致的测试上。

细节说明:不仅仅是音量问题

论文还发现,仅仅调大音量是不够的,你还得小心驾驶。他们发现,机器人需要一个特定的“学习率”(学习的速度)才能正常工作。如果他们开得太快(学习率为 2×10⁻⁴),机器人就会崩溃,忘掉一切并变得毫无用处。如果他们开得太慢或者保持恒定速度,机器人也无法得到正确的学习。理想的方案是一个先快后慢、逐渐减速但永不完全停止的调度方案,从而保持机器人的稳定性。

这意味着什么

主要的启示是,你不能直接把一个在整洁、有序数据集上有效的方法,生搬硬套到混乱、嘈杂的互联网上。噪声改变了一切。通过发明一个不断重新平衡学习过程的控制器,作者使得利用野蛮、未经整理的网络数据来训练一个“语言-视觉”机器人成为可能。他们不仅仅是找到了一个更好的设置,而是找到了一种让训练过程足够稳定、足以在混沌中生存的方法,证明了只要拥有正确的“音量旋钮”,即使是最嘈杂的数据也能教会机器人以高清晰度观察世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →