← 最新论文
💻 computer science

PRiSM: Prototype Regularization for Few-Shot VLMs

本文介绍了 PRiSM,这是一种无需训练的原型正则化方法,它具有一种新颖的多项损失函数和高效的极大化-极小化(Majorize-Minimize)优化器,显著提高了少样本视觉-语言模型在面对类别不平衡和类别数量变化等当前最先进方法无法应对的现实挑战时的鲁棒性。

原作者: Ghassen Baklouti, Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Ghassen Baklouti, Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人识别动物。你不想花上数年时间喂给它数百万张图片;相反,你希望在只展示几个关于新生物(比如“毛绒球”)的例子后,它就能理解并识别出剩下的部分。这就是**视觉-语言模型(Vision-Language Models, VLMs)**的世界。把这些模型想象成一个巨大的图书馆,其中的图片和文字已经分类存储在一个共享的文件系统中。机器人知道“狗”这个词和一张狗的照片都住在同一个图书馆社区里。

通常,为了教机器人学一个新技巧,科学家们会使用一种叫做**少样本学习(few-shot learning)**的方法。他们给机器人一个微小的“支持集”——仅仅几张特定动物的有标签示例(例如 4 张或 16 张特定动物的照片)——并要求它调整其内部地图,以便在新的、未见过的照片中识别出该动物。长期以来,科学家们使用一种非常整洁、有序的设置来测试这些方法:他们确保测试中的每种动物都有完全相同数量的示例。这就像一个教室,每个学生都恰好举手了一次。但在现实世界中,生活是混乱的。有些动物随处可见(如鸽子),而有些则很罕见(如雪豹)。这篇论文提出了一个简单但至关重要的问题:当我们不再假装世界是完美平衡的,而是开始向机器人喂食现实世界中那种混乱、不均匀的数据时,机器人的大脑会发生什么变化?

问题所在:“多数派投票”陷阱

来自蒙特利尔 ÉTS 的研究团队发现,我们目前的机器人老师其实出人意料地脆弱。他们发现,当你把这些模型应用于现实数据(即某些类别很常见,而另一些类别很罕见)时,模型会开始表现得极其糟糕。事实上,他们发现了一个奇怪的悖论:给机器人更多的例子反而会让它变得更糟。

想象一下,你正在尝试学习一所学校所有学生的姓名。如果你只能见到 4 个学生,而其中 3 个属于同一个受欢迎的小圈子,你可能会开始认为学校里的每个人看起来都像那个小圈子的人。如果你随后遇到了 16 个学生,而其中 15 个仍然属于那个相同的小圈子,你的困惑会变得更加严重。你太过于熟练地掌握了“多数派”,以至于你完全忘记了如何识别“少数派”。

论文显示,目前的“无需训练”(training-free)方法(本应是聪明且高效的)都掉进了这个陷阱。它们依赖于一个“原型”(prototype)——即一个类别的心理平均值。当数据不平衡时,这个心理平均值会被拉向多数派类别,从而模糊了不同动物之间的界限。你添加的数据越多,这种“拉力”就越强,导致机器人将罕见动物误认为是常见动物。

解决方案:PRiSM(“公平教练”)

为了解决这个问题,作者引入了一个名为 PRiSM(用于少样本视觉-语言模型的原型正则化)的新工具。你可以把 PRiSM 想象成一位严格但公正的教练,在机器人完成第一次尝试后介入。

以下是 PRiSM 如何工作的,我们用操场类比:

  1. 初始的混乱: 机器人观察它拥有的几张图片,并在每个动物所属的位置画出一张“心理地图”。因为常见动物的图片太多,地图变得扭曲且混乱;罕见动物被挤到了边缘。
  2. 教练的干预: PRiSM 并不会丢弃机器人的工作。相反,它应用一套规则(一个“正则化器”)来整理这张地图。
    • 规则 1(保持真实): “不要离你所看到的太远。” 它让机器人新的猜测保持在它所看到的实际图片附近。
    • 规则 2(尊重原始知识): “不要忘记你已经知道的东西。” 它确保机器人不会完全忘记其原始的、预训练的知识。
    • 规则 3 (保持距离): “确保各组之间不要重叠。” 这是最重要的一部分。PRiSM 会主动将不同动物的“心理簇”推开。如果机器人因为训练集中有太多的“狗”而把“猫”和“狗”搞混了,PRiSM 会在物理层面上将“猫”的簇从“狗”的簇中推开,从而在它们之间创造出清晰的空间。

团队还发明了一种特殊的、超快速的数学技巧(称为块主极大化极小优化器/block Majorize-Minimize optimizer)来进行这项清理工作。这就像拥有一个 GPS,能够瞬间计算出完美的行驶速度,而不需要先通过测试不同的速度。这使得整个过程极其快速且高效,不需要额外的“测试”数据来调整设置。

他们的发现

结果令人惊讶且充满力量。作者在 10 个不同的数据集上测试了 PRiSM,涵盖了从识别花卉、汽车到识别纹理和场景的范围。

  • “更多数据”悖论得到证实: 在他们现实且不平衡的测试中,他们观察到标准方法(如 Tip-Adapter 和 APE)在将训练样本数从 2 个增加到 16 个时,表现实际上变得更差了。例如,在某些数据集上,增加图片数量导致准确率下降了超过 30%。
  • 神奇的修复: 当他们在这些失败的方法之上添加 PRiSM 时,准确率飙升。在最极端的失衡情况下,PRiSM 将一个失败的系统变成了顶尖的表现者。例如,在某个存在严重失衡的数据集上,PRiSM 将某种方法的准确率提升了超过 40 个百分点(从大约 21% 跳升至 60% 以上)。
  • 它无处不在: PRiSM 不仅仅是针对弱模型的补丁。它甚至帮助现有的最强方法(如 ProKeR)实现了性能的进一步提升,这证明了问题不在于机器人的大脑,而在于类别排列的方式。

作者指出,这些模型在现实世界中失败的主要原因并不是它们不够聪明,而是我们测试它们的方式(假设完美平衡)掩盖了一个关键缺陷:原型偏差(prototype bias)。当数据不均匀时,机器人的“心理平均值”会发生偏移,而 PRiSM 正是将其纠正的工具。

为什么这很重要

这篇论文表明,为了让 AI 在现实世界中真正发挥作用,我们需要停止在“完美的教室”里测试它,而应该开始在“混乱的操场”里测试它。通过引入一个模拟现实世界不平衡情况的基准测试,以及一个能够修复由此产生的混乱的工具(PRiSM),作者展示了我们可以构建出足够鲁棒的 AI,使其能够处理我们每天都会遇到的不均匀的数据分布。他们不仅找到了一种改进机器人调优的方法,还找到了一种让机器人变得更公平的方法,确保它能同时关注到稀有和常见的物种。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →