想象一下,你正试图在一张照片中识别出一只猫,但一棵大树挡住了它的一半。标准的计算机视觉模型就像一个只是扫一眼照片、迅速形成看法并离开的人。如果猫的尾巴被遮住了,这个模型可能会感到困惑或做出错误的猜测,因为它无法“回头”去仔细观察,也无法询问:“等等,一只猫通常长什么样?”
这篇论文介绍了一种名为 PRISM 的新颖计算机“视觉”方式,它的工作原理更接近于人类在不确定时的思考方式。PRISM 不仅仅是进行一次快速的扫视,而是通过不断地组织、记忆和精炼的过程,直到它对答案充满信心。
以下是 PRISM 的工作原理,分为几个简单的步骤:
1. “分组”阶段(整理拼图碎片)
当 PRISM 观察图像时,它看到的不仅仅是杂乱的像素网格。它表现得像一名收集线索的侦探。它将相关的视觉部分组合在一起,放入“槽位”(slots)中。
- 类比: 想象你正在看一堆乱七八糟的乐高积木。你不是逐个观察每一块积木,而是迅速把所有的红积木放在一堆,蓝积木放在另一堆,把轮子放在第三堆。PRISM 通过将属于同一个物体(如“猫”、“树”或“汽车”)的像素组合成一个有组织的捆绑包来实现这一点。
2. “记忆”阶段(回想起蓝图)
这是 PRISM 聪明之处。如果“猫”的捆绑包因为树的遮挡而缺失了一半的碎片,普通模型只会根据它所见到的内容进行猜测。然而,PRISM 在训练过程中建立了一个完美的示例库(学习到的记忆)。
- 类比: 你脑海中有一本关于“完美的猫”从各个角度看是什么样子的相册。当你看到那只被遮挡了一半的猫时,PRISM 会说:“这看起来像一只猫,但它是不完整的。让我查一下我的相册。”它会在记忆中找到与它最匹配的图像——一张完整、清晰的猫的照片——并将其作为参考。
3. “精炼”阶段(填补空白)
PRISM 不仅仅停留在查看相册上。它将记忆中那个“完美的猫”的概念投影回杂乱的图像中,以填补缺失的部分。
- 类比: 这就像一位艺术家看到了一个缺了一只耳朵的素描。他们不仅仅是靠猜;他们会回忆起一只耳朵具体长什么样,把它画出来,然后退后一步检查是否合适。如果看起来还是有点不对劲,他们就会再来一次。PRISM 重复这个循环——组织、回想、精炼——多次。随着每一次循环,它“脑海”中的图像会变得更加清晰、完整。
4. “智能停止”(知道何时收手)
PRISM 的关键特性之一是它知道什么时候该停止思考。
- 类比: 如果你正在看一张清晰、阳光明媚的猫的照片,你只需要看一眼就能知道它是什么。但如果猫躲在灌木丛后面,你需要眯起眼睛,凑近一点,并深入思考。PRISM 也是如此。如果图像很简单,它会在一两次循环后停止以节省能量。如果图像很难或很杂乱,它会持续循环直到感到自信。这使得它在处理简单任务时既快速,在处理困难任务时又非常聪明。
为什么这很重要(根据论文所述)
作者在标准任务上测试了 PRISM,例如识别物体、在照片中寻找物体以及标注场景中的部分。他们发现:
- 它具有鲁棒性: 当图像的一部分被遮挡(occluded)或缺失时,PRISM 比其他模型更加准确。它不会在证据不完整时崩溃。
- 它很高效: 因为它在处理简单任务时会提前停止,所以不会浪费计算能力。
- 它具有灵活性: 无论任务是简单的(分类图片)还是复杂的(在人群中寻找特定物体),它都能很好地工作。
简而言之,PRISM 改变了计算机必须以单一、直线方式处理图像的概念。相反,它赋予了计算机一种“第二次思考”机制,使其能够利用记忆和重复来解决那些会让标准模型感到困惑的视觉谜题。
技术摘要:PRISM(通过迭代槽位记忆进行渐进式推理)
问题陈述
现代视觉模型通常通过单次前馈传递运行,仅计算一次视觉特征并将其传播至各层,而不会重新审视或细化中间表示。虽然这种架构在干净的基准测试中表现出色,但在现实场景中却难以应对,因为在这些场景中,由于遮挡或视觉证据缺失,观测结果往往是不完整的。在这种情况下,由于缺乏恢复缺失信息或解决歧义的机制,会导致表示脆弱且识别性能下降。此外,现有的以物体为中心的方法(例如 Slot Attention)通常保持纯粹的自下而上模式;它们仅根据现有证据来组织特征,无法在部分物体被遮挡时推断出完整的物体结构。相反,直接应用于密集特征标记(tokens)的基于原型的方法(例如 VQ-VAE)往往会受到纠缠输入的困扰,导致匹配歧义。
方法论
作者提出了 PRISM(Progressive Reasoning through Iterative Slot Memory,通过迭代槽位记忆进行渐进式推理),这是一种旨在模拟人类感知迭代特性的金字塔视觉架构。PRISM 将以物体为中心的分组与学习到的原型记忆相结合,以实现一个循环的“组织—召回—细化”(organize–recall–refine)过程。
架构概览
PRISM 是一个四阶段的特征金字塔。与每个阶段堆叠多个前馈块的传统骨干网络不同,PRISM 在每个阶段仅采用一个被循环应用的单块(Φs)。循环次数由基于输入复杂度的自适应计算时间(ACT)模块动态决定。
核心机制
在每个阶段内,循环函数 Φs 执行三个关键操作:
槽位注意力(组织):
视觉标记被竞争性地分组到固定数量的以物体为中心的“槽位”(slots)中。与标准的 Slot Attention 不同,PRISM 在键(keys)中引入了位置调制,使槽位能够同时捕捉语义内容和空间结构。这产生了结构化表示(vs,grp)和分组后的键(ks,grp),从而编码了“内容及其位置”的信息。
矢量量化记忆(召回):
分组后的槽位表示被映射到一个矢量量化(VQ)记忆空间中,该空间包含在干净图像上训练时获得的学习到的原型模式码本。
- 训练: 重建损失和承诺损失确保编码器将连续特征映射到离散原型,从而稳定码本。
- 推理: 当观测结果不完整(例如被遮挡)时,退化的槽位表示会与记忆中最近的原型进行匹配。这会检索出一个完整且连贯的模式,从而有效地根据学习到的先验知识“幻觉”出缺失的信息。
交叉注意力重分布(细化):
恢复后的槽位特征(基于原型的键和值)被重新分配回特征图上的原始空间位置。位置嵌入作为查询(queries)通过交叉注意力机制引导恢复后的特征到达正确的空间坐标。生成的特征随后通过带有残差连接的前馈网络(FFNs)进行更新,以供下一个循环步骤使用。
自适应停机
ACT 模块为每个阶段预测一个全局停机概率。如果累积概率超过阈值,则停止循环。这使得简单的输入可以提前终止(提高效率),同时为复杂或具有歧义的输入分配更多的推理步骤,起到隐式正则化的作用。
核心贡献
- 可恢复的表示范式: 本文引入了一个框架,在该框架中,视觉特征被组织成以物体为中心的抽象表示,并植根于学习到的原型空间。这使得从不完整的观测中重建连贯的表示成为可能。
- 循环、阶段式的自适应细化: PRISM 提出了一种机制,通过“组织—召回—细化”循环迭代地更新表示。循环次数是动态确定的,且所有标记在每一步都会进行联合更新。
- 增强鲁棒性的归纳偏置: 作者证明了将基于原型的恢复与动态循环细化相结合,能为视觉系统提供强大的归纳偏置。这实现了从单次前馈推理向“组织证据并召回原型”这一渐进过程的范式转变,从而提高了效率并提升了在遮挡情况下的鲁棒性。
实验结果
PRISM 在标准计算机视觉任务(ImageNet-1K 分类、MSCOCO 检测/分割、ADE20K 分割)的干净和遮挡条件下进行了评估。值得注意的是,模型是在没有遮挡图像的情况下进行训练的,仅在测试时评估遮挡情况,以衡量其分布外(OOD)的鲁棒性。
- 图像分类(ImageNet-1K): PRISM 在干净图像上的表现极具竞争力(Top-1 准确率 80.3%,以更少的参数超越了 PVTv2-B1 1.6%)。在严重遮挡(例如 80% 的补丁掩码)下,PRISM 显著优于基准模型,实现了 44.6% 的准确率,而 PVTv2-B1 为 39.6%,BiFormer-T 为 42.1%。
- 目标检测与分割(MSCOCO): 在具有遮挡物体(30% 和 50% 面积掩码)的 COCO 数据集上,PRISM 始终超越了基准模型。例如,在 50% 遮挡(M50)下,尽管使用的参数显著减少,PRISM 在 RetinaNet 上达到了 34.2 mAP,比 DaViT-T 高出 2.7 个点。
- 语义分割(ADE20K): PRISM 在干净(44.8)和遮挡(39.7)设置下均取得了最佳的平均交并比(mIoU),在随机补丁掩码下比 PVTv2-B1 高出 4.9 个点。
- 消融实验: 移除 VQ 记忆会导致遮挡情况下的性能大幅下降,证实了基于原型恢复的必要性。动态停机被证明比固定步数循环更有效,能够平衡鲁棒性与计算效率。
意义与主张
本文声称,PRISM 证明了利用结构化表示和记忆进行迭代推理是构建更具韧性和适应性的视觉模型的一个有前景的方向。通过将视觉推理视为一个并非单次变换,而是组织证据、召回学习到的原型以及细化内部状态的循环过程,PRISM 克服了前馈架构在处理不完整观测时的局限性。结果表明,这种方法提供了一种通用的架构原则,用于加强视觉识别能力,超越了特定任务的设计,特别是在视觉证据部分缺失或受损的场景下。作者指出,源代码和模型将会发布,以促进进一步的研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。