← 最新论文
💻 computer science

Collapse of Patches: Ranking Image Patches for Efficient Visual Modeling

本文引入了受量子力学启发的“补丁塌缩”(patch collapse)概念,即观察某些图像补丁会降低其他补丁的不确定性,并提出了一种利用自动编码器和 PageRank 对补丁重要性进行排序的方法,从而显著提升掩码图像建模、自回归生成以及基于 Vision Transformer 的分类任务的效率。

原作者: Wei Guo, Shunqi Mao, Zhuonan Liang, Xuanhua Yin, Heng Wang, Weidong Cai

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Guo, Shunqi Mao, Zhuonan Liang, Xuanhua Yin, Heng Wang, Weidong Cai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

图像不仅仅是颜色的平铺集合;它们是复杂的结构,其中每一部分都依赖于其他部分来使其产生意义。如果你看一张鸟的照片,看到它的喙会立即告诉你关于它头部位置的信息,而这反过来又暗示了其身体应该在何处。这种相互依赖性意味着,理解图像的一个部分通常会降低对其余部分的确定性。构建计算机视觉系统的科学家们早已知道图像就是这样运作的,但大多数现代人工智能模型将图像中的每个小方块视为同等重要。它们假设图像的任何部分都可以以任何顺序进行学习或生成,就像读一本书,章节可以被重新排列而不丢失故事逻辑一样。这种方法虽然可行,但效率低下,迫使计算机浪费能量去处理那些几乎没有价值的背景细节,同时却难以把握定义主体的核心形状。

悉尼大学的一个研究小组提出了一种看待这一过程的不同方式。他们认为图像具有一种自然的优先级顺序,即观察或创建其组成部分时应遵循的特定序列。他们将这种现象称为“补丁坍缩”(patch collapse)。其核心思想是,当计算机观察图像中某个特定的、重要的部分时,剩余部分的确定性会剧烈缩小,类似于量子粒子在被测量后稳定到确定状态的过程。研究人员发现,并非图像的所有部分对这种稳定过程的贡献都是相等的。某些补丁,如公鸡的眼睛或汽车的车轮,起到了锚定的作用,约束了画面的其余部分;而另一些补丁,如天空或草地,则远不那么关键。通过找出哪些补丁最具影响力,该团队发现了一种让计算机更快、更准确地观察和生成图像的方法。

为了揭示这种隐藏的秩序,研究人员训练了一种特殊类型的人工智能,称为“坍缩掩码自编码器”(Collapse Masked Autoencoder)。想象一个试图在观察周围碎片的同时重建缺失拼图块的系统。研究人员教导这个系统去弄清楚哪些周围的碎片对于正确猜测缺失部分实际上是必要的。他们发现,该系统并没有平等对待所有的邻近碎片。相反,它学会了忽略那些琐碎的部分,转而密集地关注一小部分特定的、持有重建关键信息的补丁。随着时间的推移,系统形成了清晰的偏好,为某些补丁分配高重要性,而为另一些补丁分配低重要性。这一过程表明,对于图像中的任何给定部分,都存在一组与其联系最为紧密的其他部分。

通过绘制整个图像的这些关系图,研究人员构建了一个网络,展示了每个补丁如何依赖于每一个其他补丁。随后,他们使用了一种类似于搜索引擎对网页重要性进行排序的数学方法,来确定图像中每个补丁的全局排名。他们将这种排名称为“坍缩顺序”(collapse order),它告诉计算机应该首先观察图像的哪些部分。结果令人瞩目:排名最高的补丁几乎总是那些定义了主要形状和物体的部分。例如,对于一张公鸡的图像,排名靠前的补丁勾勒出了喙、鸡冠和羽毛,而排名较低的补丁则对应于背景。这种顺序反映了一个人类画家可能开始素描的方式——从最具有定义性的特征开始,然后再填充细节。

随后,团队测试了使用这种特定顺序是否能提高计算机生成和识别图像的能力。在图像生成领域(即计算机从零开始创建图片),他们发现遵循坍缩顺序能显著改善过程。当计算机被迫先生成最重要的补丁时,生成的图像更加清晰、真实,且减少了令人困惑的伪影或错位的物体。系统生成的图像不仅在视觉上更优越,而且达到高质量水平所需的计算量也更少。这表明计算机不再是盲目猜测,而是遵循了一条逻辑性的发现路径,就像人类观察者从最显著的特征向外扫描场景一样。

这些益处也延伸到了图像识别领域。研究人员训练了一个视觉系统来识别物体(如动物或车辆),但加入了一个转折:他们只允许系统看到坍缩顺序中排名靠前的补丁。令人惊讶的是,即使只展示了总图像内容的22%,该系统仍能以极高的准确度识别图像。事实上,当它只看到这些关键补丁时,其表现甚至优于看到完整图像但随机移除部分内容时的表现。这一发现挑战了“看到更多的图像总是更好”的普遍假设。相反,它表明看到正确的部位并遵循正确的顺序才是真正重要的。通过专注于携带最多信息的补丁,计算机可以忽略其余部分,从而在不牺牲性能的情况下节省大量的处理能力。

这些发现为机器如何学习视觉提供了一个全新的视角。研究人员证明,图像并非将每个像素或补丁视为统一的数据单元,而是存在着一种可以被学习并利用的内部重要性层级。通过尊重这种层级结构,计算机可以变得更加高效,能够以更少的资源生成更好的图像并识别物体。这项工作表明,人类自然扫描场景的方式——首先关注最具代表性的细节——不仅是一种生物学上的特性,也是一种可以被机器采纳的视觉结构基本原则。随着研究人员继续探索这一理念,他们希望将这些原则应用于其他视觉任务,从而有望催生出新一代能够以人类眼睛般的效率和清晰度观察世界的智能技术。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →