想象一下,你正在雇佣一位才华横溢、训练有素的侦探(AI 模型),根据一张照片来破解谜题。
旧的方法(标准 AI):
目前,大多数 AI 系统将每张照片都视为由 196 个微小且完全相同的拼图碎片组成的网格。无论如何,它们都会把这 196 块碎片全部交给侦探。
- 如果照片里是一只在树上的鸟,侦探分析空白天空、模糊叶片和远处篱笆的时间,与分析鸟儿羽毛的时间一样长。
- 这就像是要求侦探阅读一整本 500 页的书,只为了寻找其中一个特定的句子,即使那个句子在第 10 页。侦探会感到疲劳(消耗更多计算能力)并且耗时更长,但那些多出来的页面对破案毫无帮助。
新思路(SpiralFovea):
该论文的作者 Kyan Mahajan 和 Mohammad Saqlain 认为,我们错过了一个巨大的机会。我们不应该仅仅让侦探变得更聪明或阅读得更快,我们应该改变首先递交给他们的是什么。
他们称之为效率的“第三个杠杆”。
- 杠杆 1: 让侦探工作时间更短(早期退出/Early Exit)。
- 杠杆 2: 让侦探在阅读时跳过某些页面(稀疏注意力/Sparse Attention)。
- 杠杆 3(他们的创新): 只把那些真正包含线索的页面交给侦探。
SpiralFovea 是如何工作的:“人类眼睛”类比
该系统以人类眼睛命名。在你的眼睛里,中心部分(中央凹/fovea)能看到清晰、细腻的图像,而边缘(外围视觉)则是模糊的,只能注意到运动。你的大脑会瞬间将清晰的视力聚焦在有趣的事物上。
SpiralFlowea 对 AI 也做了同样的事情,但它不需要通过“学习”来实现。它使用了一个简单的数学技巧,叫做熵(一种衡量“视觉混乱度”或细节程度的指标)。
- 侦察兵: 在 AI 侦探甚至开始观察照片之前,一个微小的、免费的工具会先扫描图像。它会问:“哪里最有意思?”
- 例子: 在一张画作的照片中,它会发现色彩丰富、细节丰富的脸部。在森林的照片中,它会发现那只鸟。它会忽略无聊、单一的蓝色天空或黑暗、空旷的背景。
- 螺旋: 一旦找到了这些“热点”(感兴趣的部分),它并不仅仅是把它们切出来。它会在这些热点周围构建一个螺旋形的拼图碎片。
- 就在感兴趣的中心?极其微小、细节极其丰富的碎片。
- 向外移动?稍微大一点的碎片,用以捕捉上下文信息。
- 结果: 与其交给侦探 196 块碎片(覆盖整个图像),它只交给大约 78 块。
- 至关重要的是,它交给的每一块碎片都是有用的。 那些无聊的背景甚至根本不会被处理。
魔法数字
论文在四种不同类型的困难图像谜题(如识别特定鸟类品种或艺术风格)上测试了这一点。以下是使用 SpiralFovea 后的结果:
- 更聪明: AI 的准确度更高(提升了约 2%),因为它不再被“空白背景”产生的噪声所干扰。
- 更高效: 因为侦探只需要看 78 块碎片而不是 196 块,计算机在每个思考步骤中的计算量减少了 84%。
- 更快速: 系统处理图像的速度提升了 18% 到 29%。
为什么这很重要(“为什么”部分)
作者解释说,当 AI 没有被“训练”去预期特定的网格模式时,这种方法效果最好。
- 如果一个 AI 是基于固定的网格进行训练的(像标准的监督学习模型),当你突然给它一组奇怪的、螺旋形状的线索时,它可能会感到困惑。
- 然而,对于通过观察数百万张图像进行无标签学习的现代 AI 模型(自监督模型)来说,这种方法非常契合。这些模型足够灵活,能够说:“哦,鸟在这里,让我们关注那里,”而不是坚持说:“鸟必须在我的 196 块网格中心。”
总结
可以将 SpiralFovea 看作是坐在 AI 前面的一个智能过滤器。它并没有改变 AI 的大脑;它只是改变了输入。它会说:“不要浪费时间看空白的天空。这里是那 78 块真正重要的碎片。去破案吧。”
通过这样做,他们实现了一个“双赢”:AI 变得更快、运行成本更低,同时也更准确。
技术摘要:SpiralFovea:输入自适应注视点分词技术
1. 问题陈述
当前的自适应推理技术主要围绕两个已有的“杠杆”进行操作:
- 架构/深度: 早期退出(Early exit)、混合专家模型(MoX)路由以及动态深度。
- 注意力/KV-缓存: 稀疏注意力、可变形注意力以及 KV-缓存压缩。
然而,这些方法都是作用于一个固定的网格输入分词(Tokenization)。无论图像内容如何,标准的视觉 Transformer(ViT)都会按光栅顺序将 224×224 的图像划分为 N=196 个均匀补丁(Patches)。这种方法违反了率失真原理(Rate-distortion principle),该原理认为最优的容量分配应与局部信息密度成正比。均匀分词为低熵背景区域和高熵判别性区域分配了相等的计算资源,导致在任何自适应发生之前,在每一层 Transformer 中都产生了不必要的成本。
虽然令牌剪枝(一种“杠杆-1”技术)可以减少令牌数量,但在结构上它是不同的,因为它首先形成完整的均匀网格,进行投影,并在至少一个 Transformer 块中进行处理后才丢弃令牌。此时,处理无信息令牌的成本已经支付完毕。
空白点: 存在一个缺失的“第三杠杆”:输入自适应分词(Input-Adaptive Tokenization)。这个杠杆是在任何骨干网络参数被查询之前,询问对于特定图像而言,哪些 令牌应该存在,而不是在形成之后对其进行剪枝。
2. 方法论:SpiralFovea
作者提出了 SpiralFovea,一种无参数、输入自适应的分词器,它根据局部视觉熵生成变长的令牌集。该过程完全发生在骨干网络前向传播之前。
核心流水线
熵图生成:
- 将输入图像 I 转换为亮度(BT.601),下采样至 D×D,并量化为 B 个箱(Bins)。
- 使用滑动窗口计算经验箱概率,从而导出局部香农熵图 E(x,y)。
- 该计算是 $O(HW)$ 的,无参数,且成本小于单个 Transformer 块的 2%。
热点锚点选择:
- 将图像高度分为 S 个条带(Strips)。
- 在每个条带内,选择最大熵的位置作为锚点(cs),以确保水平多样性。
- 对锚点进行归一化,并基于半径阈值(τdedup)进行去重。
多尺度螺旋环提取:
- 围绕每个保留的锚点,将补丁放置在 K=4 个同心环中。
- 第 0 环(Ring 0): 单个注视中心补丁(Foveal patch)。
- 第 k>0 环: 包含 nk 个补丁,按螺旋模式排列,其半径和补丁尺寸逐渐增加。
- 该调度设计旨在实现空间平铺且无缝隙。对于 224×224 的图像和 4 个活跃条带,理论最大值为 116 个补丁,但越界过滤器通常会将最终计数减少到 ≤78 个补丁(较标准 196 个减少了约 60%)。
令牌获取与嵌入:
- 通过双线性网格采样获取补丁。
- 嵌入(Embedding): 使用骨干网络的冻结
patch_embed.proj 对补丁进行投影。
- 位置编码(PE): 标准的光栅正弦 PE 被**极坐标 PE(Polar PE)**取代。一个学习到的 2 层 MLP 将极坐标 (c^s,k,θ) 映射到嵌入。这尊重了补丁在注视布局中的几何邻近性(无论环索引如何,空间上都是相邻的)以及螺旋的旋转对称性。
- 骨干网络处理: 将变长序列(加上 CLS 令牌)传递给冻结的 Transformer 堆栈。
- CNN 适配: 对于 CNN 骨干网络,补丁由共享的 ResNet-18 主干进行编码,并通过 Mamba 模块(状态空间模型)进行融合,以高效处理变长序列。
3. 核心贡献
- 概念框架: 将输入自适应分词定位为一种独特的、互补的“第三杠杆”,用于资源自适应推理,区别于架构和注意力修改。
- SpiralFovea 实现: 一种 $O(HW)$ 熵引导的分词器,具有无参数特性、可证明的锚点覆盖率和多尺度螺旋提取能力。其选择过程在任何骨干网络参数被评估前即已完成。
- 理论动机: 通过率失真理论(将容量分配给信息密度)和生物视觉(中央凹注视与外周显著性)来证明其设计的合理性。
- 经验性能: 在四个细粒度基准测试和四个骨干网络族上展示了严格的帕累托改进(Pareto improvements)。
- 部署诊断: 识别了一个边界条件,即该方法最为有效的场景:它在具有弱或任务无关的全图位置先验(例如自监督模型 DINO)的骨干网络上收益最高,而在具有强固定光栅先验(例如监督式 ViT-S/16)的模型上收益递减或转负。
4. 实验结果
该方法在四个基准测试上进行了评估:WikiArt (GAN-Genre, Style)、Oxford Flowers-102、PatchCamelyon 和 CUB-200-2011 (Genus grouping)。
5. 意义与主张
论文声称 SpiralFovea 代表了视觉输入处理方式的一个根本性转变。通过将输入令牌集视为主要的效率杠杆,它避免了处理无信息区域的“浪费”。
- 可组合性: 该方法与“杠杆-1”(架构)和“杠杆-2”(注意力)技术是正交的。作者认为,结合这些杠杆会产生节省效果的乘法效应(例如,为早期退出或 MoE 路由提供更短的序列)。
- 目标领域: 这项工作将自监督基础模型隔离为输入自适应分词最有价值的领域,因为这些模型缺乏监督式 ImageNet 训练模型那种僵化的位置先验。
- 实际影响: 减少传递给冻结骨干网络的令牌,可以按比例节省 GPU 显存和能量,从而降低推理的碳成本。该方法特别适用于判别信号在空间上高度集中的细粒度识别和医学成像(PatchCamelyon)领域。
作者总结道,“第三杠杆”在很大程度上尚未被探索,并邀请社区研究将输入自适应与其它自适应推理技术相结合的组合帕累托前沿,以及其在非图像模态中的适用性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。