想象你拥有一个非常聪明、规模巨大的图书馆(即 AI 模型),它能够查看图片并阅读描述,从而推断出它们的内容。通常,为了回答问题,这个图书馆会强制将每一本书从第一页读到最后一页,无论问题多么简单。这既耗时又耗能。
本文介绍了一种新方法,让图书馆在已经知道答案时能够提前停止阅读。他们将此系统称为T-GEMS(Text-Guided Exit Modules,文本引导退出模块)。
以下是其工作原理,分解为简单概念:
1. 问题:无需通读全书却仍通读全书
将 AI 的“大脑”(图像编码器)想象成一条拥有许多房间(层)的长廊。为了理解图像,AI 通常会走完全部 12 个房间。
- 旧方式:即使 AI 在第 3 个房间就找到了答案,为了保险起见,它仍会继续走到第 12 个房间。这既缓慢又消耗大量电力(计算能力)。
- 目标:我们希望 AI 能够说:“我在第 3 个房间已经足够有把握了,所以我就在这里停止并给出答案。”
2. 挑战:“沉默”的图像
在许多 AI 系统中,图像和文本是分开处理的。文本部分知道答案(例如“这是一只猫”),但图像部分只是在长廊中盲目行走。在完成整个行程之前,它并不知道自己在寻找什么。让图像部分提前停止很困难,因为它缺乏文本线索来引导它。
3. 解决方案:T-GEMS(文本引导)
作者创建了一个特殊的“引导者”,称为T-GEMS。
- 比喻:想象你在看一张模糊的照片。如果有人耳语道“这是一只猫”,你的大脑会立刻开始寻找猫的特征(耳朵、胡须),而不是随机扫描整张图片。
- 工作原理:T-GEMS 利用文本描述(耳语)来预测图像“长廊”在不同阶段应该呈现的样子。它告诉图像编码器:“根据文本,你现在应该已经看到这些特定模式了。”
4. “惊讶”计(Class-Rate)
AI 如何知道何时停止?本文引入了一个称为Class-Rate的概念,它就像一个“惊讶计”。
- 比喻:想象你在玩猜词游戏。
- 如果你被告知单词是“苹果”,而你看到一张红色水果的图片,你并不惊讶。“惊讶”程度很低。
- 如果你被告知单词是“苹果”,但你看到一张汽车图片,你会非常惊讶。“惊讶”程度很高。
- 应用:系统在每一步计算图像数据被文本描述“惊讶”的程度。如果惊讶程度很低(意味着图像和文本完美匹配),系统就会说:“我们已有足够信息;让我们提前退出!”
5. 构建引导者的两种方式
本文测试了两种训练该系统的方法:
- “样本”方法(朴素):他们向 AI 展示了成千上万只猫和狗的示例,让它记忆在每个步骤中它们的样子。这虽然有效,但需要庞大的示例库,且并未真正将文本与图像深度关联。
- “学习”方法(T-GEMS):他们教导 AI 直接从文本中学习规则。AI 学会了仅通过阅读文本就能预测图像应该呈现的样子,而无需记忆成千上万张具体照片。这种方法更灵活且高效。
6. 结果:更智能、更精简
研究人员在标准数据集(CIFAR10)上使用流行的 AI 模型(CLIP)对此进行了测试。
- 节省空间:通过提前停止,他们实际上可以“截断”图像编码器的末端。他们发现,可以移除模型中巨大的部分(节省数百万个参数),而不会显著降低准确率。
- 更高的准确率:令人惊讶的是,使用“惊讶计”(Class-Rate)作为训练工具,实际上使 AI 在即使提前停止的情况下,区分不同事物的能力也更强了。
- 权衡:如果停止得非常早(仅经过几个房间),准确率会略有下降;但如果在中途停止(大约在第 6 个房间),他们能在节省大量计算能力的同时,保持几乎全部的准确率。
总结
简而言之,这篇论文教导 AI 如何倾听文本描述,以确切知道何时已经看到了足够的图像内容从而做出猜测。它不再强制 AI 每次都处理整张图片,而是利用文本作为地图来更快地找到答案,在保持结果准确的同时节省时间和能量。
技术摘要:T-GEMS——用于降低 CLIP 图像编码器的文本引导退出模块
问题陈述
多模态(MM)模型(如 CLIP)利用对比学习将图像和文本输入对齐到共享的潜在空间中。尽管效果显著,但其推理过程是静态的:无论输入复杂度如何,每个输入都会遍历整个 Transformer 堆栈,导致计算成本高昂。早期退出(EE)方法允许模型在具备信心时于中间层停止计算,该方法已在单模态及基于融合的多模态模型中得到探索。然而,在像 CLIP 这样的对比式双编码器模型中,EE 的研究仍显不足。主要挑战在于模态编码器的分离;现有的动态方法通常依赖联合处理或令牌剪枝,未能利用文本编码器信息来指导视觉编码器中的退出。此外,为这些模型开发静态 EE 方法需要一种能够仅依赖文本描述(而非单纯依赖图像数据)来估计中间层语义内容分布的方法。
方法论
作者提出了文本引导退出模块(T-GEMs),这是一个旨在利用文本编码器信息在双编码器模型的图像编码器中执行静态早期退出的框架。其核心目标是估计给定图像 x 和文本描述 d 时,特定类别 c 的中间神经元激活(ℓij)的后验概率分布。
- 分布估计:该方法假设中间激活遵循高斯分布。目标是计算每个类别和每一层的均值(μ)和方差(σ2)。
- 两种估计方法:
- 基于采样的方法:一种朴素方法,利用校准集 S 经验性地计算每个类别的 μ 和 σ2。这种方法避免了训练新参数,但未能建立文本与图像激活图之间的联系。
- 基于学习的方法(T-GEMs):一个可学习网络 Ψi(即 T-GEM)直接从文本嵌入(dt)估计分布参数,从而在推理过程中无需样本图像。该模块经过优化以最小化激活信号的“率”(即惊讶度)。
- 跳跃模块(The Jumper Module):为了提高区分度,投影模块 Ji(Jumper)将中间图像激活映射到低维空间 ℓ~i。这有助于更优的率估计,并允许整合跨模态相似性。
- 分类指标(类别率,Class-Rate):该方法引入了类别率指标(Rci),而非标准的余弦相似度。该指标计算在给定类别假设下激活的“惊讶度”。预测类别是使该率最小化的类别(公式 3),实质上选择了最能高效压缩信号的类别。
- 训练目标:模块使用组合损失函数 L=Lr+Ls 进行训练:
- Lr:基于率的正则化项,最小化高斯分布的负对数似然,增强区分语义内容的能力。
- Ls:文本嵌入与投影图像表示之间的跨模态相似性损失(余弦相似度)。
主要贡献
论文声称有四项主要贡献:
- 中间表示分析:调查了 CLIP 中中间表示如何随文本嵌入在不同类别间变化,揭示了这些层包含适合早期退出的判别性信息。
- 类别率正则化器:引入了一种源自激活图的统计量,它与余弦相似度相关,但作为可训练的正则化器以提升判别能力。
- 文本引导退出模块(T-GEMs):设计了一种仅从文本嵌入预测中间图像编码器激活的模块,证明了模态之间存在有界关系。
- 静态早期退出框架:训练了利用中间激活图进行图像分类等任务的静态 EE 模块,这是首次探索在对比式双编码器模型中利用文本和视觉编码器的中间层进行静态 EE 的研究。
实验结果
实验在 CIFAR-10 数据集上使用 CLIP ViT-B-32 和 ViT-L-14 架构进行。
- 性能与完整 CLIP 对比:T-GEMs + Jumper 方法取得了与完整 CLIP 模型相当的竞争力。例如,对于 ViT-B-32,该方法在最后一层(RB12)达到了 92% 的准确率,与 91.3% 的零样本基线相当。
- 正则化的影响:引入基于率的正则化器(Lr)显著提升了性能,特别是在早期层(RB3–RB5),相比仅使用余弦相似度的方法,增益高达 6%。
- 参数效率:T-GEMs 和 Jumper 引入的额外参数微乎其微(数十万),约占单个残差块的 4%。这允许显著的模型压缩;例如,在第 5 层退出可将编码器大小减少约 5200 万参数,同时保持高准确率。
- 类别率与余弦对比:类别率指标被证明是余弦相似度的可靠代理,当用作推理指标时,尤其是在与率正则化器结合使用时,往往优于余弦相似度。
- 样本敏感性:基于采样的方法需要合理数量的样本(例如 S≥100)才能生效,而基于学习的方法在投影维度 K=128 时趋于稳定,表明 T-GEMs 并不严格依赖大型模型。
意义与主张
论文将这项工作定位为高效多模态推理的基础性步骤。它声称是首次通过利用文本与视觉中间层之间的关系,探索对比式双编码器模型中的静态早期退出。作者强调,他们的方法在不妨碍图文相似性性能的前提下,减小了图像编码器的规模。
其意义在于证明了:
- 早期编码器层中的中间激活足以用于分类任务的判别。
- 基于率的正则化能够提取比单纯的标准相似性指标更具判别性的表示。
- 文本嵌入可以有效指导图像激活分布的估计,从而实现一种无需在推理过程中进行动态、逐样本决策的静态早期退出策略。
作者在范围上保持谦逊,指出虽然他们目前未实现动态退出策略(即每个样本在不同层退出),但其静态框架为未来的动态实现和轻量级多模态编码器训练提供了有希望的基础。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。