想象一下,你正在教一位非常聪明的学生(一个视觉语言模型)如何观察一张图片并回答问题。通常,我们通过向他们展示成千上万张图片,并让他们猜测句子中的下一个词来进行教学。
问题在于,正如本文作者发现的那样,这个学生有时会变得“分心”或“困惑”。他们可能会看着一张狗的照片,却自信地说:“那是一只猫”,或者他们可能会关注背景噪音而不是主要物体。这是因为学生的内部笔记(视觉数据)被太多无用的信息弄得杂乱不堪,就像收音机频道里的静电噪声一样。
以下是本文提出的解决办法的简单拆解:
问题所在:“嘈杂的收音机”
把模型接收到的视觉信息想象成一个无线电信号。在标准训练中,模型试图一次性学习所有内容。但因为它试图预测下一个词,它会不小心捕捉到“静电”(无关细节)和“坏信号”(幻觉)。这就像是在听一首清晰的歌曲时,有人在你耳边大喊随机数字。模型会被淹没,其注意力也会卡在错误的地方(论文中称之为“注意力汇聚”现象,即模型盯着一个不重要的标记看,而不是看整个画面)。
解决方案:“信息正则化注意力”(IRA)
作者引入了一个新工具——信息正则化注意力(Information-Regularized Attention, IRA)。你可以把它想象成模型大脑中的智能降噪耳机。
IRA 不仅仅是让模型按原样读取视觉数据,它会在模型做出决策之前,特意在模型的内部笔记中加入一点点“受控的混乱”(随机噪声)。
以下是利用创意类比进行的解释:
“随机化”步骤(添加噪声): 想象你正在向朋友描述一幅画。如果你只是盯着看,你可能会被一个小小的尘埃点困住。但如果你被要求戴着一副略微模糊的眼镜(即“噪声”)来描述它,你就会被迫忽略那个小尘埃,转而关注大的、重要的形状。
- 在论文中,这种“模糊眼镜”的效果就是随机注意力(stochastic attention)。它迫使模型对微小的细节保持不确定性,从而只关注那些对答案真正有意义的、强烈且清晰的信号。
“智能过滤器”(以不确定性为条件): 模型并不会在所有地方都添加噪声。它是很聪明的。
- 如果模型对图像的某个部分已经非常有信心(低不确定性),系统会说:“好的,保持清晰,不要弄乱它。”
- 如果模型感到困惑或者数据看起来很混乱(高不确定性),系统会说:“这部分很摇摆不定;让我们在这里加入一些噪声,迫使你去重新检查并寻找真正的真相。”
- 这就像一位老师,只在学生遇到困难时才给予帮助,而不是直接为他们重写整篇论文。
结果:一条更直的路: 论文测量了模型思考路径的“曲率”。
- 没有 IRA 时: 模型的思考路径就像过山车——扭曲、不稳定,且容易坠毁(产生幻觉)。
- 有了 IRA 后: 路径变成了一条平滑、笔直的高速公路。模型从观察图像到给出答案的过程变得顺畅,不会经历不必要的、令人困惑的绕路。
他们发现了什么?
当他们测试这种新方法时:
- 减少了幻觉: 模型不再编造关于图像的事实。
- 更好的专注力: 它不再卡在不重要的背景细节上(减少了“注意力汇聚”)。
- 更强的推理能力: 它在处理复杂任务(例如需要结合所见与所知来回答问题)时表现得更好,因为它的内部“笔记”更干净、更可靠。
核心结论
本文声称,通过以一种聪明且受控的方式,在模型的视觉处理过程中特意加入一点“不确定性”(噪声),我们实际上可以让它变得更加确定和可靠。这有点像摇晃一罐混合坚果,让大的坚果浮到上面;噪声有助于让重要的视觉信号从垃圾信息中脱颖而出。
这种方法不仅让模型的回答变得更好,它还从根本上改变了模型如何“思考”图像,使其内部的世界地图更加平滑和稳定。
技术摘要:面向视觉中心推理的信息正则化注意力机制
问题陈述
视觉语言模型(VLMs)已成为多模态学习的一种范式,但面临着显著的可靠性问题,包括物体幻觉、视觉接地(grounding)能力弱,以及在全参数指令微调后出现的灾难性遗忘。作者认为,这些失败源于在标准的下一 Token 预测目标下,缺乏对视觉表示学习的显式控制。在当前的训练范式下,视觉嵌入仅通过语言监督进行被动优化。这导致任务无关或噪声较大的视觉信号通过注意力层进行传播,从而引发“注意力汇聚”(attention sinks,即注意力坍缩到语义无信息的 token 上)和伪跨模态交互。现有的以数据为中心的方法(例如依赖于扩展监督信号的偏好优化)未能直接对特征表示本身进行正则化。
方法论:信息正则化注意力(IRA)
为了解决这些问题,本文提出了信息正则化注意力(Information-Regularized Attention, IRA),这是一种随机注意力机制,旨在显式地调节注入到中间 Transformer 层隐藏状态中的视觉信息量。
- 信息论公式化: 该方法将问题建模为一个变分推理任务。IRA 不再将隐藏状态 h 视为输入 x 的确定性映射,而是通过在注意力模块进入注意力计算之前,向值状态(value states)中注入随机噪声,引入了一个随机隐变量 z。这使得视觉嵌入的确定性传播转变为一个随机过程。
- 架构: 每个 Transformer 层都附带一个轻量级的参数化头,用于生成后验分布 qϕ(z∣v),其中 v 代表值状态。该后验分布通过重参数化技巧(z=v+Δϕ(v)+σqϵ)进行近似,使模型能够学习自适应的扰动和不确定性估计,而不会增加额外的编码开销。
- 正则化目标: 训练目标包含一个 KL 散度项,用于衡量学习到的后验分布与数据依赖先验 pλ(z∣⌊v⌋) 之间的差异。该先验以分离后的原始值状态为中心(使用梯度截断操作),以防止平凡的后验-先验坍缩。
- 不确定性调节权重: 考虑到并非所有视觉 token 都需要同等的正则化,作者引入了一种 token 维度的权重机制。正则化强度根据两个因素进行自适应调整:
- 重要性: 语言上下文分配给该 token 的平均注意力质量。
- 不确定性: 跨模态注意力分布的熵。
不重要(低注意力)且不确定(高熵)的 token 会受到更强的正则化,而关键的视觉细节则会被保留。
- 特定层应用: 实验表明,将 IRA 应用于中后层(具体为 Transformer 深度 60%–80% 的层)效果最佳,因为这些层在抽象推理与保留视觉接地信号之间取得了平衡。
核心贡献
- 新颖机制: 提出了 IRA,它在视觉表示进入跨模态注意力之前对其进行正则化,从而在全参数指令微调过程中显式控制视觉信息流。
- 几何洞察: 展示了 IRA 如何改善表示几何结构。作者引入了一个曲率度量来分析神经轨迹,发现 IRA 产生了更平滑、更线性的层间轨迹,这与稳定的训练动态和改进的接地能力相关联。
- 缓解注意力汇聚: 识别了注意力汇聚与表示曲率之间的相关性。研究表明,IRA 能够抑制注意力汇聚,并降低接收过度、无信息注意力的 token 比例。
结果
作者在多种基准测试中评估了 IRA 在开源 VLM(InternVL2, InternVL2.5, LLaVA-OneVision)上的表现:
- 通用性能: 在推理密集型基准测试(如 MMMU, STEM, General QA)和知识密集型任务(OK-VQA)中,IRA 始终优于标准的监督微调(SFT)。
- 鲁棒性: 该方法提升了幻觉检测基准(POPE, HallusionBench)的表现,并减少了低级视觉任务(VLM-are-biased, VLM-are-blind)中的偏差。
- 泛化能力: IRA 在处理包括多图理解(MuirBench, BLINK)和视频理解(MVBench)在内的分布外(OOD)任务时展现出更好的泛化能力。
- 表示分析: 定量分析显示,与 SFT 基线相比,IRA 模型表现出更低的曲率变化(更直的轨迹)以及显著降低的注意力汇聚比例。
- 消融实验: 去除不确定性引导权重或数据依赖先验会导致性能下降,证实了自适应正则化和锚定预训练表示的必要性。
意义与主张
本文主张,随机注意力不仅是一种正则化器,更是生成式架构内表示学习的基础贡献者。通过显式调节注入隐藏状态的信息,IRA 解决了视觉幻觉和不稳定性的根源:即噪声视觉信号的失控传播。作者认为,提高 VLM 的可靠性需要超越以数据为中心的后训练阶段,直接对生成架构内的特征表示进行正则化。此外,这项工作表明,注意力不应仅被视为一种权重机制,而应被视为评估内部表示质量的度量标准,为构建更可靠、更具可解释性的多模态系统提供了新的方向。作者指出,虽然由于资源限制,目前的实验仅限于 8B 参数规模的模型,但他们预期研究结果可以扩展到更大的模型。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。