想象你有一位非常聪明、博览群书的朋友,他热衷于讲述关于图片的故事。这位朋友擅长使用大词,并能让句子流畅自然。然而,有一个陷阱:有时当图片有些模糊或令人困惑时,你的朋友就开始编造内容。他可能会描述照片中实际上并不存在的狗,或者说一个人手里拿着一个红苹果,而实际上苹果是绿色的。在人工智能领域,这被称为“幻觉”。
你分享的这篇论文介绍了一种新方法,旨在帮助这位 AI 朋友在保持其讲故事 flair 的同时说出真相。他们将其方法称为IECD2(指令 - 证据对比双流解码)。以下是其工作原理,使用简单的类比:
问题:“讲故事的人”与“侦探”
作者们注意到,当 AI 观察图像时,通常存在两种相互冲突的本能:
- 讲故事的人(指令流):这部分 AI 希望给出一个漫长、有趣且语法完美的答案。它依赖于基于训练所预期看到的内容。如果你问“厨房里有什么?”,它可能会说“有冰箱、炉灶和一只猫”,因为这是常见的厨房场景,即使猫并不存在。
- 侦探(证据流):这部分 AI 非常严格。它只希望谈论它实际能在图像像素中看到的内容。它非常安全且准确,但可能很枯燥。它可能只会说“我看到一张桌子”,并拒绝猜测其他任何内容,即使显然有一只猫坐在上面。
解决方案:“双流”辩论
IECD2 不强迫 AI 在成为优秀的讲故事者或严格的侦探之间做出选择,而是让两者同时发言。
这就像是一个两人委员会决定接下来要说什么:
- A 先生(讲故事的人) 提议:“我们说有一只猫吧!”(因为这听起来不错)。
- B 先生(侦探) 检查照片后说:“我没看到猫。我只看到一把椅子。”
“交通灯”机制
IECD2 的魔力在于一个特殊的交通灯系统(称为“对比门”),它倾听双方的意见并决定要说什么。
- 绿灯(一致):如果讲故事的人和侦探达成一致(例如,两人都说“是的,有一只猫”),AI 就会说“有一只猫!”。它让故事自然流畅地继续。
- 红灯(分歧):如果讲故事的人想说一些侦探无法找到的内容(例如,“有一只猫!”对比“我什么都没看到”),交通灯就会变红。系统会静音讲故事的人的猜测。它迫使 AI 坚持真相,防止其编造那只猫。
- 黄灯(谨慎):如果他们不确定,系统会更倾向于侦探以确保安全。
为什么这比之前更好
以前的方法试图通过以下方式解决这个问题:
- 让 AI 保持安静:这阻止了幻觉,但使答案变得枯燥且不完整。
- 尝试重新训练 AI:这需要很长时间,并且需要海量数据。
IECD2 的不同之处在于它不需要重新训练 AI。这就像给 AI 在说话时戴上一副新眼镜。它瞬间平衡了“有趣的故事”与“硬事实”。
结果
作者在许多不同任务上测试了这种方法,例如描述照片(图像描述)和回答关于图像的问题(视觉问答)。
- 更少撒谎:AI 编造的虚假物体(如那只想象中的猫)大大减少。
- 更好的故事:即使它停止了撒谎,也没有变得枯燥。它仍然提供了丰富、描述性的答案。
- 速度:它运行迅速,不需要 AI 学习任何新内容;它只是改变了 AI 在最后一刻选择词语的方式。
简而言之,IECD2 教导 AI 实时将其自身的“想象力”与“相机”进行核对,确保它说的每一个字都有图片中实际存在的内容作为支撑。
以下是论文《Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning》(IECD2)的详细技术总结。
1. 问题陈述
视觉语言模型(VLMs)在遵循指令和开放式推理方面已展现出强大的能力。然而,它们严重受困于幻觉问题,即模型生成流畅、看似合理但缺乏视觉依据的内容(例如:不存在的物体、错误的属性或虚构的关系)。
- 根本原因:论文指出,标准的指令提示会放大语言先验。当视觉信号模糊或微弱时,模型会优先依据训练数据中的统计可能性,而非实际的图像证据。
- 权衡困境:现有的修复尝试往往造成一种二元对立:
- 指令驱动提示能生成丰富、描述性的文本,但幻觉率较高。
- 证据约束提示能减少幻觉,但导致输出过于保守、字面化且信息量不足。
- 差距:当前的对比解码(CD)方法通常依赖静态权重或特定类型的扰动(例如图像损坏),可能无法在生成过程中动态平衡语言丰富性与视觉忠实度。
2. 方法论:IECD2
作者提出了指令 - 证据对比双流解码(IECD2),这是一种无需训练、模型无关的解码框架。它通过在每一步解码时维护两个并行的概率分布并自适应地融合它们来运作。
A. 双流公式
在每一步解码 t,给定历史 y<t,模型在词汇表上生成两个 token 概率分布:
- 指令流(pt(I)):以标准自然语言指令提示(S)为条件。该流捕捉语言先验,鼓励流畅性、连贯性和描述丰富性。当视觉证据薄弱时,它容易产生幻觉。
- 证据流(pt(E)):以提示变体(xevidence)为条件,明确指示模型严格依赖可观察的图像内容。该流抑制推测性推断,充当保守的、基于视觉的基线。
注:两个流使用相同的底层 VLM 参数;差异完全源于条件提示。
B. 散度感知对比门控
核心创新是一种自适应融合机制,根据两个流之间的分歧来平衡它们。
- 几何融合:最终概率分布 pt(IECD2) 是两个流的几何平均:
pt(IECD2)(v)∝(pt(I)(v))gt⋅(pt(E)(v))1−gt
其中 gt∈[0,1] 是门控系数。
- 对称 KL 散度:门控 gt 由两个流之间的对称 Kullback-Leibler (KL) 散度(Dt)决定:
Dt=KL(pt(I)∣∣pt(E))+KL(pt(E)∣∣pt(I))
- 自适应逻辑:
- 低散度(Dt≈0):两个流达成一致。门控允许指令流具有更高影响力,保留语言流畅性和描述能力。
- 高散度(Dt≫0):两个流不一致(表明指令流可能正在产生幻觉)。门控(gt)急剧下降至接近 0,抑制指令流,迫使模型依赖证据流以防止幻觉。
3. 主要贡献
- 双流框架:引入 IECD2,在不重新训练的情况下,在生成过程中显式维护并行的指令驱动和证据 grounded 的 token 分布。
- 基于散度的门控:一种新颖机制,利用对称 KL 散度动态解决语言先验与视觉证据之间的冲突,选择性地抑制易产生幻觉的 token,同时保留信息丰富的内容。
- 全面评估:在多样化任务(VQA、图像描述、目标检测)和数据集(POPE、MME、VQAv2、AMBER、MS-COCO、LLaVA-Bench)上进行了广泛实验,证明了持续的提升。
4. 实验结果
作者在多个基准测试中评估了 LLaVA-1.5-7B 和 InstructBLIP 上的 IECD2。
- 幻觉减少:
- MSCOCO 图像描述:与标准解码相比,IECD2 将 LLaVA-1.5 的 CHAIRs(句子级幻觉)降低了 85.2%,将 InstructBLIP 降低了 98.8%。其表现优于 IFCD、CATCH 和 Octopus 等强基线。
- AMBER 生成任务:实现了幻觉率(Hal)和认知幻觉(Cog)的大幅降低,例如将 LLaVA-1.5 的 Cog 从 31.0 降低至 0.4。
- 任务准确率与 grounded:
- POPE(物体存在性):相比标准解码,准确率提高了高达 5.1%,F1 提高了 4.8%,显示出对对抗性采样和流行采样偏差的鲁棒性。
- VQAv2:在保持竞争性性能的同时,准确率提高了 +7.76%(LLaVA-1.5)和 +14.24%(InstructBLIP)。
- MME:在感知(存在性、计数、颜色)和认知(常识、代码)任务中表现出稳定的性能,证明该方法能处理多样化的幻觉类型。
- 效率:
- 该方法无需训练。
- 推理时间增加可控(生成任务中,无 KV 缓存时每个查询约增加 2.3 秒;使用 KV 缓存后降至 1.1 秒)。
5. 意义与影响
- 解决流畅性与忠实度的权衡:IECD2 成功打破了通常减少幻觉会损害输出质量的权衡。它生成的描述既具有描述性(语言丰富),又在事实上准确(基于视觉 grounded)。
- 通用性:作为一种解码时策略,它适用于任何经过指令微调的 VLM,无需参数更新或重新训练,因此具有高度可扩展性。
- 机制洞察:论文提供了实证证据,表明幻觉不仅仅是模型缺陷,而是指令遵循与证据 grounded 之间概率分布冲突的结果。对称 KL 门控有效地充当了“冲突检测器”以缓解这一问题。
- 最先进性能:结果确立了 IECD2 作为 grounded 视觉语言推理的新最先进方法,在判别式和生成式任务中均优于 VCD、ICD 和 RBD 等专用方法。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。