想象一下,你拥有一个非常聪明的机器人助手(多模态大语言模型),它能够查看图片并详细描述。你问它:“你看到了什么?”它便开始讲述。但有时,这个机器人会变得过于富有想象力。它可能会看着一张有滑雪者的雪山图片,并自信地说:“我看到滑雪者身上有一个红色的包",尽管图片中根本没有包。这被称为对象幻觉。
本文介绍了一种名为**指令透镜分数(Instruction Lens Score, InsLen)**的新工具,用于捕捉这些谎言。以下是其工作原理,通过简单的类比来说明:
问题所在:“嘈杂的相机”与“智能向导”
将机器人的视觉系统想象成一台相机,它有时会因光线不佳或反光而混淆。它可能会看到一个看起来像包的阴影,然后告诉机器人的大脑:“嘿,那里有个包!”
通常,其他方法会试图通过查看相机的原始数据(即“视觉嵌入”)来检查机器人的回答。但如果相机本身已陷入混乱,这种检查就会失效。
作者们发现了一个令人惊讶的事实:机器人的指令(即你输入的文本,如“请描述这张图片”)充当了智能向导。尽管相机存在噪声,但智能向导有一种过滤噪声的方法。当机器人读取你的指令时,它隐式地“知道”图片中实际有什么,并能忽略来自混乱相机的虚假“包”信号。
解决方案:“指令透镜”
研究人员构建了一个名为InsLen的检测器,它就像一面放大镜,专门聚焦于智能向导的思维,而非相机的视角。
他们将此分解为两个主要检查:
1. “现实检查”(校准局部分数)
- 类比:想象一位侦探(相机)发现了一个看起来像包的线索。但一位明智的法官(指令)审视同一线索后说道:“我不认为那是包;那只是阴影。”
- 工作原理:该方法评估机器人“看到”包时的“置信度”。如果相机对包感到兴奋,但“智能向导”(指令)对此非常怀疑并赋予其极低的概率,系统就会知道需要校准(降低)该置信度。这实际上是在说:“相机在撒谎;向导更清楚。”
2. “上下文检查”(上下文一致性分数)
- 类比:想象你正试图在人群中识别一个人。
- 局部检查:你观察一块看起来像脸的模糊像素区域。
- 上下文检查:你询问“智能向导”:“这个人符合整个场景的故事吗?”如果场景是滑雪坡,向导知道应该有滑雪者和雪,但可能不会有漂浮在空中的“包”。
- 工作原理:该方法考察“智能向导”对整个场景的理解。它检查机器人声称看到的物体(例如“包”)是否与向导所讲述的全局故事相符。如果向导的故事不支持包的存在,系统就会将其标记为幻觉。
为什么这更好?
大多数先前的方法试图通过增加更复杂的机制(例如要求第二个超昂贵的 AI 来检查工作)或通过训练机器人达到完美(这需要耗费漫长时间)来修复机器人。
InsLen 的不同之处在于:
- 即插即用:你无需重新训练机器人或添加新的昂贵工具。你只需利用机器人自身的内部“智能向导”思维来检查其工作。
- 快速:它几乎不会为机器人的思考过程增加额外时间。
- 准确:在他们的测试中,这种方法比其他任何尝试过的方法都能捕捉到更多的谎言,即使是在机器人观察那些真实物体与虚假物体看起来非常相似的棘手图片时(例如勺子和刀)。
总结
该论文声称,通过倾听机器人的指令(即“智能向导”),而不仅仅是它的眼睛(即相机),我们可以有效地过滤掉虚假物体。指令透镜分数结合了“现实检查”(校准相机的置信度)与“上下文检查”(确保物体符合故事),从而为 AI 图像描述创建了一个高度可靠的谎言检测器。
技术摘要:用于物体幻觉检测的指令透镜分数
问题陈述
多模态大语言模型(MLLMs)已在视觉理解和推理方面展现出显著能力。然而,阻碍其可靠部署的一个关键障碍是物体幻觉(OH),即模型生成了输入图像中并不存在的物体描述。现有的检测方法面临两个主要局限:
- 辅助模型依赖:依赖外部模型(如 GPT-4)或专用幻觉检测器的方法会产生巨大的计算开销,并需要额外的训练。
- 对误导性视觉信号的脆弱性:基于视觉的检测分数(如注意力权重、局部相似度)往往在视觉编码器引入误导性信息,或幻觉物体的局部视觉模式与真实物体相似时(例如勺子和刀具有相似的纹理),遭受虚假的高置信度影响。
方法:指令透镜分数(InsLen)
本文提出了指令透镜分数(InsLen),这是一种无需训练、即插即用的检测器,它利用指令 token 的内部嵌入来过滤误导性视觉信息。核心洞察在于:指令嵌入隐式地编码了基于图像的视觉信息,同时有效地抑制了由视觉嵌入引入的错误线索。
该方法利用Logit Lens技术,将中间层嵌入投影到词汇空间以分析置信度分布。InsLen 包含两个互补组件:
1. 校准局部分数(Scls)
该组件解决了基于视觉的分数中虚假过度自信的问题。
- 机制:通过测量分配给物体 token 的最大置信度(在所有指令嵌入中),引入校准置信度(Scafe)。
- 逻辑:由于指令嵌入过滤掉了误导性视觉线索,幻觉物体在此投影中获得的置信度较低。
- 融合:Scafe与现有的基于视觉的分数(如局部相似度分数、内部置信度)进行乘法融合,以校准局部视觉证据:
Scls(o)=Scafe(o)⋅Slocal(o)
2. 上下文一致性分数(Sccs)
该组件解决了图像块级视觉嵌入的局限性,后者可能无法区分具有相似局部纹理的物体。
- 机制:聚合那些为物体 token 分配高概率的指令嵌入,以形成全局上下文表示(zˉ)。
- 逻辑:指令嵌入捕捉全局物体上下文。生成的物体 token 嵌入(ho)与聚合的指令上下文(zˉ)之间的一致性,使用归一化的 ℓ2 距离进行测量。
- 加权:一致性分数由所选指令嵌入的平均置信度进行加权,以确保可靠性:
Sccs(o)=Scon(o)⋅p(o∣{z^1,...,z^m})
最终评分
最终的InsLen分数是校准局部分数和上下文一致性分数的加权组合:
SIns(o)=ω⋅Scls(o)+(1−ω)⋅Sccs(o)
其中 ω 为超参数。
主要贡献
- 指令嵌入分析:作者揭示了 MLLM 中的指令嵌入隐式编码了可靠的视觉语义,并能有效过滤源自视觉嵌入的误导性信息,这一能力此前在幻觉检测中被忽视。
- 提出的检测器(InsLen):一种新颖的、无需训练的检测器,它将校准后的视觉证据与基于指令的上下文一致性相结合,无需辅助模型或额外训练。
- 全面评估:在多个基准测试(MSCOCO、Objects365、POPE、CLEVR)和多样化的 MLLM 架构(LLaVA-1.5、InstructBLIP、mPLUG-Owl3、Qwen3-VL、LLaVA-OneVision)上进行的广泛实验证明了该方法的有效性。
实验结果
- 性能:在所有测试的基准测试和模型架构中,InsLen 的表现始终优于现有的最先进方法(如 GLSIM、SVAR、Internal Confidence)。
- 在带有 Qwen3-VL 的MSCOCO基准测试中,InsLen 将 AUROC 提高了7.70%,超过了最强的基线(GLSIM)。
- 在POPE基准测试中,对于 LLaVA-1.5,其 AUROC 比基线高出高达13.81%。
- 在CLEVR基准测试(测试属性和关系幻觉)中,InsLen 表现出优越性能,特别是在 Qwen3-VL 等更强模型上(77.72% AUROC 对比 SVAR 的 73.01%)。
- 鲁棒性:该方法在微调后的模型(如 LLaVA-RLHF、LLaVA-RLAIF-V)上依然有效,并在不同的输入指令长度和超参数设置(ω、m、τ)下表现出稳定性。
- 效率:虽然相比某些基线(例如 LLaVA-1.5 约为 104 毫秒对比 95 毫秒)引入了稍高的计算开销,但相对于答案生成而言成本微乎其微,且显著低于需要辅助模型或清零操作(如 EAZY)的方法。
意义与主张
本文主张,指令透镜分数提供了一种有价值且未被充分探索的信号,用于提高 MLLM 生成的可靠性。通过证明指令嵌入能有效抑制误导性视觉信息,这项工作为幻觉检测提供了新视角,无需依赖外部资源或重新训练。作者将 InsLen 定位为一种稳健的、即插即用的解决方案,能够增强 MLLM 在现实世界应用中的可信度,在这些应用中,物体幻觉构成了重大风险。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。