← 最新论文
🤖 AI

Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability

本文引入了一个统一的理论框架和一种被称为正交语义投影(OSP)的几何干预方法,通过将查询向量与干扰概念进行正交化处理,以确保稳健的可解释性,从而在数学层面解释并缓解视觉语言模型解释中的语义幻觉问题。

原作者: Emirhan Bilgiç, Baptiste Caramiaux, Zhi Yan, Gianni Franchi

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Emirhan Bilgiç, Baptiste Caramiaux, Zhi Yan, Gianni Franchi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

论文解析:《解构幻觉:用于鲁棒可解释性的正交语义投影》

这里使用简单的语言和富有创意的类比来解释这篇论文。

问题所在:“混乱的手电筒”

想象你有一个智能摄像头系统(视觉语言模型),它能够观察图片并告诉你其中有什么。为了确保我们信任这个摄像头,我们会使用一种叫做 XAI(可解释人工智能) 的特殊工具。这个工具就像一个手电筒热力图,照亮图像中摄像头在做决策时所“注视”的部分。

问题在于: 有时这个手电筒会感到困惑。
如果你问摄像头:“在哪里?”而照片里实际是一只,手电筒可能仍然会明亮地照在狗身上。这就像是手电筒在想:“好吧,狗和猫都是长着毛且有四条腿的动物,所以即使你问的是猫,我也会把光照在狗身上。”

论文将这种现象称为 “语义幻觉”(Semantic Hallucination)。这种解释看起来很有说服力,但它在撒谎。它在错误的对象上高亮显示,因为计算机大脑中的概念过于“粘稠”且混杂在一起。

成因:“拥挤的思想之屋”

为什么会发生这种情况?论文认为,在计算机的大脑内部,所有的词汇和图像都生活在一个巨大的、高维度的房间里。

  • 在这个房间里,“猫”的概念和“狗”的概念并不是各自独立的角落。
  • 相反,它们站得很近,共享着一部分空间,因为它们拥有共同的特征(比如“毛发”或“爪子”)。

当计算机试图寻找“猫”时,它抓取了整个“猫性”的集群。但由于“狗”就站在旁边并共享了部分空间,计算机不小心也把“狗”的部分给抓了过来。这被称为 “线性语义泄漏”(Linear Semantic Leakage)。这些想法因为没有被完美分离而相互“泄漏”了。

解决方案:“降噪”过滤器

作者提出了一种名为 正交语义投影(Orthogonal Semantic Projection, OSP) 的新方法。你可以把它想象成计算机思维中的一个智能降噪过滤器

以下是它的工作步骤:

  1. 干扰项词典: 在计算机观察图像之前,OSP 会创建一个“干扰项”列表。如果你正在寻找“猫”,系统知道“狗”、“狮子”和“老虎”是近亲。它会收集这些干扰项的数学“特征”。
  2. 几何清理: OSP 获取计算机的“猫”概念,并在数学上将其推离“狗”、“狮子”和“老虎”的概念。
    • 类比: 想象你试图在一个嘈anda的房间里听一首特定的歌(“猫”),而周围的人都在唱着类似的曲调。OSP 就像是戴上了一副主动降噪耳机,专门抵消掉那些正在唱关于狗和狮子歌曲的人的声音。
  3. 纯净信号: 剩下的就是一个“纯净化”版本的“猫”概念。它已经剥离了所有与其他动物共有的特征。它现在与干扰项是 正交的(Orthogonal)(即处于完美的 90 度角)。
  4. 结果: 当计算机使用这个纯净的“猫”概念来投射它的手电筒时,它会完全忽略那只狗。热力图现在只会照亮真正的猫,或者如果根本没有猫,则什么都不照亮。

为什么这很重要

论文证明了这不仅仅是针对某一种特定摄像机的技巧;它适用于许多不同的 AI 模型(如 CLIP、SigLIP 和 Stable Diffusion)以及许多不同的热力图生成方式。

  • 它停止了谎言: 计算机不再仅仅因为某些物体看起来相似就去高亮显示并不存在的物体。
  • 它保留了真相: 它不会降低计算机寻找“正确”物体的能力;事实上,它通常会让“正确”的高亮变得更加精准。
  • 它是一个即插即用的工具: 你不需要重新训练整个 AI。你只需要在生成解释之前添加这个“过滤器”步骤。

证明过程

研究人员在数千张图像上进行了测试。

  • 定量证明: 他们测量了 AI 正确识别目标对象并忽略错误对象的频率。这个“过滤器”(OSP)显著提高了这些得分。
  • 人类实验证明: 他们向 200 名真实的人展示了热力图。当使用旧方法生成热力图时,人们经常会被错误的亮点所迷惑或误导。当他们看到由新方法 OSP 生成的热力图时,人们能更好地猜出 AI 正在看什么,并且对答案感到更加自信。

总结

简而言之,这篇论文介绍了一种在 AI 尝试自我解释之前,先清理其词汇表的方法。通过在数学上分离相似的概念(如猫和狗),使它们不再互相渗透,AI 终于可以精准地指向你所要求的确切事物,而不会意外地照亮旁边的错误物体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →