← 最新论文
💻 computer science

UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

本文提出了 UHP 检测,这是一种新颖的黑盒框架,它将幻觉建模为跨越由扰动模态和逻辑极性定义的四个一致性组的结构化不确定性模式,通过捕捉大型视觉语言模型中独特且可泛化的幻觉行为,显著优于现有方法。

原作者: Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia, Mohamad Amin Yousefi, Asal Mohammadjafari Mamaqani, Behrad Samimi, Mohammad Hossein Rohban

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia, Mohamad Amin Yousefi, Asal Mohammadjafari Mamaqani, Behrad Samimi, Mohammad Hossein Rohban

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在和一个非常聪明、非常自信,且能够看图并回答问题的机器人交谈。这个机器人属于一种被称为“大型视觉语言模型”(LVLMs)的新一代人工智能。把它们想象成一个读遍了整个互联网、同时也能够观察照片的“超级大脑”。它们在描述所见事物方面表现出色,但也有一个古怪的缺陷:有时它们会编造事实。在人工智能领域,这被称为“幻觉”。这就像是一个学生,当被问及一张猫的照片时,却自信满满地告诉你那只猫戴着一顶帽子,尽管帽子根本不存在。这是一个大问题,因为如果我们将这些机器人信任用于辅助医生或驾驶汽车,它们的编造故事可能会导致现实世界的错误。

有一段时间,科学家们试图通过检查机器人的“不确定性”来抓捕这些谎言。旧的想法很简单:如果机器人听起来很不确定,或者在以略微不同的方式被问及同一个问题时给出不同的答案,那么它很可能在撒谎。但研究人员发现这个计划中有一个漏洞。有时,机器人即使在编造彻头彻尾的谎言时,也可以表现得极其自信且一致。这就像是一个圆滑的骗子,从不改变自己的说法;仅仅通过检查“摇晃”或“不确定性”是抓不住他们的。大问题变成了:当骗子表现得完美一致时,我们该如何识破谎言?

这就是一项名为 UHP 检测(独特幻觉模式,Unique Hallucination Pattern)的新研究介入的地方,它提出了一个聪明的解决方案。研究人员意识到,我们不应该寻找单一的不确定性迹象,而应该寻找一种特定的行为模式。他们用两条主要规则与机器人进行了一场游戏:

  1. “什么”规则: 他们通过两种方式改变输入。有时他们微调图片(比如改变光照或缩放),有时他们微调问题(比如重新组织措辞)。
  2. “是/否”规则: 他们要求机器人检查一个正确的陈述(例如,“有一只猫”)及其完全相反的陈述(例如,“没有猫”)。

通过混合这些规则,他们创建了四个不同的“房间”或组别来测试机器人。在一个完美的世界里,如果机器人对“有一只猫”说“是”,那么对于“没有猫”,它应该说“否”,并且即使你稍微改变图片,它也应该保持说法一致。但是,当机器人产生幻觉时,它不仅仅是感到困惑,它会以一种非常特定、奇怪的方式感到困惑。它可能会在改变图片时保持一致,但在改变措辞时前后矛盾;或者它可能在一个房间里认同一个谎言,但在另一个房间里自我矛盾。

团队构建了一个轻量级的“侦探”(一个简单的计算机程序),它会同时观察机器人在所有四个房间中的行为表现。他们发现,幻觉并非随机的错误;它们会留下独特的指纹。在对三种不同 AI 模型的测试中,这种新方法在捕捉谎言方面比旧方法更有效。它将识别幻觉的能力在某项指标上提升了高达 18.72%,在另一项指标上提升了 20.07%,甚至击败了那些需要窥探机器人“大脑内部”的最先进方法。

研究人员还展示了这种“指纹”是真实存在的,而非偶然现象。当他们在一组谜题上训练侦探,并在另一组完全不同的谜题上进行测试时,它仍然表现良好。这表明,这些 AI 模型撒谎的方式是它们思维方式中一个基本组成部分,而不仅仅是针对某个特定测试的错误。这项研究证明,要抓住幻觉,你不能仅仅问:“你确定吗?”你还需要问:“当我从各个角度去戳它时,你的故事还能站得住脚吗?”通过绘制这些独特的连贯性模式,我们终于可以在这些自信的骗子造成麻烦之前抓住它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →