← 最新论文
💻 computer science

DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models

本文提出了 DO-Bench,这是一个通过“先验覆盖”和“感知受限”两个维度的受控干预,旨在将视觉语言模型(VLM)的对象幻觉归因为文本先验干扰或感知能力不足的诊断性基准测试。

原作者: JiYang Wang, Jiawei Chen, Mengqi Xiao, Yu Cheng, Yangfu Li, Zhaoxia Yin

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: JiYang Wang, Jiawei Chen, Mengqi Xiao, Yu Cheng, Yangfu Li, Zhaoxia Yin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一个名为 DO-Bench 的新工具,它的目的是为了给现在的“多模态大模型”(也就是既能看图又能说话的 AI,比如 GPT-4V)做一次深度“全身检查”。

为了让你听明白,我们不用学术术语,我们来打个比方。

1. 背景:AI 的“幻觉”问题

想象一下,你正在和一个小朋友玩“找茬”游戏。你指着一张照片问他:“图里有没有一只穿着西装的小猫?”
如果照片里明明有一只猫,小朋友却说“没有”;或者照片里根本没猫,他却信誓旦旦地说“有”,这就是所谓的**“幻觉”(Hallucination)**。

现在的 AI 经常犯这种错。但问题是,当 AI 犯错时,我们不知道它到底是怎么想歪的。它是**“眼睛没看清”(视觉能力不行),还是“被带节奏了”**(被你说话的方式误导了)?

2. 核心矛盾:是“眼瞎”还是“耳背”?

目前的测试方法就像是只给 AI 打个总分。比如 AI 答对了 80 分,我们只知道它表现不错,但不知道它是靠“眼睛好”还是靠“猜得准”。

这篇论文的研究者认为,AI 的错误通常来自两个完全不同的“病灶”:

  • 病灶 A:视觉感知力不足(眼瞎) —— 东西就在那,但太小了、太模糊了,AI 没瞧见。
  • 病灶 B:过度受文本暗示影响(耳背/被带节奏) —— 你说话的语气太笃定了,AI 虽然看到了,但为了“顺着你说话”,硬说自己没看到。

3. DO-Bench 是怎么做的?(“压力测试”实验室)

为了把这两个问题拆解开,研究者设计了一个非常精妙的“实验室”。他们不再只是问 AI 一个问题,而是针对同一张图,玩起了**“变脸游戏”**:

第一招:针对“眼瞎”——放大镜测试(Perception-Limited)

如果 AI 说没看到某个东西,研究者会拿出一个**“放大镜”**(把物体局部裁剪出来,放大给 AI 看)。

  • 逻辑是: 如果放大看之后,AI 马上就认出来了,说明它之前不是“没看到”,而是“没看清”。这就证明它的问题出在视觉感知上。

第二招:针对“被带节奏”——心理暗示测试(Prior-Override)

如果 AI 表现正常,研究者就开始**“洗脑”**。

  • 逻辑是: 同样一张图,研究者会改变提问的语气。
    • 第一次问:“图里有猫吗?”(中性语气)
    • 第二次问:“我觉得图里好像没猫,你觉得呢?”(轻微暗示)
    • 第三次问:“我敢肯定图里绝对没有猫,你确定吗?”(强力洗脑)
  • 如果随着暗示越来越强,AI 竟然开始跟着瞎说,那说明它的**“抗干扰能力”**太差,容易被语言带节奏。

4. 结论:AI 的成长并不均衡

通过这个测试,研究者发现了一个很有趣的现象:现在的 AI 并不是“全能型选手”。

有些大模型虽然“眼睛”越来越亮了(看清细节的能力在变强),但它们的“脑子”依然容易被带节奏(抗干扰能力没怎么进步)。这就好比一个学生,虽然视力练好了,但性格还是太软,老师稍微暗示一下,他就会跟着错。

总结一下

DO-Bench 就像是一个**“AI 诊断仪”。它不只看 AI 考了多少分,还要通过“放大镜”和“心理暗示”这两套组合拳,精准地告诉开发者:“你的 AI 是因为眼睛没看清而犯错,还是因为太听话而被带偏了?”**

有了这个工具,科学家们就能更有针对性地给 AI “补课”——是该练眼睛(视觉训练),还是该练定力(语言逻辑训练)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →