← 最新论文
💬 NLP

Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue

本文揭示了视觉语言模型倾向于通过将仅有的任务相关内容的出现与已建立的共同基础相混淆,从而高估协作对话中的相互理解,这种偏差是由静态指称线索而非动态对话历史所驱动的。

原作者: Nan Li, Albert Gatt, Massimo Poesio

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Nan Li, Albert Gatt, Massimo Poesio

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:“看见”并不等于“共享”

想象你和一位朋友正试图在两张不同的地图上画出路线。你们两人各有一张地图,但它们并不完全相同。也许你的地图顶部有一个“停放的货车”,而你朋友的地图底部也有一个。

当你提到“去那个停放的货车”时,你想到的是顶部的那个;而你的朋友想到的是底部的那个。尽管你们使用了相同的词汇,但你们实际上还没有就“是哪一个”达成共识。

在人类对话中,我们通过来回交谈来解决这个问题:“等等,你是说公园附近的那个吗?”“噢,不,我是说面包店旁边的那个。”这种检查和确认的过程被称为语境化(Grounding)

问题所在:
研究人员提出了一个问题:现代 AI 模型(视觉语言模型)能否区分“我们“可能”共享的内容”与“我们“已经”共享的内容”?

他们通过扮演一个“第三方观察者”(旁听者/Overhearer)来进行测试。AI 可以看到地图并听到对话,但它无法提问或插话进行澄清。

主要发现:AI 太过乐观了

研究人员发现,当给 AI 实际的地图时,它识别正确答案的总能力提高了,但是它变得危险地过度自信了。

类比:“共存(Co-Presence)”陷阱
想象你正从阳台上观看一场戏。你看到两名演员站在一把红椅子旁边。

  • 演员 A 认为这把椅子是给反派用的。
  • 演员 B 认为这把椅子是给英雄用的。
  • 他们还没有谈论关于这把椅子的话题。

因为你(观察者)能看到这把椅子就在那里,供两人共同使用,所以你的大脑会假设他们一定是在谈论同一件事。你会想:“噢,他们肯定达成共识了!”

AI 也做了完全一样的事情。当它在两张地图上都看到同一个地标(比如“停放的货车”)时,它就假设说话者已经就此达成了共识。它混淆了潜力(该物体在两张地图上都存在)与现实(说话者是否已经确认了他们指的是同一个物体)。

实验过程:什么改变了 AI 的想法?

研究人员在不同的条件下测试了 AI,以观察是什么导致了这种“过度乐观”。

1. 视觉陷阱(地图 vs. 文本)

  • 真实地图: 当 AI 看到实际的地图图像时,它过于频繁地回答“是的,他们达成共识了!”
  • 文本描述: 当他们用简单的文本列表替换图像(例如“地图 A 有一辆货车;地图 B 也有一辆货车”)时,AI 仍然过于频繁地回答“是的,他们达成共识了!”
  • 空白/打乱的地图: 当他们向 AI 展示空白的灰色方块或打乱的地图碎片(没有任何有用信息)时,AI 变得非常谨慎。它停止了猜测“是”,转而开始猜测“否”。

教训: 问题不在于 AI 不擅长“看”图片,而在于它不擅长解释信息。无论信息是以图片还是文本列表的形式呈现,只要 AI 看到一个物体是可以被共享的,它就会假设它已经被共享了。

2. “旁听者”效应
AI 在结构上是一个“旁听者”。它听到了每一个字,但无法参与其中。

  • 人类知道,仅仅因为两个人正在看同一个物体,并不意味着他们在共同讨论它。
  • AI 则认为:“我看到两个地图上都有这个物体,所以他们一定是在共同讨论它。”

它将物体存在视为相互理解的证据。

结果:一种权衡

AI 的行为呈现出一种特定的模式:

  • 当说话者确实达成一致时: AI 能很好地识别这一点(尤其是在有地图的情况下)。
  • 当说话者产生困惑或尚未达成一致时: AI 在识别这一点方面表现得很糟糕。即使在说话者各说各话的情况下,它也会自信地回答“他们达成共识了!”

这就像一个学生,对于自己已经知道答案的问题表现出色,但当遇到困惑时,他会因为认为问题显而易见而自信地猜错答案。

哪些 AI 模型表现出了这种现象?

研究人员测试了多个模型。

  • Qwen3-VL-8B: 该模型最清晰地展示了这种偏差。在涉及地图时,它在错误答案上表现得非常自信。
  • Gemma3 模型: 它们的表现不同。有些模型因为被复杂的地图绘图搞糊涂了,甚至几乎不去尝试回答。
  • 规模并不重要: 增大模型规模并没有解决问题。事实上,更大的模型往往在错误的答案上表现得更加自信。

总结

论文得出结论,目前的 AI 模型擅长静态分析(观察地图并看到什么可能被共享),但缺乏动态追踪的能力(观察对话以观察什么已经被共享)。

它们将达成共识的可能性误认为是实际的共识。它们看到了地图上的“共同基础”,并假设说话者已经搭建了跨越它的桥梁,即便说话者甚至还未开口谈及此事。

简而言之: AI 看到了地图,便假设每个人都在同一频道上,并自信地忽略了说话者可能正在阅读完全不同的章节这一事实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →