← 最新论文
💬 NLP

EgoArgus: Benchmarking VLMs as Situational Assistants for Modality-Grounded User Supports

本文介绍了 EgoArgus,这是一个经人工标注的基准数据集,旨在评估视觉语言模型在日常场景中通过在视觉证据与用户对话之间进行仲裁,从而作为可靠的第一视角助手的能力,并揭示了当前在模态信任评估方面的局限性以及现有偏差缓解方法受限的有效性。

原作者: Yu-Chien Tang, Yu-Hsiang Liu, An-Zi Yen

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu-Chien Tang, Yu-Hsiang Liu, An-Zi Yen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一副能够看见你所见、听见你所言,并能实时提供有用建议的眼镜。这就是被称为“视觉-语言模型”的新一代人工智能所许下的承诺。这些系统旨在充当日常助手,通过安装在头部或胸部的摄像头观察世界,同时倾听你的对话。它们旨在理解你的处境,预测你下一步可能做什么,并在必要时提供警告或建议。但为了让这些助手真正可靠,它们必须解决一个难题:当它们看到的视频与你所说的话讲述了不同的故事时,它们应该信任哪一个?

台湾阳明交通大学的研究人员构建了一项新测试,以观察当前的人工智能是否能够处理这种冲突。他们创建了一个名为 EgoArgus 的数据集,模拟了用户与助手之间五种不同类型的日常互动。在某些场景中,视频和对话是一致的,共同描绘出一幅清晰的画面。而在另一些场景中,对话可能与屏幕上发生的事情完全无关,或者具有礼貌性的误导性。最具有挑战性的情况发生在用户说一套、而摄像头显示的却是另一套时,例如一个人声称已经关掉了水龙头,但水仍在流。研究人员想看看人工智能能否忽略误导性的言语并依赖视觉证据,还是会感到困惑并误入歧途。

为了进行这项测试,团队从人们从事日常任务(如烹饪、购物或驾驶)的真实生活视频中收集了数千个示例。他们将这些视频与符合其五种场景的对话配对。他们还创建了合成片段,让 AI 助手决定是该开口说话还是保持沉默。结果是令人震惊的。当用户的言语与视频相矛盾时,人工智能模型的表现极其糟糕。它们并没有信任显示真相的摄像头,而是盲目地跟随了用户错误的陈述。在这些矛盾的情况下,模型的表现甚至比随机猜测还要差。它们会证实用户的错误而非进行纠正,或者会根据屏幕上实际发生的情况提出毫无意义的建议。

该研究还考察了人工智能是否可以决定何时介入。一个好的助手知道何时该说话,何时该保持安静。研究人员发现,即使是最强大的模型也在这种平衡中挣扎。有些模型过于急躁,在没有任何问题时发出警告,而另一些模型则完全错过了真正的安全隐患。当它们介入时,时机也往往不对,要么在证据不足时过早行动,要么在问题已经发生后才行动。团队尝试了多种方法来修复这些错误,例如强制模型更多地关注视频,或训练它们优先考虑视觉证据而非文本。这些尝试仅提供了有限的帮助。模型仍然顽固地偏向于文本,这表明仅仅调整它们的注意力不足以让它们变得可靠。

对这些模型如何思考的进一步调查揭示了问题根源之深。研究人员深入观察了模型如何处理视频和文字。他们发现,模型在很长一段时间内都将这两类信息混合在一起。直到处理的最后阶段,模型才开始将视觉证据与口头语言分离。然而到那时,决策往往已经被误导性的对话所左右。这表明这些模型缺乏一种在实时情况下权衡冲突证据的稳健机制。它们可以区分图片和句子,但当两者不一致时,它们并不总能判断哪一个是真相。

研究结果表明,尽管这些人工智能系统在理解世界方面变得越来越好,但它们尚未准备好作为独立的日常助手被信任。它们缺乏在嘈杂环境中进行判断所需的批判性思维,在这些环境中,人类的言语可能是错误的、无关的,甚至是欺骗性的。为了让这些助手真正变得有用,它们不仅需要学会看和听,还需要学会何时该相信眼睛而非耳朵。在它们能够做到这一点之前,它们仍然容易被带偏,即便答案就在眼前。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →