← 最新论文
🤖 AI

Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

该论文引入了 CEDI,这是一个动态的多轮交互框架,通过揭示多模态大语言模型相比于传统评估方法而言显著更多且更加真实的视觉幻觉,弥合了静态基准测试与实际应用之间的差距。

原作者: Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何观察世界。长期以来,科学家们通过给机器人展示一张照片并问它:“你看到了什么?”来测试这些机器人。这就像是一场随堂测验,机器人必须针对一张照片写一篇短文。如果机器人抓住了主要事物,它就能得到 A 等级。但在现实世界中,我们并不只是盯着照片写文章。我们会与我们的设备交谈。我们会问:“那是狗吗?”接着问:“它的项圈是什么颜色的?”然后又问:“等等,那是狗还是狐狸?”我们进行对话。我们改变主意。我们感到困惑。问题在于,我们旧有的“随堂测验”式测试无法捕捉到机器人在与我们实际聊天时犯下的错误。它们可能通过了测验,但在对话中却失败了——为了维持对话而编造不存在的事实。这非常重要,因为如果一个机器人在驾驶汽车或协助医生,编造事实可能会带来危险。我们需要一种能够以我们实际使用它们的方式来测试它们的方法:即在混乱的、往复式的聊天中进行测试。

这篇论文介绍了一种测试这些“视觉语言模型”(VLMs)的新方法,称为 CEDI。把 CEDI 想象成不是一场考试,而是一场三人剧。首先,你有一个机器人(被测试的模型)。其次,你有一个侦探(自动考官)。第三,你有一个法官(评分员)。侦探不仅仅是给机器人看一张图片然后就走开。相反,侦达被赋予了一张图片的秘密地图(称为“场景图”)和一个特定的目标,比如“寻找停车位”。然后,侦探开始与机器人进行对话,提出的问题随着聊天的深入变得越来越难、越来越具体。侦探可能会问:“有一辆红色的车吗?”如果机器人回答有,侦探可能会追问:“它是哪种型号的?”甚至可能试图通过问“为什么那辆蓝色的车停在那里?”来欺骗机器人,而实际上并没有蓝色的车。其目的是观察机器人是否会为了让对话继续下去而开始编造事实(幻觉)。

作者发现,这种“侦探”方法比旧的“随堂测验”式方法更能捕捉到谎言。当他们将 CEDI 应用于几种不同的机器人时,他们发现这些机器人编造虚假细节的情况比旧测试显示的要显著更多。例如,在一个数据集中,新方法发现机器人的“幻觉率”比旧方法高出了 5 到 23 个百分点。当对话变长时,机器人也更容易撒谎。看起来,随着聊天的进行,机器人会被自己之前的回答所迷惑,并开始强化自己的错误,就像一场“传声筒”游戏,信息变得越来越错误。

论文还表明,机器人在说“我不知道”方面表现得很糟糕。当侦探基于一个错误的假设提问时——比如图中并没有人,却问“那个男人手里拿着什么?”——机器人通常仍会尝试回答,甚至凭空捏造出一个男人和一顶帽子。它们在应该拒绝错误观点时表现得最差。该系统中新的“法官”使用了一种特殊的图匹配评分,能够比以往的工具更一致地捕捉到这些谎言,并且比旧方法更符合人类法官的意见。

简而言之,这篇论文表明,用单向提问来测试机器人的旧方法忽略了它们面临的巨大问题。通过转向一种模拟现实生活的动态、多轮对话,我们可以看到这些机器人更容易编造事实,尤其是在它们试图维持对话或被错误假设误导时。作者并不是说这些机器人坏掉了,而是说我们需要停止像对待一场无声考试那样测试它们,而应该像测试一场对话那样测试它们,因为真正的麻烦就隐藏在其中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →