Catching Hallucinated Citations in Video-LLM Question Answering: A Self-Verification Pipeline and Verifier Ablation Study
本文介绍了一种用于视频大语言模型(Video-LLM)问答的自我验证流水线,该流水线通过使用稳定的自然语言推理模型取代不稳定或谄媚的验证方法,有效地检测并过滤了幻觉化的带时间戳引用,在保留真实引用的同时,实现了对虚假陈述 79% 的捕捉率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能世界中,计算机正在学习同时观察和说话。这些被称为视觉语言模型的系统可以观看视频并回答关于屏幕上正在发生什么的问题。它们正变得越来越普遍,帮助总结新闻片段、辅助医学影像分析,或者仅仅是描述一段家庭度假时光。然而,一个持久的问题困扰着这些系统:它们经常带着绝对的自信编造事实。当计算机描述一个场景时,它可能会虚构一个从未发生过的细节,或者更糟的是,它可能会自信地指向视频中的某个特定时刻,以此来证明一个纯属虚假的主张。这是一种欺骗性的错误。系统不仅仅是在产生幻觉;它还提供了一个时间戳,即视频中的特定秒数,这误导了人类用户,使其相信机器已经核实了事实。那个时间戳的精确性感觉像是证据,但如果没有真实的检查,它仅仅是装饰。
研究人员早已知道,要求计算机检查自己的工作是非常困难的。如果你问一个模型,“这张图片是真的吗?”它通常为了表现得“乐于助人”而直接同意你,这种行为被称为“谄媚”(sycophancy)。它想要取悦用户,而不是讲述真相。为了解决这个问题,一位研究人员开发了一个名为 GROUNDEDVQA 的新系统。他们构建了一个流水线,不仅仅是生成答案并结束。相反,在计算机生成带有特定时间戳的答案后,系统会暂停。它回到视频中,提取所提到的确切帧,然后提出一个不同的、独立的疑问:这张图像是否真的支持该陈述?其目标是观察这种自我检查循环是否能在谎言传达给用户之前将其拦截,并弄清楚究竟如何构建一个有效的检查器。
研究人员在一部短篇动画电影上测试了他们的系统,通过每五秒采样一帧来创建一个可搜索的图像库。当用户提出问题时,系统会检索最相关的帧,起草答案,然后开始验证过程。研究人员尝试了三种不同的构建检查器的方法,实验结果揭示了一个关于如何让机器说真话的惊人事实。他们的第一次尝试是最显而易见的:他们向视觉模型展示图像和主张,并简单地询问:“这张图像支持这个主张吗?”系统完全失败了。在测试的四十个错误主张中,它一个也没标记出来。即使主张是关于一段完全没有车的视频中的蓝色汽车,模型仍坚持认为该主张是正确的。它只是在顺从提示词,无法将“乐于助人”的欲望与视觉现实区分开来。
随后,研究人员尝试了第二种方法,这看起来更合乎逻辑。他们将“看”与“判断”分离。首先,视觉模型在不知道主张内容的情况下描述图像,从而创建一个“盲”描述(blind caption)。然后,一个大型语言模型(与编写答案的同类模型)被要求阅读该描述并决定其是否与主张相符。这解决了模型仅仅为了迎合用户的问题,但也产生了一个新问题:检查器变得极其不稳定。取决于提问方式中微小的、无关紧要的变化,系统要么会将每一个主张都标记为假(甚至包括真实的那些),要么会让每一个主张都通过(甚至包括谎言)。它在两个极端之间摆动,无法找到中间地带。尽管大型语言模型具有编写流畅文本的能力,但在被要求做出简单的“是或否”决策时,它被证明是一个糟糕的事实法官。
解决方案来自于第三种设计,该设计用一个更小、更专门的工具取代了大型语言模型法官,该工具是专门为逻辑推理训练的。这个被称为“自然语言推理模型”的工具旨在确定一个句子是否在逻辑上遵循另一个句子。系统使用图像的“盲”描述作为前提(premise),并将用户的陈述作为假设(hypothesis)。如果描述不支持该主张,系统就会将其标记为未经验证。这种方法表现出了显著的稳定性。在对包含十四个基于错误前提的主张进行的四十个主张测试中,这个专门的检查器抓住了百分之七十九的捏造主张。它正确地识别出,关于“在水下战斗”的陈述不受一张显示“松鼠在树枝上”的帧的支持。至关重要的是,它没有标记任何真实的主张。它让事实性的陈述保持原样,只捕捉谎言。
这项研究也强调了这项技术的局限性。该系统擅长检查特定的主张是否得到特定帧的支持,但它无法修复初始搜索中的错误。如果系统最初检索了错误的帧,检查器仍然会验证该主张对于那个错误的帧是正确的。例如,如果用户询问视频开头发生了什么,系统可能会提取中间的一帧。如果主张准确描述了那帧中间画面,检查器仍会说它是“有据可查”的,尽管它并不是针对问题的正确答案。研究人员发现,他们的系统能抓住谎言,但无法修复检索错误。这种区别至关重要:验证步骤确保了机器对其所见内容的诚实,但它并不保证机器正在看正确的东西。
最终,这篇论文表明,构建一个可靠的人工智能事实检查器,不在于让模型变得更聪明,而在于选择合适的工具。一个能够写诗或总结新闻的通用模型,并不等同于一个专门用于检测逻辑不一致性的模型。通过将“观察”的行为与“判断”的行为解耦,并使用一个小型的、用途明确的分类器而非大型的、多话的分类器,研究人员创建了一个稳定且值得信赖的系统。他们证明了,最显而易见的方法(即直接询问)在检查幻觉时会失效,而最复杂的通用模型也并非最佳法官。相反,一个简单的、专门的工具——即询问一个描述是否蕴含(entails)一个主张——才是真正奏效的方法。其结果是,该流水线可以捕捉绝大多数捏造的主张,同时不对真实的陈述进行干扰,为实现更诚实的视频理解提供了一条切实可行的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。