← 最新论文
💻 computer science

VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

该论文提出了 VADER,这是一个无需训练的框架,通过将注意力动态重新分配给视频证据并选择性地擦除视觉标记以构建一个鲁棒的对比解码分支,从而缓解视频大语言模型中的幻觉问题。

原作者: Dong Xing, Jiaxin Chen, Hang Yang, Peixun Liu, Qiushi Yang, Yuqing Wang

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Dong Xing, Jiaxin Chen, Hang Yang, Peixun Liu, Qiushi Yang, Yuqing Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在与一个超级聪明的机器人对话,它看过数百万部电影,并能用完美的句子来描述它们。这个机器人是一个“视频大语言模型”(VideoLLM)。它就像一个永不疲倦的讲故事的人,但它有一个棘手的习惯:有时,它会因为对自己的声音过于自信,而编造一些实际上并不存在的细节。它可能会告诉你一个角色“跳过了栅栏”,而视频中其实只显示他们在走路,仅仅是因为在电影中这是人们常做的事情。这被称为“幻觉”。

这个问题在视频领域尤其棘手。与单张照片不同,视频是一个长长的帧流。如果机器人错过了其中一帧的细节,它通常可以通过观察前后的帧来推断出来,因为前后的帧看起来通常非常相似。这就像如果你错过了一首歌里的一个词,你可以通过前后相似的词来猜出它。因此,过去用来阻止机器人撒谎的技巧——比如直接模糊掉图像的一部分——往往会失效。机器人会利用周围的帧来填补空白。科学家们希望解决这个问题,而不必重新从头教起机器人,因为那将耗费漫长的时间和巨额的成本。他们需要一种方法,让机器人在说话的瞬间,能更密切地关注它实际看到的内容。

于是有了 VADER,一种为这些视频机器人充当“聪明编辑”的新方法。VADER 并不强迫机器人学习新规则,而是在对话过程中介入,轻轻地引导机器人的注意力。它使用两个巧妙的技巧来阻止机器人凭空捏造。

首先,它使用了一个名为**视觉焦点重分配(VFR)*的工具。把机器人的大脑想象成一个繁忙的厨房,里面有很多厨师(层)在同时工作。有些厨师在观察视频,而另一些则在闲聊食谱(文本)。有时,那些闲聊的厨师会变得太大声,从而盖过了观察视频的厨师。VFR 就像是一个动态音量旋钮。它会倾听特定的视频和问题,弄清楚究竟哪些厨师在讨论视频,然后调高他们的音量,同时调低闲聊的声音。它不会对每个视频都使用固定的设置;相反,它会诊断情况并决定:“好吧,对于这个*特定的场景,我们需要多听取 20% 的视频证据。”

其次,VADER 使用了一个名为**选择性证据擦除(SEE)**的技巧。这变得非常有趣。想象一下,你正试图猜测一部电影的剧情,但你只能看背景布景,不能看主角。如果你仍然能正确猜出剧情,这意味着你只是根据电影中通常会发生的事情进行猜测(你的“先验偏差”)。如果你猜错了,这证明你确实依赖了演员。VADER 通过在机器人的大脑内部,逐帧地秘密“擦除”最重要的视觉线索(比如主角)。它创造了一个关于故事的“假设”版本,在这个版本中,机器人必须在没有关键证据的情况下进行猜测。如果机器人在这种“被擦除”的版本中仍然给出相同的答案,VADER 就知道机器人只是在根据习惯进行猜测,而不是基于实际的视频内容。

最后,VADER 会将机器人的“真实”答案与“被擦除”后的答案进行比较。如果机器人在两种情况下都很有信心,它就知道这个答案很可能是一个幻觉,并会抑制它。如果移除证据后答案发生了变化,VADER 就知道机器人实际上是在关注视频。

结果令人印象深刻。当研究人员在名为 LLaVA-Video-7B 的流行机器人上测试时,它在识别真实事件和保持时间线准确方面表现得更好。在名为 EventHallusion 的特定测试中,机器人的准确率跃升至 72.60%。这是一个了不起的成就,因为它击败了其他需要昂贵重新训练的方法。这篇论文表明,通过仅仅调整机器人注意力的分配方式,并在运行过程中测试其自身的偏差,我们可以让视频 AI 变得更加诚实,而无需教会它一门全新的语言。这提醒了我们,有时候,阻止一个骗子最好的办法,就是让他闭上眼睛讲故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →