← 最新论文
🤖 AI

CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering

本文介绍了 CRAFT,这是一种以查询为条件的流水线,它结合了动态关键帧选择、多语言自动语音识别以及混合批判循环,通过迭代验证主张并整合带有精确来源归属的证据,在基于证据的多视频问答任务中实现了最先进的性能。

原作者: Mahesh Bhosale, Abdul Wasi, Vishvesh Trivedi, Pengyu Yan, Akhil Gorugantu, David Doermann

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Mahesh Bhosale, Abdul Wasi, Vishvesh Trivedi, Pengyu Yan, Akhil Gorugantu, David Doermann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位新闻编辑,正试图根据来自世界各地的数十段不同视频片段,撰写一篇关于重大事件(如地震或选举)的单一、准确的报道。有些片段是英语的,有些是缅甸语的,有些长达数小时,其中许多还包含无关画面。

你的目标是撰写一份报告,其中每一句话都必须有特定的视频片段作为支撑,并且你必须准确引用证明该事实的具体片段。如果你猜测了某个细节或引用了错误的视频,你的文章就会被视为“幻觉”(虚假)。

这正是论文CRAFT所应对的挑战。以下是他们如何解决这一问题的简明解释:

问题:大海捞针

现实世界的新闻视频杂乱无章。

  1. 过长:一段 2 小时的视频对于计算机来说太大,无法一次性“观看”。如果你只是随机选取帧(例如每 10 秒拍一张照片),你可能会错过地震发生的确切时刻。
  2. 缺失音频:许多真相是出来的,而不是展示出来的。如果记者说“大桥在下午 3 点倒塌了”,但镜头只显示废墟,那么仅依靠图像分析的计算机就会错过这一关键细节。
  3. 撒谎的机器:即使是智能 AI 模型有时也会编造内容。它们可能会自信地陈述视频中实际上并不存在的事实,或者混淆两个不同的事件。

解决方案:CRAFT(智能新闻编辑室)

作者们构建了一个名为CRAFT(Critic-Refined Adaptive Key-Frame Targeting,即“批判者优化的自适应关键帧定位”)的系统。你可以将其想象为一个高度组织化的新闻编辑室,拥有一支专家团队,而不是只有一位过度劳累的编辑。

以下是逐步工作流程:

1. “智能摄像机”(动态关键帧选择)

CRAFT 不像那样观看整个视频或随机选取帧,而是像一位智能摄像师那样运作。

  • 类比:想象你正在一部 2 小时的电影中寻找特定场景。与其看完整部电影,不如让 AI 帮你:“只显示地震可见的帧。”
  • 工作原理:系统扫描视频,仅挑选出与你的具体问题相关的帧。这节省了时间,并确保 AI 专注于正确的证据。

2. “翻译员”(自动语音识别与翻译)

该系统不仅“看”,还会“听”。

  • 类比:这就像房间里有一位翻译,他倾听视频中说的每一个字(即使是缅甸语或尼泊尔语等外语),并将其用英语记录下来。
  • 工作原理:它使用语音转文本技术将口语转换为文本。如果音频嘈杂或属于罕见语言,它已准备好“备用翻译”。它还会检查文本,确保 AI 没有陷入重复同一个词的常见故障中。

3. “事实核查”循环(批判者)

这是最重要的部分。系统不会只写一次文章,而是会修订它。

  • 类比:想象一位初级记者起草了一份稿件。然后,一位资深编辑(即“批判者”)阅读它并提出三个棘手的问题:
    1. 时间核查:“这真的发生在你所说的时间吗?”(时间定位)。
    2. 矛盾核查:“这句话是否与你前一段的内容相矛盾?”(跨主张筛查)。
    3. 最终裁决:“这一主张是否真的得到了视频的支持,还是你在编造?”(裁决)。
  • 工作原理:如果“批判者”发现错误,它会带着修改指令将草稿退回给 AI。这一过程最多重复四次,直到事实确凿。

4. “总编辑”(引用合并)

最后,系统将所有经过验证的事实合并成一份报告。

  • 类比:想象五位不同的记者发现了同一个事实(例如,“大桥倒塌了”)。总编辑不会将这句话写五遍,而是只写一次,但附上全部五个视频片段作为证明。
  • 工作原理:这确保了最终报告简洁,但完全由找到的每一处证据所支持。

结果:它奏效了吗?

团队在名为MAGMaR 2026的困难基准测试中测试了 CRAFT,该测试涉及现实世界的新闻事件。

  • 得分:CRAFT 在所有测试系统中取得了最高分。在发现正确事实(召回率)和正确引用视频(引用 F1 分数)方面,它比其他强大的 AI 模型表现更好。
  • 秘诀:论文发现,最大的改进来自:
    1. 将事实分解为微小的、原子化的部分(原子主张)。
    2. 听取音频(自动语音识别)。
    3. 迫使 AI 检查自身工作的“批判者”循环。

总结

CRAFT 就像一个超高效、多语言的新闻编辑室,它不仅观看视频,还会倾听视频,挑选出最重要的时刻,通过自我辩论来发现错误,并生成一份最终报告,其中每一句话都有特定的视频片段作为支撑。它证明,通过添加一个“批判者”来检查工作,AI 在讲述现实世界事件的真相方面可以变得更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →