← 最新论文
💻 computer science

VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority

VideoSEAL 通过引入一个将长期规划与答案权威性解耦的规划器 - 检查器框架,解决了智能体长视频理解中的“证据错位”问题,该框架要求通过像素级验证来确保答案由检索到的证据支持,并在多个基准测试中实现了最先进的性能。

原作者: Chenhao Qiu (Mango TV), Yechao Zhang (Nanyang Technological University), Xin Luo (Mango TV), Shien Song (Mango TV), Xusheng Liu (Mango TV)

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenhao Qiu (Mango TV), Yechao Zhang (Nanyang Technological University), Xin Luo (Mango TV), Shien Song (Mango TV), Xusheng Liu (Mango TV)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是《VideoSEAL》论文的通俗化解读,辅以生动的类比。

核心难题:那个“自信却错误”的侦探

想象一下,你正在观看一部很长的电影(比如一部 2 小时的影片),有人问你一个关于影片进行到 45 分钟时某个微小细节的具体问题。

当前试图回答这些问题的 AI 系统,就像是一群过度劳累且压力巨大的侦探。他们必须扫描整部电影才能找到答案。

  • 缺陷:这些侦探往往会被海量信息搞得疲惫不堪或困惑不已。他们可能会找到一些线索,但并非正确的线索。然而,由于他们承受着必须给出答案的压力,他们便开始猜测。
  • 结果:他们有时会给出正确的答案,但实际上并没有找到能证明该答案的证据。他们只是根据“听起来合理”的内容或训练记忆进行了猜测。这被称为证据错位(Evidence Misalignment)。这就像是一个学生算出了正确的数学答案,却写下了错误的解题步骤。

论文将这种现象称为“证据错位”。即使最终答案碰巧是正确的,AI 实际上是在“幻觉”出证明过程。


为什么会发生这种情况?(两种压力)

作者发现,这些 AI 侦探犯下此类错误主要有两个原因:

  1. 提示压力(“长篇故事”问题):
    想象侦探在回答问题前,必须阅读一本长达 500 页的笔记。随着笔记变得越来越长、越来越杂乱,侦探会感到不知所措。他们不再寻找特定的线索,而是试图“把故事圆回来”以给出一个答案。他们停止了搜索,转而开始迎合手头已有的任何内容来凑出一个答案。

  2. 奖励压力(“只看分数”问题):
    想象一位老师只根据考试最终答案打分,而忽略学生是如何得出该答案的。如果学生不费力气地猜对了答案,他们依然能拿到"A"。AI 因此学到,与其费力去寻找确切视频帧,不如直接猜测来得更快、更省力。它学会了为了获得奖励而“作弊”。


解决方案:拆分工作(规划者 vs. 检查者)

论文指出,旧有的做法——让单个 AI 包揽所有任务(搜索、思考并回答)——是问题的根源。这就像要求一个人同时担任侦察兵法官警长

VideoSEAL 引入了一种新的团队结构:

  1. 规划者(The Planner,即侦察兵):

    • 职责:这个 AI 的唯一工作就是浏览视频并找出候选片段。它暂时不关心最终答案。它只是说:“我找到了这 3 个可能相关的片段。”
    • 类比:想象一位图书管理员,他的任务只是从书架上找出可能包含答案的书籍。他并不阅读这些书,只是把它们取出来。
  2. 检查者(The Inspector,即法官):

    • 职责:这是一个独立的、强大的 AI。它查看规划者找到的特定视频片段。它会问:“这些片段真的能证明答案吗?”
    • 守门人:如果检查者看到了足够的证据,它会说:“是的,这是答案。”如果它没看到足够的证据,它会说:“继续搜索。”
    • 类比:想象俱乐部门口一位严格的保安。侦察兵把人员(片段)带到门口。保安检查他们的身份证(证据)。如果身份证是伪造的或缺失的,保安就不让他们进入(不给答案)。保安拒绝猜测。

实际运作方式

  • 旧方式:一个 AI 进行搜索,被过多的文本搞糊涂,然后猜测一个答案。
  • VideoSEAL 方式
    1. 规划者进行搜索并找到一个片段。
    2. 检查者查看该片段。“这足够吗?”
    3. 如果:检查者将规划者送回,让其再次搜索。
    4. 如果:检查者给出最终答案。

这建立了一个“制衡”系统。规划者不能随意猜测;它必须找到检查者认可的证据。


结果:更高的准确率与更少的猜测

作者在四个不同的长视频基准测试中测试了这个新系统。结果如下:

  • 更高的准确率:与旧的“全能型”系统相比,新系统获得了更高的分数(例如,在一个测试中为 55.1%,在另一个测试中为 62.0%)。
  • 更可靠的证据:不仅答案更正确,该系统在真正找到能证明答案的正确视频片段方面也表现优异得多。
  • 可扩展性:如果你给它更多的搜索时间(更多的“搜索预算”),系统会变得更聪明。而旧系统随着搜索时间延长,只会变得更加困惑并犯更多错误。
  • 即插即用:由于“检查者”是独立的,你可以随时将其替换为更智能、更强大的 AI,而无需重新训练“规划者”。这就像在不重建整个底盘的情况下升级汽车的引擎。

总结

VideoSEAL 通过将工作拆分为两个角色来解决 AI 在长视频中猜测答案的问题:一个是负责搜寻线索的规划者,另一个是负责验证线索的检查者。通过强制系统在给出答案之前证明其答案,他们阻止了 AI 用猜测来“作弊”,从而实现了更可靠、更值得信赖的视频理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →