MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation
MARQUIS 是一个三阶段流水线,通过查询扩展、结构化证据提取和受控文章生成,解决了复杂查询处理和多视频合成方面的局限性,显著增强了视频检索增强生成能力,并在 MAGMaR2026 共享任务中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名记者,受命撰写一篇关于复杂事件(如特大风暴或政治选举)的详细新闻报道。然而,你并没有一名实地记者;相反,你拥有一个包含100,000 段不同视频片段的图书馆,这些片段由数百台不同的摄像机录制。你的任务是找到合适的片段,厘清其中实际发生的情况,并撰写一篇连贯的故事,准确引用证明每个事实的具体视频。
这就是MARQUIS系统所应对的挑战。该论文指出,当前的人工智能工具在这项特定工作上表现不佳。它们要么在问题复杂时无法找到正确的视频,要么因试图同时阅读过多视频而不堪重负,最终产生幻觉(即编造内容)。
MARQUIS 通过扮演一个三阶段新闻编辑室流水线的角色来解决这一问题,将庞大的任务分解为更小、更易管理的步骤。
第一阶段:侦探的搜索(检索)
问题所在: 如果你问人工智能“告诉我 2025 年选举结果的所有情况”,标准搜索引擎可能会感到困惑。它试图将整个长问题转化为一个单一的“搜索代码”(嵌入向量),这往往忽略了细微差别。这就像试图通过一次性描述整个干草堆来寻找其中特定的针。
MARQUIS 的解决方案:
MARQUIS 不像一次进行大搜索,而是像侦探一样将大案件分解为小线索。
- 分解: 它将你的大问题分解为 20 多个微小、具体的问题(例如:“自由党赢得了多少席位?”“投票率是多少?”“哪些选区发生了翻转?”)。
- 并行搜索: 它针对每一个微小问题,分别搜索视频库。
- 融合: 它将针对微小问题找到的所有视频列表合并为一个总列表。
- 重排序: 最后,一位专门的“视频裁判”审视候选视频并重新排序,确保最相关的视频排在最前面。
结果: 这种方法就像使用放大镜寻找特定的针,而不是猜测整个干草堆的位置。它将系统找到正确视频的能力从0.195 分提升至 0.759 分(这是一个巨大的飞跃)。
第二阶段:事实核查员(信息提取)
问题所在: 一旦你拥有了视频,就不能直接把整个视频文件交给撰稿人。撰稿人需要具体的事实。此外,视频可能具有欺骗性;有时某人说的话并非事实,或者拍摄角度具有误导性。
MARQUIS 的解决方案:
MARQUIS 不仅仅是“阅读”视频;它提取具体的“主张”,然后对其进行校准。
- 三种类型的笔记:
- 通用笔记: “一名穿红大衣的女子正在讲话。”(可能是日后有用的事实)。
- 针对性主张: “视频显示有 50 人获救。”(专门回答你问题的具体事实)。
- 问答: 系统向视频提出具体问题并获取答案。
- 校准(测谎仪): 这是一个关键步骤。在撰稿人看到任何主张之前,一个“校准器”模型会并排查看该主张和原始视频。它会问:“这段视频真的能证明这句话吗?”它会分配一个概率分数(0 到 1)。如果视频不支持该主张,它就会被过滤掉。
类比: 想象一个事实核查团队,他们阅读记者写的每一句话,然后回到原始 footage 进行核实。如果 footage 不匹配,这句话就会被扔进垃圾桶。
第三阶段:撰稿人(文章生成)
问题所在: 即使有了好的事实,撰写一篇流畅的文章也很难。如果你给撰稿人 500 个互不相关的要点,他们可能会写出一份杂乱的列表。如果你给他们一份 2 小时的视频转录稿,他们可能会迷失在细节中而忘记主旨。
MARQUIS 的解决方案:
系统提供了三种撰写文章的方式,但最好的一种采用结构化方法:
- 聚类: 它将已核实的事实按主题分组(例如:“伤亡情况”、“救援努力”、“政府回应”)。
- 总结: 它为每个主题写一句简短的、带有引用的句子。
- 润色: 它将这些句子拼接成一篇流畅、可读的新闻故事,确保每个事实都有引用(如
[视频 #45, 0:12-0:15])。
“递归”选项(MARQUIS-RLM):
论文还介绍了一种特殊的“管理者”人工智能(基于递归语言模型)。这种管理者不仅仅是一次性写作,而是像一个拥有持久笔记本的项目经理。
- 它审视已有的事实。
- 它意识到:“我缺少北部地区的伤亡人数。”
- 它回到第一阶段和第二阶段,专门请求该缺失信息,将其添加到笔记本中,并检查冲突。
- 只有当笔记本内容充实且一致时,它才会撰写最终文章。
核心结论
该论文声称,通过分解问题——更智能地搜索、严格地核实事实、以及组织写作流程——MARQUIS 产生的结果远优于当前方法。
- 检索: 更频繁地找到了正确的视频。
- 生成: 生成了人类评分更高的文章(3.83 分/5 分,而基线为 3.09 分),因为它们更连贯且来源更可靠。
- 可靠性: 该系统设计为“基于事实”,意味着它拒绝撰写没有视频证据支持的事实,从而避免了其他人工智能系统中常见的“幻觉”。
简而言之,MARQUIS 通过扮演一个高度组织化、多步骤的新闻编辑室,而不是一个单一且不堪重负的作者,将一堆混乱的 100,000 段视频转化为可靠、来源清晰的新闻报道。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。