技术摘要:MERIT(基于多键值片段检索与推理时时间扩展的框架)
问题陈述
多模态大语言模型(MLLM)的快速演进已将视频理解的任务从短视频片段转向了长达数小时甚至数天的超长视频流。然而,由于上下文窗口限制,直接对这类超长视频进行端到端处理在计算上是不可行的。虽然检索增强生成(RAG)框架提供了一种解决方案,但以往的方法在超长场景中存在两个关键的低效问题:
- 查询无关的开销(Query-Agnostic Overhead): 现有的方法(例如层级化摘要或基于图的记忆)在已知下游查询之前,投入大量的计算资源来预先建模高层语义关系和结构。这迫使系统进行“查询无关的抽象”,而这种抽象可能并不符合特定查询所需的信息。
- 智能错配(Intelligence Misallocation): 使用强大的 MLLM 进行复杂的静态记忆构建(例如将片段合并为天级的摘要或构建知识图谱)是将高能力的推理能力浪费在可以推迟执行的任务上。
作者认为,瓶颈不应在于预先构建复杂的静态语义,而在于实现高召回率的检索,以确保能够持续提供正确的细粒度证据,并将语义组合推迟到已知查询的推理阶段。
方法论:MERIT
MERIT 是一个轻量级的智能体框架,专为超长视频理解而设计。它采用了极简的两阶段范式:片段记忆构建(查询无关)以及智能体检索与回答(查询相关)。
1. 片段记忆构建(阶段 1)
MERIT 不构建复杂的层级图或多尺度摘要,而是将视频 V 划分为互不重叠的 30 秒片段。对于每个片段,它生成一段稠密描述并提取一组多键值(Multi-keys, Ki)。
- 多键值表示法: 每个片段由四个不同且互补的键进行索引,以捕捉多样化的视角:
- 事件/动作键(Event/Action Key): 可观察到的物理动作与交互。
- 对话/提及键(Dialogue/Mention Key): 说话内容、指令或特定词汇。
- 物体键(Object Key): 被操作、被请求或被移动的具体物品,包括状态转换。
- 摘要键(Summary Key): 对核心叙事的紧凑、关键词式的抽象。
- 记忆库(Memory Store): 记忆 M 是一个简单的键值存储,其中键(Ki)用于检索,值(vi,di)提供原始证据。
2. 智能体检索与回答(阶段 2)
在推理阶段,系统运行在一个迭代的多轮循环中:
- 多键值检索: 求解器生成一个检索查询 q(j),并使用句子嵌入模型将其与存储的键进行匹配。给定片段的检索相关性由所有键中的最大相似度决定:
Si(j)=k∈Kimaxsim(E(q(j)),E(k))
这使得只要片段的任一键值与查询对齐,该片段即可被检索,从而显著提高了召回率。
- 邻域过滤(时间扩展): 意识到证据往往跨越多个相邻时刻,MERIT 不仅仅依赖于检索到的 30 秒锚点。在检索到一组片段后,系统会通过包含相邻片段(例如 ±Δ 个片段)来动态扩展时间上下文。
- 查询相关过滤: 求解器在这一扩展的局部上下文中充当过滤器,仅提炼出与特定查询相关的信息。这在无需预计算全局结构的情况下,重建了连贯的上下文。
- 迭代推理: 智能体评估累积的证据是否充足。如果不足,它会优化查询并重复检索过程;否则,它将整合证据以生成最终答案。
核心贡献
- 智能分配的范式转变: 本文提出将语义组合推迟到推理阶段,而不是投资于查询无关的预处理。这使得 MLLM 仅在任务明确时才发挥其完整的推理能力。
- 简单且有效的多键值索引: 通过为极简的片段附加四个异构键,MERIT 在没有层级或基于图的记忆构建带来的计算开销下,实现了高召回率的检索。
- 按需时间扩展: “邻域过滤”机制通过仅在推理时围绕检索到的片段扩展时间范围,捕捉了更广泛的语义上下文,避免了大规模全局记忆构建的高昂成本。
- 极简架构: MERIT 消除了对昂贵的多阶段记忆整合的需求,转而依赖简单的键匹配机制和动态上下文扩展。
实验结果
MERIT 在三个长视频基准测试上进行了评估:EgoLifeQA(超长、第一视角)、LVBench(小时级)和 Video-MME (Long)。
- 达到 SOTA 性能: MERIT 在所有基准测试中均取得了新的 SOTA 结果。
- 在 EgoLifeQA 上,使用 GPT-5 作为求解器,MERIT 的平均准确率达到了 71.2%,超过之前的 SOTA(使用 GPT-5 的 WorldMM)5.6%。
- 在 LVBench 上,MERIT (GPT-5) 达到了 71.8%,超越了之前的 SOTA 9.9%。
- 在 Video-MME (Long) 上,MERIT 达到了 77.7%,优于 WorldMM (76.6%)。
- 效率: MERIT 在记忆构建方面展现了显著的效率提升。与 WorldMM 相比,它减少了 8.4 倍的输入 Token 和 8.6 倍的输出 Token,同时将 LLM 调用次数从约 23,700 次降至约 6,200 次。
- 检索质量: MERIT 实现了比层级化(EgoRAG: 0.15)和基于图(WorldMM: 0.53)基准更高的命中率(0.56),证实了精确、细粒度的检索对于问答性能至关重要。
- 消融实验:
- 邻域过滤: 移除该组件会导致性能显著下降,尤其是在需要更广阔上下文的类别中(如 RelationMap, HabitInsight)。
- 多键值组合: 同时使用四个键可获得最高准确率,验证了这些键的互补性。
- 求解器依赖性: 性能随更强的求解器(如 GPT-5 vs. Qwen3-VL-8B)显著提升,强化了“记忆应保持轻量,由求解器处理复杂推理”的假设。
重要性与主张
本文声称,将语义组合推迟到查询时刻比投资于查询无关的预处理是一种更具原则性且更有效的方法。结果表明:
- 简单即有效: 一个简单的片段多键值记忆,结合按需的时间扩展,可以超越复杂的层级化和基于图的架构。
- 检索是瓶颈: 相比于预计算的语义结构,获取细粒度证据的高召回率检索更为关键。
- 可扩展性: 该框架对于任意长的视频具有高度的可扩展性,因为它避免了随着视频长度增加而更新复杂全局记忆结构的级联计算成本。
作者将 MERIT 定位为未来超长视频理解的一个实用且可扩展的基础,强调复杂的推理所需的“智能”应当分配到由查询定义抽象需求的推理阶段。