← 最新论文
🤖 AI

Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning

本文介绍了用于多跳音视频推理的基准测试 MOV-Bench,并提出了 AOP-Agent,这是一个高效的智能体框架,它通过主动的全模态感知增强开源 Omni-LLM 的推理能力,而无需额外训练。

原作者: Ke Xu, Yuhao Wang, Ziyang Cheng, Hongcheng Liu, Yanfeng Wang, Yu Wang

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Ke Xu, Yuhao Wang, Ziyang Cheng, Hongcheng Liu, Yanfeng Wang, Yu Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和创意类比对该论文的解读。

核心难题:“大海捞针”式视频

想象你被给了一段 30 分钟繁忙车间的视频。有人问你一个棘手的问题:“为什么技术员给那个芯片涂了那种特定的胶水?”

要回答这个问题,你不能只看一秒钟。你必须:

  1. 到 5 分钟前关于“次品芯片”的评论。
  2. 到 10 分钟前显示一根松动电线的画面。
  3. 连接这两段相距甚远的信息,意识到胶水只是对不良焊点的临时修复。

当前的 AI 模型(称为Omni-LLMs)就像试图一次性背诵整段视频的学生。当视频很长时,它们会不堪重负。它们会忘记 5 分钟前的线索,或者错过 10 分钟前的视觉线索。它们试图根据整个混乱的片段来猜测答案,往往因为证据分散且稀疏而答错。

解决方案一:MOV-Bench(“高难度测试”)

研究人员首先建立了一个名为MOV-Bench的新考试。

  • 它是什么: 基于真实视频构建的 519 个棘手问题集合。
  • 关键点: 每个问题都需要“多跳”推理。你无法仅通过观看一个片段来回答。你必须在视频的不同时间点之间跳跃,并在听(音频)和看(视觉)之间切换。
  • 结果: 当他们在该考试上测试当前的 AI 模型时,模型失败了。它们难以找到分散的线索并串联起这些点。

解决方案二:AOP-Agent(“侦探”)

研究人员没有强迫 AI 一次性背诵整段视频,而是创建了一个名为AOP-Agent的新系统。不要把它想象成为了考试而死记硬背的学生,而要把它想象成一位正在破解谜案的侦探

以下是这位侦探如何工作,采用“低资源”方法(意味着它不需要昂贵的超级计算机或特殊的训练):

  1. 档案柜(分层记忆):
    在侦探开始之前,视频被整理进一个智能档案柜。

    • 概览: 整个视频的一页总结。
    • 章节: 视频被分割成 30 秒的片段,每个片段都有简短总结和“关键词”列表(如“胶水”、“芯片”、“焊料”)。
    • 细节: 如果需要,侦探可以放大到特定的 5 秒片段以获取高清细节。
  2. 三步循环(观察、反思、重规划):
    侦探不仅仅是观看;它利用三种角色主动搜寻线索:

    • 规划者: 查看问题和“档案柜”。它说:“我需要找到他们谈论胶水的地方。让我们先搜索‘关键词’部分。”
    • 观察者: 使用工具调出规划者请求的特定视频片段。
    • 反思者: 检查证据。“好的,我们找到了胶水,但还没找到‘次品芯片’。目前的线索还不够。让我们回去搜索接下来 30 秒的‘音频’部分。”

    如果线索仍然缺失,规划者会改变策略(重规划)并尝试不同的搜索工具。这个循环持续进行,直到侦探确信自己掌握了所有部分。

  3. 答案:
    一旦侦探从视频的不同部分收集了足够的具体证据,推理者(最终的裁决者)就会将拼图组合起来并给出答案。

为什么这很重要

  • 无需魔法训练: 该系统使用开源 AI 模型即可工作,无需重新训练它们,也无需使用昂贵的专有“黑盒”模型。
  • 主动 vs. 被动: 旧方法是被动的(观看整个视频并希望记住)。AOP-Agent 是主动的(决定确切要看什么、何时看以及何时停止)。
  • 结果: 在“高难度测试”(MOV-Bench)和其他视频基准测试中,AOP-Agent 的表现显著优于旧方法,特别是在长视频和需要连接多个不同线索的问题上。

局限性(“侦探的错误”)

论文承认该系统并不完美:

  • 幻觉: 如果“档案柜”(记忆)错误地描述了场景(例如,它说有人大喊大叫,但实际上没有),侦探可能会基于这个谎言构建错误的理论。
  • 速度: 因为侦探必须多次停止、思考、搜索和检查,所以它比只看一遍视频要慢。
  • 实时性: 该系统需要先将整个视频处理进档案柜,因此目前无法在实时流媒体视频(如现场体育广播)上实时工作。

总结

这篇论文介绍了一种教导 AI 推理长视频的新方法。与其试图一次性吞下整个视频,他们为 AI 提供了一套侦探工具箱:一个智能归档系统和一个逐步流程,用于搜寻分散的线索、反思发现的内容,并在确信无疑时才给出答案。这使得标准的开源 AI 模型能够解决它们以前无法处理的复杂视频谜题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →