← 最新论文
💻 computer science

StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering

StreamOV 是一个用于流式全视频理解的新颖框架,它通过采用证据引导的内存以实现高效上下文管理,并利用隐藏状态驱动的触发机制来生成主动响应,从而克服了离线方法的局限性,并经由新引入的 SOVBench 进行了验证。

原作者: Ming Xie, Zizheng Huang, Xudong Tan, Chao Wang, Xiangyu Zeng, Wenxiao Wu, Tao Chen, Limin Wang, Yanwei Fu

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ming Xie, Zizheng Huang, Xudong Tan, Chao Wang, Xiangyu Zeng, Wenxiao Wu, Tao Chen, Limin Wang, Yanwei Fu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一个永不停歇的 24 小时实时新闻直播流。你想与一个智能 AI 聊聊当下正在发生的事,但你无法暂停视频,也无法回看一小时前发生的内容。AI 必须实时地观看、聆听、记忆并作出回应。

这就是 StreamOV 所要解决的问题。

问题:被“压垮的图书管理员”

大多数现有的 AI 视频模型就像只在图书馆闭馆后才工作的图书管理员。它们会等到整部电影播放完毕,读完整个剧本,然后才回答你的问题。这种方式无法适用于直播流。

如果你试图让这些“离线”图书管理员进行实时工作,它们将面临两大难题:

  1. 记忆溢出:如果它们试图记住两小时直播流中的每一帧画面和每一个声音,它们的大脑会崩溃。它们需要一种方法来遗忘无聊的部分,只保留重要内容。
  2. “沉默”问题:在实时聊天中,有时最好的回答就是完全不回答。如果你问:“厨师正在做什么菜?”而厨师尚未开始动手,AI 就不应该猜测或幻觉出一个答案。它应该保持安静,直到厨师真正拿起刀。现有的 AI 往往难以做到这一点;它们要么说得太多(用废话填补沉默),要么需要一个单独的、笨拙的“管理者”来告诉它们何时开口。

解决方案:StreamOV

作者创建了 StreamOV,这是一个专为这种实时、“全模态”(视觉与听觉)世界设计的系统。以下是其工作原理,借助一些简单的比喻:

1. “智能筛子”(证据引导的记忆)

想象你在观看直播流,但你只有一本小记事本用来记笔记。你无法记下所有内容。

  • 旧方法:记下所有内容,然后试图稍后将其全部塞进去。
  • StreamOV 方法:它拥有一个智能筛子。随着视频播放,它会不断自问:“这一刻重要吗?”
    • 视觉场景是否发生了剧烈变化?(厨师打翻了平底锅!) -> 保留
    • 音频是否突然变大或出现突发声响?(一声巨响!) -> 保留
    • 这是否匹配用户刚刚提出的问题?(用户问到了鸡蛋;厨师刚刚敲开了一颗鸡蛋。) -> 保留
    • 这仅仅是背景噪音或静态镜头吗? -> 丢弃

它构建了“长短期记忆”。短期记忆是刚刚发生事件的密集缓冲区(过去几秒)。长期记忆则是过去一小时中最“富含证据”时刻的稀疏集合。这使得 AI 的记忆容量保持有限(小巧),却极具信息量。

2. “内部直觉检查”(响应触发)

这是该论文最巧妙的技巧。

  • 旧方法:AI 生成一个特殊的“沉默标记”(就像输入"……"或“稍等”)来告诉自己要闭嘴,或者使用一个单独的、较小的 AI 机器人充当门卫来决定何时开口。

  • StreamOV 方法:AI 使用其自身的内部直觉检查
    可以将 AI 的大脑想象为在真正开口说话之前有一个“预思考”阶段。StreamOV 会审视 AI 大脑内部思维的最初火花(隐藏状态)。

    • 大脑是否感到自信? -> 开口说话
    • 大脑是否感觉信息缺失? -> 保持沉默

    它不需要输入“稍等”或询问单独的机器人。它只需在内部决定“我现在有足够的证据了”,然后开始说话。如果没有,它 simply 停止处理该轮次,从而节省能量并避免胡言乱语。

3. 新测试:SOVBench

为了证明这行之有效,作者不能仅使用旧测试,因为旧测试就像针对已完成电影的“随堂测验”。他们构建了 SOVBench,这是一场全新的实战考试。

  • 它测试实时理解能力(回答关于当下正在发生之事的问题)。
  • 它测试回忆能力(记住 10 分钟前发生的事)。
  • 它测试主动性(知道何时开口,何时保持沉默)。
  • 它包含视频和音频,确保 AI 不仅仅是在“观看”,也在“聆听”。

结果

当他们运行测试时,StreamOV 不仅仅是参与了游戏;它赢得了胜利。

  • 它超越了那些被迫在流式模式下工作的庞大、强大的离线模型(如 Qwen3-Omni)。
  • 与其他流式模型相比,它更擅长知道何时开口以及何时保持沉默。
  • 它证明了通过使用“智能筛子”进行记忆管理,以及使用“内部直觉检查”进行时机把控,AI 可以在无需无限记忆或外部管理器的情况下,高效地理解实时视频流。

简而言之:StreamOV 是首个能够观看实时、无尽视频,仅记住重要部分,并确切知道何时介入对话、何时保持安静的 AI,且全程不会感到不堪重负。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →