← 最新论文
💬 NLP

Harnessing Streaming Video in the Wild

本文通过引入一个包含专门训练数据集(Streaming-Train-248K)、一个能够实现主动交互、长期记忆和实时处理的即插即用部署系统(Streaming Harness),以及一个旨在推动从离线视频理解向可部署流式智能转变的新基准测试(Streaming-Eval)的综合框架,解决了现有视觉语言模型在处理无界视频流方面的局限性。

原作者: Dingyu Yao, Shuhuan Gu, Qingyi Si, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Naibin Gu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Dingyu Yao, Shuhuan Gu, Qingyi Si, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Naibin Gu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在观看一场体育直播。你的身边坐着一位智能助手。

旧方式(离线视频):
目前的多数 AI 助手就像是一个在比赛结束后才观看录像的人。他们可以暂停、回放,并在看完整场比赛后说:“哇,那是一个精彩的进球!”他们擅长分析过去,但无法在你观看比赛的过程中与你交流。如果你在比赛进行时向他们提问,他们可能会卡住,或者开始猜测接下来会发生什么(这是一种幻觉),或者即使在没有发生有趣事情时也一直不停地说话。

新方式(本论文的解决方案):
这篇题为《利用野外流式视频》(Harnessing Streaming Video in the Wild)的论文作者们,构建了一个系统,将 AI 转变为一名能够处理数小时视频而不感到疲劳或遗忘的实时、现场解说员。他们称之为“统一栈”(unified stack),因为他们同时解决了三个大问题:大脑、记忆和测试场。

以下是他们如何实现的,使用了简单的类比:

1. 大脑:学习如何“闭嘴”(Streaming-Train-248K)

问题: 如果你教一个 AI 去描述视频,它往往会试图描述每一秒钟。这就像一个旁白在说:“球是红色的。球在移动。球还在移动。球正在移动……”这很烦人而且浪费时间。
解决方案: 团队创建了一个包含 248,000 个视频片段的海量数据集。他们教会了 AI 一个新技巧:沉默

  • 他们给了 AI 两个特殊的“按钮”:一个用于说话,一个用于保持沉默
  • 他们训练 AI 只有在重要事情发生时(如进球或有趣的瞬间)才按下“说话”键,而在没有新情况发生时按下“沉默”键。
  • 结果: AI 学会了像专业的体育解说员一样,知道何时该说话,何时该让观众在沉默中欢呼。

2. 系统:智能图书管理员(Streaming Harness)

问题: 即便有一个聪明的大脑,也需要良好的记忆。如果你看一部 2 小时的电影,AI 通常在 10 分钟后就会耗尽内存。这就像试图在脑海中进行一场 2 小时的对话而不做任何记录;当你进行到结尾时,你已经忘了开头了。此外,实时视频需要极高的速度。如果 AI 需要思考 5 秒钟,视频已经跳过了。
解决方案: 他们构建了一个名为 Streaming Harness 的“即插即用”系统。把它想象成一个拥有三个书架的智能图书管理员

  • 短期书架(即时): 保存最后几分钟的高细节视频(如原始图像)。
  • 中期书架(摘要): 当短期书架满了,图书管理员会写一份快速摘要,然后把原始图像收起来。
  • 长期书架(档案): 当中期书架满了,图书管理员会将这些摘要合并成一个巨大的、有组织的进度表。
  • 神奇之处: 这个系统旨在与“vLLM”(一种超快引擎)配合工作。这就像图书管理员通过重复利用旧笔记,而不是每次都重新阅读整本书来节省时间。这使得 AI 即使在 12 小时的视频播放后,依然能保持极快的响应速度(回复时间在 1 秒以内)。

3. 测试:实战压力测试(Streaming-Eval)

问题: 在此之前,人们通过给 AI 一个短片并问一个问题来测试视频 AI。这就像通过让运动员跑 100 米来测试他们是否能跑马拉松。这无法告诉我们他们是否能跑完 26 英里。
解决方案: 他们创建了一个新的基准测试,称为 Streaming-Eval

  • 他们使用的不是短片,而是长期的、混乱的真实世界视频(如烹饪节目、DIY 项目和现场体育赛事)。
  • 他们测试了 AI 的六种不同技能:
    • 主动性(Proactive): 它是否在正确的时间说话?
    • 准时性(Punctual): 它是否等待了正确的时刻?
    • 上下文相关性(Contextual): 它是否记得 10 分钟前说过的话?
    • 过去/未来/现在(Backward/Forward/Present): 它能否回答关于过去、未来或现在的问题?
  • 他们还发明了一种新的评分规则(SW-F1),如果 AI 回答得太早或太晚,即使事实没错,也会受到惩罚。

结果

当他们将他们的“流式原生”(Streaming-Native)AI(那个被训练学会沉默的 AI)放入“Streaming Harness”(记忆系统)中时,结果令人印象深刻:

  • 记忆力: 它能记住 12 小时前的细节。
  • 速度: 即使在 2 小时的视频播放后,它依然保持快速(低于 1 秒)。
  • 性能: 它在描述实时视频并回答相关问题方面,击败了顶尖且昂贵的闭源 AI 模型(如 Claude Opus、GPT-5 和 Gemini)。

总结:
这篇论文指出,他们构建了一个完整的方案,将 AI 从一个“赛后分析师”转变为“现场直播伙伴”。他们教会了它何时该说话,赋予了它持续数小时而不减速的记忆力,并创造了一种全新的方式来测试它是否真的能处理现实生活中无止尽的视频流。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →