← 最新论文
💻 computer science

ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding

ObjectStream 是一个无需训练的框架,它通过将冻结的视频大语言模型(Video-LLM)表示组织为持久的潜在对象锚点,增强了流式视频理解能力,从而实现了对对象历史和交互的高效、高性能推理,并显著降低了内存占用和标记(token)数量。

原作者: Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一段繁忙城市街道的直播。汽车飞驰而过,行人穿过马路,一只鸟落在灯柱上。现在,想象你是一个试图回答关于这条街道问题的机器人,但你只能记住你在任何一个瞬间看到的极小部分画面。如果有人问:“十分钟前经过的那辆车是什么颜色的?”或者“那个人掉落钥匙了吗?”,你的记忆可能只是一片空白。这就是**流式视频理解(streaming video understanding)**的挑战。这是人工智能的一个分支,旨在让计算机理解以实时形式(如直播流)到达的视频,而不是可以暂停和倒回的电影。大问题在于视频量巨大;它是一场视觉数据的洪水。如果计算机试图保存每一个帧,它会耗尽内存(它的脑力空间),并且变得反应迟钝,无法快速回答问题。因此,科学家必须想办法丢弃那些无聊的部分(比如空白的天空),同时保留重要的部分(比如移动的狗),且不丢失故事的完整性。

于是有了 ObjectStream,一种全新的方法,它就像是机器人记忆中的一位超级有序的图书管理员。它并不试图记住视频流中的每一个像素,而是决定将“物体”作为故事的主角进行记忆。你可以这样想:如果你在向朋友描述一场混乱的派对,你不会列出每一个走进门的人。相反,你会追踪那些“关键人物”——DJ、在桌子上跳舞的人、戴红帽子的人。ObjectStream 对机器人也正是如此。它观察冻结的视频数据并说:“嘿,那一块像素看起来像个杯子,”然后它会为这个杯子记录一份持续的日记。它追踪这个杯子的去向,它是被撞倒了,还是消失了。它不需要雇佣专门的专家团队(如外部物体检测器)来寻找这些物品;它利用机器人现有的“大脑”就能自行搞定。

该论文介绍了一个巧妙的三部分系统来管理这种记忆。首先,它创建了**“潜在物体锚点”(Latent Object Anchors)。想象一下这些是你贴在视频中重要事物上的便利贴。随着视频播放,机器人会更新这些笔记:“橙色马克杯现在在桌子上,”或者“蓝色杯子正被人拿着。”它会保持这些物体的历史记录,即使它们移动或发生轻微变化。其次,它有一个专门用于“瞬时变化”(Transient Changes)的部分。有时,事情发生得很快——比如刀切开黄瓜,或者球弹跳。这些是快速发生的时刻,如果只看长期历史,可能会被平滑处理掉。ObjectStream 会保留这些快速变化的“快照”,这样机器人就不会错过精彩瞬间。第三,它保留了一个“近期视觉接地窗口”(Recent Visual Grounding Window)**,这只是对最后几秒钟视频的高质量清晰视图。这确保了如果有人问:“现在正在发生什么?”,机器人能有一个新鲜、无模糊的视角去观察。

研究人员在现有的、虽然擅长理解视频但处理实时流时表现挣扎的 AI 模型上测试了这个想法。他们发现,通过添加这个“物体锚点”系统,模型在回答有关视频中发生情况的问题时表现得更好。例如,在一个测试名为 OVO-Bench(检查机器人实时感知能力的测试)的任务中,模型的得分提升了 10.0 分(从 63.3 升至 73.3)。更令人印象深刻的是,它在实现这一点的同时,使用了大约 50% 的更少内存,并且回答问题的速度比以前快了一倍。事实上,该系统非常高效,它甚至可以丢弃 82.5% 的原始视频数据(即“token”),却依然比那些试图保留所有数据的模型表现得更好。

该论文指出,这种方法是解决内存问题的一种切实可行的方式,而无需从头开始重新训练整个 AI 模型。它表明,围绕“事物”(物体)而非仅仅围绕“时刻”(帧)来组织记忆,有助于机器人追踪故事的发展。作者发现,这种方法对于直播流和长篇预录视频都有效,这证明了记录物体的“日记”是处理视觉信息洪流的一种聪明方式。它并不是解决世界上所有问题的万灵药,但它表明,如果我们希望机器人能够实时理解我们忙碌移动的世界,我们需要教会它们记住“角色”,而不仅仅是“布景”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →