ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory
ProtoKV 是一个流式视频理解框架,它通过结合近窗口精确的 KV 缓存与用于历史内容的固定容量摘要状态状态的混合方法,在保持恒定内存占用的同时解决了延迟查询的挑战,从而随着查询延迟的增加,显著提高了相对于 Token 保留基准模型的准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在观看一段非常长的、连续的视频流,比如一个 24 小时的监控摄像头画面。你的任务是回答关于这段视频中发生了什么的问题。问题在于?你有一个微小的大脑(有限的计算机内存),而且你不能暂停视频去回放重看。你必须在等待有人提问的同时保持观看,而提问可能发生在某个特定事件发生几分钟甚至几小时之后。
这就是**流式视频理解(Streaming Video Understanding)**的挑战。
问题所在:“遗忘”的大脑
目前的多数系统试图通过保留最近几分钟视频的“滑动窗口”来解决这个问题。
- 类比: 想象你拿着一个装水的桶(你的记忆)。随着新水(视频帧)流入,你必须让旧水流出,以防止水桶溢出。
- 缺陷: 如果一个关键事件发生了(比如小偷偷走了钱包),随后出现了 20 分钟无聊的画面,直到有人问:“你看到那个小偷了吗?”,这时旧水(小偷)已经从桶里倒掉了。系统忘记了答案。
其他系统尝试保留一份“重要时刻”(token)的列表。但如果视频很长,它们必须不断决定丢弃哪些保存下来的时刻,以腾出空间给新的时刻。如果它们丢弃了错误的时刻,答案就会永远丢失。
解决方案:ProtoKV(“总结笔记本”)
作者提出了一种名为 ProtoKV 的新系统。ProtoKV 不再试图保存每一个单独的帧或仅仅是几个特定的时刻,而是使用了一个像智能笔记本一样的两部分记忆系统。
1. “近期过去”(精确窗口)
对于视频中最近的部分(例如最近的几分钟),ProtoKV 保留一份完美的、高分辨率的副本。
- 类比: 这就像是你拥有过去 5 分钟内发生的一切的高清照片。如果你询问关于现在的事情,答案就在那里,清晰可见。
2. “远期过去”(原型库)
对于发生在那个最近窗口之前的所有内容,ProtoKV 不再保存单个帧。相反,它会创建摘要。
- 类比: 想象你在看一场游行。你不会记得 2 小时前每一个人的脸。相反,你会记得:“有一支进行曲乐队”、“一个带有巨型猫装饰的花车”以及“一群穿着红衣服的人”。
- 它是如何工作的: ProtoKV 将相似的事物组合在一起形成“原型(Prototypes)”。
- 如果一个人正在走路,ProtoKV 会创建一个“走路的人”摘要。
- 如果那个人走了 10 分钟,系统不会保存 10 分钟的视频。它只是更新这个“走路的人”摘要,写道:“这个人一直在走路。”
- 它还会保留一个“残差(residual)”笔记:“大多数时候,这个人走路很正常,但偶尔会挥挥手。”这捕捉到了多样性,而无需保存每一步的动作。
魔法技巧:“幽灵 Token”
当问题终于到来时(例如,“30 分钟前那个穿红衣服的人做了什么?”),系统需要将此信息喂给 AI 模型。但模型期望看到的是实际的视频帧,而不是仅仅是一个摘要。
ProtoKV 使用了一个巧妙的技巧,称为伪 Token(Pseudo-Tokens)。
- 类比: 想象你有一张写着“巨型猫花车”的总结笔记。为了向 AI 展示这个内容,ProtoKV 会根据这些总结笔记创建一些看起来像“巨型猫花车”的“幽灵”视频帧。
- 这些幽灵并不是真实的帧;它们是基于摘要的数学重建。AI 模型看到这些幽灵后,会将它们视为与真实视频帧完全相同的存在。
- 至关重要的是,系统会计算有多少个真实时刻构成了那个摘要。如果“巨型猫花车”摘要是由 500 秒的真实视频构建的,系统会告诉 AI:“这个幽灵代表了 500 秒的证据”,这样 AI 就会更加关注它。
为什么这更好
论文声称,在回答关于很久以前发生的事情(高延迟)的问题方面,ProtoKV 比其他方法表现得要好得多。
- 旧方法(滑动窗口): 如果事件发生在 30 分钟前,系统已经把它删除了。准确率降至零。
- 旧方法(Token 保留): 系统试图保存特定的时刻,但必须删除其中一些以腾出空间。它可能会删掉小偷出现的那个精确瞬间。
- ProtoKV: 它永远不会删除事件的概念。它只是将其压缩成一个摘要。即使经过了 30 分钟的新视频,那个“小偷”摘要仍然存在,并随着新细节不断更新,随时准备转化为“幽灵”帧供 AI 回答问题。
结果
作者在多个视频基准测试中测试了该系统。他们发现:
- 准确性: 在针对发生很久以前的事件提问时,ProtoKV 的得分显著更高(高出多达 12.5 个百分点)。
- 稳定性: 随着事件与提问之间的时间间隔增大,ProtoKV 的性能保持稳定,而其他方法的性能则大幅下降。
- 速度: 它回答问题的速度与其他方法一样快,因为“摘要”很小且能轻松放入计算机内存,因此不会拖慢系统。
简而言之,ProtoKV 通过停止尝试记住每一个细节,转而记住所发生事情的“故事”,解决了“遗忘”问题,使其能够在不需要超级计算机内存的情况下,回答关于远期过去的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。