Watch, Remember, Reason: Human-View Video Understanding with MLLMs
本文提出了一个统一的“人类视角”框架,用于通过多模态大语言模型进行视频理解,围绕观看、记忆和推理这三项核心能力来组织该领域,从而系统地分析处理长且复杂视频场景中的挑战、方法、应用及未来方向。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图理解一部非常长且复杂的电影。你不能只是扫一眼,你必须观看它、记住情节并解开谜团。这篇论文认为,要教会计算机做到这一点,需要它们掌握三项特定的类人技能:观看(Watching)、记忆(Remembering)和推理(Reasoning)。
以下是该论文内容的简单拆解,使用了日常类比。
大局观:“人类视角”方法
作者认为,与其将视频理解视为一系列独立的数学问题,我们应该像人类一样看待它。当你观看一部两小时的电影时,你并不会以同样的强度盯着每一个画面。你会观看重要的部分,记住角色和情节要点,并推理整个故事,从而回答诸如“谁干的?”或“为什么会发生那件事?”之类的问题。
论文将最新的 AI 研究归纳到这三个范畴中。
1. 观看: “选择性的眼睛”
问题: 视频量巨大。一部一小时的电影有数千帧。如果向计算机展示每一帧,它会应接不暇(就像试图用消防水龙头喝水一样)。而且,最重要的线索可能是一个只持续了刹那间的微小细节。
解决方案: 论文回顾了教导 AI 成为“选择性观察者”的方法。
- 细粒度观看(Fine-Grained Watching): 这就像侦探放大观察特定的指纹。AI 学习精准定位某事发生的具体时间和地点(例如:“枪在 12:05 被发射”)。
- 全面观看(Comprehensive Watching): 这就像电影评论家总结整部影片。AI 学习描述整个视频或将其分解为场景。
- 视听观看(Audio-Visual Watching): 这就像开着声音看电影。AI 学习在观看动作的同时聆听对话和音乐,理解尖叫声与惊恐的面孔是相匹配的。
- 高效观看(Efficient Watching): 这是“跳过无聊部分”的技能。AI 学习忽略冗余帧(比如一段对着墙壁的长镜头),只保留那些真正能回答问题的帧。
2. 记忆: “智能档案柜”
问题: 即使 AI 观看了视频,它也无法同时把整个视频都装进它的“大脑”。如果视频长达 2 小时,当 AI 看到结尾时,它可能已经忘记了前 10 分钟发生了什么。
解决方案: 论文探讨了 AI 如何构建“记忆系统”。
- 离线记忆(Offline Memory): 想象你看了部电影,然后把摘要写在笔记本上。稍后,你可以翻阅这个笔记本来寻找细节。一些 AI 系统通过在回答问题前将视频压缩成一个较小的“摘要”或一系列关键事件来实现这一点。
- 流式记忆(Streaming Memory): 这就像新闻主播。视频正在实时输入,AI 必须在记住“刚刚发生了什么”的同时,还要兼顾“一小时前发生了什么”,且不能耗尽存储空间。它使用一个“滚动缓冲区”来保留最重要的近期信息,以及一个“长期存档”来记录大局。
- 智能体型 vs 非智能体型(Agentic vs. Non-Agent):
- 非智能体型: AI 在观看过程中自动编写自己的摘要(就像学生做笔记)。
- 智能体型: AI 表现得像个图书管理员。它意识到自己遗忘了某些内容,于是回到“视频图书馆”,找到那个特定的片段,并把它带回自己的“办公桌”前重新观察。
3. 推理: “侦探的逻辑”
问题: 仅仅看到和记住是不够的。AI 需要把点连成线。如果 AI 说“管家干的”,但它无法指出视频中证明这一点的具体时刻,那就是“幻觉”(编造谎言)。
解决方案: 论文讨论了 AI 如何在开口说话前进行“思考”。
- 纯文本推理(Text-Only Reasoning): AI 在给出答案之前,会写下一段很长的内部思考过程(就像侦探的笔记本)。它会说:“我看到了 X,然后发生了 Y,所以 Z 必然成立。”
- 结合视频进行思考(Thinking with Videos): 这是最新且最先进的想法。AI 不再仅仅是猜测,而是主动回到视频中去核实自己的工作。这就像侦探说:“等等,我觉得在第 10 分钟看到了一个线索。让我倒回去再看一眼那个特定的帧。”
- 智能体型(Agentic): AI 使用工具进行放大、裁剪帧或搜索特定的时间戳。
- 非智能体型(Non-Agent): AI 接受训练,使其在回答中自然地包含时间戳和对所见内容的描述,以此证明它确实查看了证据。
特殊类型的“电影”(子领域)
论文还指出,不同类型的视频需要不同的技能:
- 第一视角(Egocentric): 从人的眼睛角度拍摄的视频(如 GoPro 拍摄)。AI 必须理解这个人正在做什么以及他们的意图是什么。
- 体育运动(Sports): 这些视频节奏极快且充满规则。AI 需要了解比赛规则才能理解裁判为什么吹哨。
- 教学视频(Instructional): 这些视频漫长且信息密集。AI 需要追踪课程步骤,并将老师的声音与幻灯片匹配起来。
- 医疗视频(Medical): 这些涉及高风险领域。AI 需要对工具和身体部位非常精确,通常需要观察漫长的手术过程。
- 电影/叙事类(Movies/Storytelling): 这些依赖于情节和角色关系。AI 必须记住角色是谁,以及他们在整个故事中是如何变化的。
工具箱:数据与测试
论文列出了研究人员用于训练和测试这些 AI 模型的“教科书”(数据集)和“考试”(基准测试)。
- 数据集(Datasets): 这些是带有问答内容的庞大视频集合,其中一些会对为什么答案是正确的进行了详细说明。
- 基准测试(Benchmarks): 这些是检查 AI 是否真的能处理长视频、能否找到特定时刻、或者能否在不产生混乱的情况下推理复杂故事的测试。
未来:下一步是什么?
论文总结道,虽然我们正在取得进展,但仍存在巨大的障碍:
- 空间推理: AI 在理解物体在 3D 空间中的确切位置以及它们如何相对于彼此移动方面仍然较弱。
- 多视频处理: 大多数 AI 一次只能处理一个视频。现实生活涉及在不同的摄像机视角或相关的视频之间切换。
- 长达一小时的视频: 在处理长达数小时的视频而不丢失主线方面,仍然非常困难。
- 效率: 我们需要能够无需检查每一帧就能找到真相的 AI,从而节省时间和能源。
- 流媒体: 开发能够观看直播并实时做出反应(如主动助手)的 AI 是一个主要目标。
简而言之,论文指出,要让 AI 真正理解视频,我们不能再将其视为静态图像,而应将其视为一个需要人类式的观察、记忆和逻辑结合的动态故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。