← 最新论文
🤖 AI

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

本文提出了一个统一的“人类视角”框架,用于通过多模态大语言模型进行视频理解,围绕观看、记忆和推理这三项核心能力来组织该领域,从而系统地分析处理长且复杂视频场景中的挑战、方法、应用及未来方向。

原作者: Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图理解一部非常长且复杂的电影。你不能只是扫一眼,你必须观看它、记住情节并解开谜团。这篇论文认为,要教会计算机做到这一点,需要它们掌握三项特定的类人技能:观看(Watching)记忆(Remembering)推理(Reasoning)

以下是该论文内容的简单拆解,使用了日常类比。

大局观:“人类视角”方法

作者认为,与其将视频理解视为一系列独立的数学问题,我们应该像人类一样看待它。当你观看一部两小时的电影时,你并不会以同样的强度盯着每一个画面。你会观看重要的部分,记住角色和情节要点,并推理整个故事,从而回答诸如“谁干的?”或“为什么会发生那件事?”之类的问题。

论文将最新的 AI 研究归纳到这三个范畴中。


1. 观看: “选择性的眼睛”

问题: 视频量巨大。一部一小时的电影有数千帧。如果向计算机展示每一帧,它会应接不暇(就像试图用消防水龙头喝水一样)。而且,最重要的线索可能是一个只持续了刹那间的微小细节。

解决方案: 论文回顾了教导 AI 成为“选择性观察者”的方法。

  • 细粒度观看(Fine-Grained Watching): 这就像侦探放大观察特定的指纹。AI 学习精准定位某事发生的具体时间地点(例如:“枪在 12:05 被发射”)。
  • 全面观看(Comprehensive Watching): 这就像电影评论家总结整部影片。AI 学习描述整个视频或将其分解为场景。
  • 视听观看(Audio-Visual Watching): 这就像开着声音看电影。AI 学习在观看动作的同时聆听对话和音乐,理解尖叫声与惊恐的面孔是相匹配的。
  • 高效观看(Efficient Watching): 这是“跳过无聊部分”的技能。AI 学习忽略冗余帧(比如一段对着墙壁的长镜头),只保留那些真正能回答问题的帧。

2. 记忆: “智能档案柜”

问题: 即使 AI 观看了视频,它也无法同时把整个视频都装进它的“大脑”。如果视频长达 2 小时,当 AI 看到结尾时,它可能已经忘记了前 10 分钟发生了什么。

解决方案: 论文探讨了 AI 如何构建“记忆系统”。

  • 离线记忆(Offline Memory): 想象你看了部电影,然后把摘要写在笔记本上。稍后,你可以翻阅这个笔记本来寻找细节。一些 AI 系统通过在回答问题前将视频压缩成一个较小的“摘要”或一系列关键事件来实现这一点。
  • 流式记忆(Streaming Memory): 这就像新闻主播。视频正在实时输入,AI 必须在记住“刚刚发生了什么”的同时,还要兼顾“一小时前发生了什么”,且不能耗尽存储空间。它使用一个“滚动缓冲区”来保留最重要的近期信息,以及一个“长期存档”来记录大局。
  • 智能体型 vs 非智能体型(Agentic vs. Non-Agent):
    • 非智能体型: AI 在观看过程中自动编写自己的摘要(就像学生做笔记)。
    • 智能体型: AI 表现得像个图书管理员。它意识到自己遗忘了某些内容,于是回到“视频图书馆”,找到那个特定的片段,并把它带回自己的“办公桌”前重新观察。

3. 推理: “侦探的逻辑”

问题: 仅仅看到和记住是不够的。AI 需要把点连成线。如果 AI 说“管家干的”,但它无法指出视频中证明这一点的具体时刻,那就是“幻觉”(编造谎言)。

解决方案: 论文讨论了 AI 如何在开口说话前进行“思考”。

  • 纯文本推理(Text-Only Reasoning): AI 在给出答案之前,会写下一段很长的内部思考过程(就像侦探的笔记本)。它会说:“我看到了 X,然后发生了 Y,所以 Z 必然成立。”
  • 结合视频进行思考(Thinking with Videos): 这是最新且最先进的想法。AI 不再仅仅是猜测,而是主动回到视频中去核实自己的工作。这就像侦探说:“等等,我觉得在第 10 分钟看到了一个线索。让我倒回去再看一眼那个特定的帧。”
    • 智能体型(Agentic): AI 使用工具进行放大、裁剪帧或搜索特定的时间戳。
    • 非智能体型(Non-Agent): AI 接受训练,使其在回答中自然地包含时间戳和对所见内容的描述,以此证明它确实查看了证据。

特殊类型的“电影”(子领域)

论文还指出,不同类型的视频需要不同的技能:

  • 第一视角(Egocentric): 从人的眼睛角度拍摄的视频(如 GoPro 拍摄)。AI 必须理解这个人正在做什么以及他们的意图是什么。
  • 体育运动(Sports): 这些视频节奏极快且充满规则。AI 需要了解比赛规则才能理解裁判为什么吹哨。
  • 教学视频(Instructional): 这些视频漫长且信息密集。AI 需要追踪课程步骤,并将老师的声音与幻灯片匹配起来。
  • 医疗视频(Medical): 这些涉及高风险领域。AI 需要对工具和身体部位非常精确,通常需要观察漫长的手术过程。
  • 电影/叙事类(Movies/Storytelling): 这些依赖于情节和角色关系。AI 必须记住角色是谁,以及他们在整个故事中是如何变化的。

工具箱:数据与测试

论文列出了研究人员用于训练和测试这些 AI 模型的“教科书”(数据集)和“考试”(基准测试)。

  • 数据集(Datasets): 这些是带有问答内容的庞大视频集合,其中一些会对为什么答案是正确的进行了详细说明。
  • 基准测试(Benchmarks): 这些是检查 AI 是否真的能处理长视频、能否找到特定时刻、或者能否在不产生混乱的情况下推理复杂故事的测试。

未来:下一步是什么?

论文总结道,虽然我们正在取得进展,但仍存在巨大的障碍:

  1. 空间推理: AI 在理解物体在 3D 空间中的确切位置以及它们如何相对于彼此移动方面仍然较弱。
  2. 多视频处理: 大多数 AI 一次只能处理一个视频。现实生活涉及在不同的摄像机视角或相关的视频之间切换。
  3. 长达一小时的视频: 在处理长达数小时的视频而不丢失主线方面,仍然非常困难。
  4. 效率: 我们需要能够无需检查每一帧就能找到真相的 AI,从而节省时间和能源。
  5. 流媒体: 开发能够观看直播并实时做出反应(如主动助手)的 AI 是一个主要目标。

简而言之,论文指出,要让 AI 真正理解视频,我们不能再将其视为静态图像,而应将其视为一个需要人类式的观察记忆逻辑结合的动态故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →