← 最新论文
💻 computer science

MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding

该论文提出了 MARC,一种记忆增强型强化学习框架,通过结合视觉记忆检索器(Visual Memory Retriever)与压缩组相对策略优化(Compression Group Relative Policy Optimization)蒸馏方法的创新“先检索后压缩”策略,在实现接近基准水平的视频理解准确度的同时,将视觉标记(visual tokens)减少了 95%,并将 GPU 显存降低了 72%。

原作者: Peiran Wu, Zhuorui Yu, Yunze Liu, Chi-Hao Wu, Enmin Zhou, Junxiao Shen

发布于 2026-02-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Peiran Wu, Zhuorui Yu, Yunze Liu, Chi-Hao Wu, Enmin Zhou, Junxiao Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个巨大的高清电影文件,需要展示给一位非常聪明但很忙的助手(一个 AI 模型)。问题在于,这个文件太大了,以至于助手会被淹没,耗尽内存,并且要花很长时间才能给你答案。这就是目前 AI 视频理解面临的困境:视频太大,难以快速处理。

这篇论文介绍了一个名为 MARC(记忆增强强化学习标记压缩)的新系统来解决这个问题。你可以把 MARC 想象成一个两步走的“智能剪辑师”,它能将一部电影缩减到只有一张照片的大小,同时又不丢失故事内容。

以下是它的工作原理,使用了简单的类比:

1. 问题所在:“信息过载”瓶颈

目前,为了理解视频,AI 模型通常尝试查看每一个帧,就像以每秒 60 帧的速度观看电影一样。如果视频很长,这就会产生海量的数据。

  • 类比: 想象一下,为了回答一个简单的问题,你需要读完一本 500 页的书。这是低效的。你不需要阅读每一页上的每一个字;你只需要找到隐藏答案的特定章节。

2. 第一步:视觉记忆检索器(聪明的图书管理员)

在 AI 尝试压缩视频之前,它首先需要找到正确的部分。论文中称之为视觉记忆检索器 (Visual Memory Retriever, VMR)

  • 工作原理: 这个工具不再将视频视为连续的流,而是像一个理解故事的人类图书管理员一样。它将视频分解为“事件”(例如电影中的场景)。
  • 隐喻: 如果你问:“车祸发生时发生了什么?”图书管理员不会给你看整部电影。他们会立即调出与车祸相关的 3 个短片,包括车祸发生瞬间及其前后的时刻。他们会忽略那些无事发生的枯燥部分。
  • 结果: 现在 AI 只需要处理几个简短且相关的片段,而不是整部电影。

3. 第二步:C-GRPO(“师徒制”训练)

现在 AI 已经有了正确的片段,但它仍然有太多的细节(标记/tokens)需要高效处理。论文引入了一种新的训练方法,称为 C-GRPO

  • 类比: 想象一位主厨(老师)正在使用一间完整的厨房烹饪一道复杂的 64 道菜的大餐。然后,你有一个学徒(学生),他只被允许使用一个微型露营炉灶和一种食材。
  • 挑战: 通常,如果你强迫学徒使用这么少的资源,食物的味道会变得很难吃。
  • 解决方案: 论文使用了一种特殊的“强化学习”奖励系统。学徒尝试烹饪,系统会检查:“尽管学徒使用的食材如此之少,但他做出的菜味道是否和主厨的一样好?”
    • 如果学徒成功了,他们会获得奖励。
    • 如果失败了,他们会受到惩罚。
  • 结果: 通过这种试错过程,学徒学会了如何仅利用极少部分的食材,就能提取出“味道的精华”(即推理能力)。

4. 结果:缩减大象

论文声称,通过结合“聪明的图书管理员”(寻找正确的片段)和“师徒制”训练(压缩数据):

  • 体积缩减: 他们可以将原本需要 64 帧 数据才能理解的视频,压缩到仅相当于 1 帧 的大小。这意味着实现了 95% 的数据缩减
  • 性能: 尽管使用了减少 95% 的数据,AI 理解问题的能力与看到完整 64 帧时的表现几乎完全相同。
  • 速度与内存:
    • 内存: 它节省了 72% 的计算机内存 (RAM)。
    • 速度: 生成答案的速度提高了 23.9%

为什么这很重要(根据论文所述)

作者指出,这使得在资源有限的设备上运行这些强大的视频 AI 模型成为可能。他们特别提到了以下应用场景:

  • 实时视频问答(在视频播放过程中针对内容进行提问)。
  • 监控系统(在无需超级计算机的情况下监控摄像头)。
  • 自动驾驶(汽车需要在有限的车载功率下快速理解视频)。

简而言之,MARC 教会了 AI 如何从“逐字阅读者”变成“略读者”,从而在不需要处理整个文件的情况下,找到最重要的时刻并进行深度理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →