← 最新论文
🤖 AI

DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding

DynFrame 是一种自适应多模态框架,它引入了可学习的、分词化的帧采样密度以及解耦段落的 GRPO 训练策略,以实现高效的多粒度视频证据检索和精确的信用分配,从而在复杂视频理解任务中取得最先进的性能。

原作者: Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu, Yan Xia, Zhenhao Peng, Weilong Dai, Jinlong Liu, Haobing Tang, Le Zhang, Hao Jiang, Pipei Huang

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu, Yan Xia, Zhenhao Peng, Weilong Dai, Jinlong Liu, Haobing Tang, Le Zhang, Hao Jiang, Pipei Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于DynFrame论文的解释,已用通俗易懂的语言并辅以生动的类比进行翻译。

核心难题:“模糊快照”陷阱

想象一下,你正在试图解开一段 30 分钟视频中的谜团。你问一个智能 AI:“车祸发生时,那辆车是什么颜色的?”

当前的 AI 模型往往像是一个在回答问题前只拍摄一张模糊快照的摄影师。它们可能会选取开头、中间和结尾的某一帧。如果车祸发生在这些帧之间的一瞬间,AI 就会完全错过。随后,它只能试图依靠记忆来猜测答案,这常常导致“幻觉”(即凭空捏造)。

一些更新的模型试图通过允许 AI“倒带”并重新观看视频来解决这个问题。然而,这些模型显得笨拙。它们通常必须多次倒带,请求一小段片段,然后再请求另一段,接着又是一段。这不仅缓慢、昂贵,还会让 AI 的“思考过程”变得冗长且混乱。

解决方案:DynFrame(“智能侦探”)

DynFrame是一个新系统,它教导 AI 成为一名更聪明的侦探。DynFrame 不再拍摄模糊快照或将视频倒带十次,而是学会在单一步骤中同时完成两件事:

  1. 看哪里:它挑选确切的时间窗口(例如,“查看 1:05 到 1:10 之间”)。
  2. 以多快的速度观看:它决定该特定时刻所需的“帧率”(每秒多少张图片)。

类比:监控摄像头
想象一名保安正在观看实时画面。

  • 旧 AI:保安每 10 秒拍一张照片。如果小偷在 10:05 跑过,保安就会错过。随后,保安不得不呼叫摄像师“放大”并“放慢”画面,然后再呼叫一次以“进一步放大”。
  • DynFrame:保安看到可疑之处。瞬间,他们说道:“倒带到 10:05,并每秒给我显示 60 帧!”他们立即获得了完美的、高速的证据来破案。

工作原理(“原生令牌”)

该论文介绍了一个巧妙的技巧,称为令牌化检索(Tokenized Retrieval)
通常,要求计算机“获取更多视频”就像给另一个部门发送一封单独的邮件。DynFrame 将这一过程变成了对话本身的一部分。

AI 在其思考过程中直接生成特殊的“魔法词”(令牌),如 <span>(时间窗口)和 <fps>(每秒帧数)。

  • 示例:AI 思考:“我需要检查车祸。10.0s - 12.0s 6。好的,现在我看到车是红色的……"

这使得 AI 能够即时决定:对于快速动作,它是否需要慢动作视图(高帧率),或者对于缓慢的对话,是否只需要几个慢帧。

训练:“解耦分段 GRPO"

训练模型做到这一点颇具挑战性。如果 AI 给出了错误的答案,你怎么知道它是失败于看了错误的时间,还是失败于误读了它看到的视频?

作者们创造了一种新的训练方法,称为SD-GRPO

  • 类比:想象一名学生参加考试。
    • 旧方法:如果学生最终答案错误,即使他们选对了教科书页码但只是犯了数学错误,他们也会因为整张试卷而得到低分。
    • DynFrame 方法:老师将分数分开。“你选对了页码(做得好!)”,但是“你的数学做错了(再试一次)”。
      这有助于 AI 专门学习如何找到正确的视频片段,以及如何对其进行推理,而不会混淆这两种技能。

结果

作者在六个不同的视频挑战中测试了 DynFrame(例如在视频中寻找特定时刻或回答关于长电影的问题)。

  • 性能:他们较小的模型(40 亿参数)的表现与更大、更成熟的模型(70 亿至 80 亿参数)相当。
  • 效率:由于 DynFrame 只需要一个智能检索步骤,而不需要多个笨拙的步骤,因此它速度更快,所需的计算能力更少。

总结

DynFrame是一个视频 AI,它不只是“猜测”要看什么。它学会说:“我需要看这段特定的 5 秒片段,但我需要以慢动作观看”,所有这些都在一口气中完成。这使得它在解决复杂的视频谜团时更加出色,既不会迷失方向,也不会浪费时间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →