← 最新论文
🤖 machine learning

VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization

本文提出了 VideoFlexTok,一种采用由粗到细结构的可变长度视频 Token 化方法,通过让 Token 序列自适应地先捕获抽象语义再补充细节,显著降低了下游生成模型的训练复杂度与计算成本,并实现了在同等预算下更高效的视频生成与更长视频的处理。

原作者: Andrei Atanov, Jesse Allardice, Roman Bachmann, Oğuzhan Fatih Kar, R Devon Hjelm, David Griffiths, Peter Fu, Afshin Dehghan, Amir Zamir

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrei Atanov, Jesse Allardice, Roman Bachmann, Oğuzhan Fatih Kar, R Devon Hjelm, David Griffiths, Peter Fu, Afshin Dehghan, Amir Zamir

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 VideoFlexTok 的新技术,它就像是为视频制作了一个“智能压缩包”。

为了让你更容易理解,我们可以把视频想象成一锅炖菜,而传统的视频压缩技术就像是一个死板的模具

1. 传统方法:死板的“固定模具” (Fixed-size 3D Grid)

目前的视频 AI(比如 Sora 或其他生成模型)在处理视频时,通常使用一种叫"3D 网格”的方法。

  • 比喻:想象你要描述一锅炖菜。传统方法不管这锅菜里只有几块土豆,还是有一百块,它都强制把锅切成完全一样大小的 1000 个小格子。
  • 问题
    • 如果菜很简单(比如只有水在动),这 1000 个格子里大部分是空的,但 AI 还是得一个个去数,浪费力气。
    • 如果菜很复杂(比如有很多食材在翻滚),这 1000 个格子可能又不够用,细节会糊掉。
    • 结果:AI 必须学会处理所有情况,导致它学得很慢,而且非常消耗算力(就像为了做一碗清汤面,却非要搬来一吨面粉)。

2. VideoFlexTok 的创意:灵活的“智能摘要” (Coarse-to-Fine)

VideoFlexTok 改变了这个规则。它不再把视频切成死板的格子,而是像写故事画画一样,分步骤、分层次地描述视频。

  • 比喻:想象你在向朋友描述刚才看到的视频。
    • 第一步(粗粒度):你先说:“这是一个红色的车弯曲的乡间小路上开。”(这只需要很少的“词”或“令牌”,但抓住了核心:车、路、动作)。
    • 第二步(中粒度):朋友问:“车开得怎么样?”你补充:“速度中等,周围有。”
    • 第三步(细粒度):朋友想看细节,你再说:“树叶是绿色的,车轮在,路面有点颠簸。”
    • 第四步(超细节):如果你需要,还可以描述“车漆上的反光”或“路边石头的纹理”。

VideoFlexTok 的核心魔法在于:

  1. 按需分配:它可以根据需要,只用很少的“词”(比如 4 个)就能概括视频的大概(车在动),或者用很多“词”(比如 256 个)来还原每一个细节。
  2. 先抓重点,再填细节:它生成的顺序是从粗到细。前几个“词”就包含了视频的灵魂(是什么物体、怎么动),后面的“词”只是用来修饰细节的。
  3. 万能解码器:无论 AI 给了它几个“词”(哪怕只有 4 个),它都能根据这些核心信息,脑补出完整、逼真的视频画面。

3. 这带来了什么好处?

A. 省资源,跑得快 (Efficiency)

  • 比喻:以前造视频模型,就像是用大象去搬砖,不管砖多小,都得用大象。现在 VideoFlexTok 让 AI 变成了蚂蚁
  • 实际效果:论文中提到,生成一个 10 秒的视频,传统方法可能需要 5000 多个“词”(Token),而 VideoFlexTok 只需要 672 个
    • 这意味着训练模型的速度快了 5 到 10 倍
    • 或者,用同样大的算力,可以训练出更聪明、效果更好的模型。

B. 能生成更长的视频 (Long Video Generation)

  • 比喻:以前因为“搬运工”(算力)太累,只能搬很短的砖(短视频)。现在因为“搬运工”变聪明了,一次能搬更多,所以可以造出10 秒甚至更长的连贯视频,而不会让电脑“累死”。
  • 实际效果:论文成功训练了一个模型,用极少的“词”生成了 10 秒(81 帧)的视频,而且画面连贯,逻辑通顺。

C. 更懂“意思” (Semantic Understanding)

  • 比喻:传统的压缩就像把照片压成像素点,AI 只能看到“红点、绿点”。VideoFlexTok 的前几个“词”直接告诉 AI:“这是一辆车,它在转弯”。
  • 实际效果:因为前几个词就抓住了核心意思,AI 在生成视频时,能更准确地听懂你的指令(比如“一辆红车在转弯”),生成的视频更符合你的要求,而不是瞎编乱造。

4. 总结:它是怎么工作的?

  1. 编码器(Encoder):像是一个精明的编辑。它看视频,先提取出“谁在干什么”(核心信息),再提取“长什么样”(细节信息)。它把这些信息打包成不同长度的“压缩包”。
  2. 解码器(Decoder):像是一个想象力丰富的画家。无论编辑给它的是“只有核心信息”的短包,还是“包含所有细节”的长包,它都能根据这些信息,画出一张逼真的视频图。
  3. 训练方式:它被训练成一种“预测未来”的游戏。它不仅要还原现在的画面,还要学会根据前面的“粗线条”去预测后面的“细线条”,这让它学会了视频的运动规律。

一句话总结

VideoFlexTok 就像给视频 AI 装上了一个“智能摘要”功能:它不再死板地数每一个像素,而是先学会“抓重点”,再根据需要“填细节”。这让 AI 生成视频变得更聪明、更快速,而且能轻松制作出更长的视频。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →