← 最新论文
🤖 AI

CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion

本文介绍了 CachedSearch,这是一种无需训练的方法,通过激进地缓存候选展开(rollouts)以保持排序保真度,随后仅对排名第一的获胜者进行全计算量重新生成,从而在各种模型架构上以显著降低的成本实现近乎最优的性能增益,进而加速了视频扩散模型在测试时的搜索过程。

原作者: Shreshth Saini, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Shreshth Saini, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一座巨大的图书馆中寻找一首完美的歌曲。你有一个速度极快但有点笨拙的助手,他能在几秒钟内扫描数千首歌,但有时会弄混歌词或漏掉节拍。同时,你还有一个动作缓慢、追求完美的助手,他能完美地聆听每一个音符,但检查一首歌却要花很长时间。在人工智能(特别是“视频生成”)领域,我们正处于类似的情况。AI 模型可以根据文本描述创建视频,但制作单个高质量视频的成本极其高昂且耗时,就像为每一首歌都聘请那位追求完美的助手一样。为了获得最佳结果,研究人员使用了一种被称为“测试时搜索”(test-time search)的技巧:他们让 AI 生成许多不同版本的视频(候选视频),然后从中挑选出绝对最好的那一个。问题在于,制作所有这些候选视频需要耗费巨额的时间和计算资源,而且其中大部分最终都会被丢弃。

这篇论文介绍了一种名为 CachedSearch 的巧妙新策略来解决这个昂贵的问题。你可以把它想象成一个“草拟并定稿”的系统。与其要求那位追求完美的助手从头开始编写每一个候选版本,团队使用了那位快速但笨拙的助手来快速生成所有选项的粗略草稿。他们使用一种特殊的“缓存”(caching)技巧来加速这一过程,这种技巧通过重复利用上一步的部分工作成果,使草稿生成的速度提高了约两倍。至关重要的是,研究人员测试了这些粗略草稿是否足够好,足以判断出哪个视频才是最好的。他们发现,尽管草稿并不完美,但它们对候选视频的排序方式与那个缓慢、完美的版本几乎完全一致。因此,该策略是:利用快速生成的草稿找到赢家,然后仅在此时才要求那位缓慢、完美的助手从头开始制作那一个最终的获胜视频。

结果令人印象深刻。通过使用这种“廉价探索,全力投入”的方法,团队发现他们可以保留通过完美检查每一个选项所能获得的约 94.7% 的质量提升,但仅需花费 63% 的时间。事实上,如果你拥有的时间预算(budget)与检查四段完美视频相同,这种方法能让你检查八份粗略草稿,找到最好的那一个,并将其变得完美,从而比旧方法获得 38% 更好的结果。论文表明,这种方法在不同的 AI 模型上都有效,从拥有 13 亿参数的小型模型到拥有 140 亿参数的大型模型。其核心发现是,快速草稿所犯的“错误”大多发生在视频已经非常相似、以至于选哪一个都几乎无关紧要的时候。这意味着该方法可以安全使用,无需重新训练 AI 模型,它就像是一个插件式的升级,在不损失魔力的前提下,让视频生成变得更快、更便宜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →