← 最新论文
💻 computer science

Hierarchical Denoising For Multi-Step Visual Reasoning

本文介绍了 HDR,这是一个采用分层潜变量和稀疏注意力机制的统一框架,旨在实现高效、低延迟的多步视觉推理视频生成,在推理准确度和推理速度方面均显著优于现有的流式自回归模型和双向扩散模型。

原作者: Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人去解决复杂的谜题,比如迷宫或国际象棋,但不仅仅是思考动作,而是要求机器人在进行每一步操作时,都要实时绘制出整个游戏的每一帧画面。这就是视频生成模型(video generation models)那个令人兴奋又棘手的世界。这些 AI 系统不仅是观看视频,它们是从零开始创造视频。最近,科学家们一直试图将这些模型从简单的“视频画家”(仅让画面看起来真实)升级为“视频思考者”(能够通过多步逻辑推理)。

这里面临着一种两种思维方式之间的拉锯战。一种方式就像是一个字一个字地写故事:它很快、很高效,但一旦你写下一个词,你就很难在不重写整页的情况下回头修改。另一种方式则是先写好一整篇草稿,然后同时编辑整个篇章,以确保情节合理。这种方式非常利于逻辑,但极其缓慢且沉重,就像是在拍摄电影的过程中还要同时剪辑整部电影一样。大家都在问:我们能否构建一个既能像人类一样进行深度逻辑思考,又能生成足够快、足以满足实时需求的视频模型?

于是,HDR(用于视觉推理的分层去噪,Hierarchical Denoising for Visual Reasoning)出现了。这是研究人员提出的一种新框架,旨在解决这个难题。把 HDR 想象成一位聪明的导演,他并不只是从头到尾一次性拍完一个场景,而是先勾勒出整部电影的一个模糊轮廓(即“粗粒度”计划),确定大的剧情节奏和角色的行动轨迹。只有在宏观蓝图确定之后,导演才会放大细节,填充像衣服颜色或手部精确动作之类的微小细节。

在论文中,作者解释说,之前的快速模型(被称为“流式自回归扩散模型”)表现得过于急躁。它们会过早地做出决定——就像一个机器人在检查路径是否通畅之前,就匆忙决定向左转。一旦做出这个决定,机器人就被困住了,即使那条路是死胡同。另一方面,那些慢速的“双向”模型虽然可以观察整个时间线并修正错误,但由于计算量巨大,它们无法实现实时运行。

HDR 通过将视频生成过程组织成一个树状结构来弥补这一差距。想象一下,这是一个关于时间的家族树。在树的顶端,模型会对整体计划生成一些“带有噪声”的猜测。这些猜测是模糊且具有不确定性的,但这其实是一件好事!这意味着模型正在保留多种可能性,维持着多种选择。随着过程向树的“更细粒度”层级移动,模型会逐渐清除噪声,将这些模糊的想法转化为清晰、具体的视频帧。至关重要的是,模型只有在利用顶层结构规划好整个旅程后,才会最终确定详细的视频内容。

实验结果令人印象深刻。在测试了六种不同的推理任务(如导航迷宫、解决汉诺塔谜题或在不洒水的情况下将水倒入管中)后,HDR 的表现显著优于那些急躁的快速模型。它将解决这类多步谜题的成功率从约 34% 大幅提升到了 60%,这是一个巨大的飞跃。更重要的是,它在提升智能的同时并没有降低速度。虽然那些慢速的“全量编辑”模型生成单步动作需要近 38 秒,但 HDR 仅需 0.70 秒 即可完成,这使得它比慢速方法快了约 54 倍,同时依然比快速方法要聪明得多。

研究人员还发现,HDR 是一个学习效率极高的模型。即使在仅使用常规数据量 2% 的情况下进行训练,它仍能保持 82.9% 的成功率,而其他模型则会跌至约 52%。这表明,“分层式”的思维方式——先规划大局,再填充细节——是一种学习规则而非仅仅记忆案例的强大方式。

为了证明这不仅仅是电脑屏幕上的技巧,团队还在现实世界中测试了 HDR,让一个机械臂在由积木组成的物理迷宫中进行导航。尽管现实世界充满了各种变数(如光照变化或积木摆放歪斜),使用 HDR 逻辑的机器人能够成功地带着一个毛绒玩具穿过迷宫,这证明了这种“先思考再绘制”的方法在物理世界中同样有效。

简而言之,HDR 表明我们不必在“快速”与“智能”之间做单选题。通过将视频生成组织成一个由计划与细节构成的层级结构,我们可以赋予 AI 在处理复杂多步问题时的推理能力,同时保持足够快的生成速度,使其具备实用价值。这是一种教机器人在迈出下一步之前先进行预判的新方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →