← 最新论文
🤖 machine learning

DISK: Dynamic Inference SKipping for World Models

本文介绍了 DISK,这是一种无需训练的自适应推理方法,它利用双分支控制器和跨模态跳过决策,在保持预测精度和视觉质量的同时,实现了自回归世界模型中轨迹扩散 2 倍和视频扩散 1.6 倍的加速。

原作者: Anugunj Naman, Gaibo Zhang, Ayushman Singh, Yaguang Zhang

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Anugunj Naman, Gaibo Zhang, Ayushman Singh, Yaguang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图逐秒预测一条繁忙高速公路的未来。你需要同时完成两件事:

  1. 画出画面: 下一帧的汽车、树木和道路看起来会是什么样子?(“视觉”部分)。
  2. 画出路径: 你的车在下一帧将会移动到哪里?(“轨迹”部分)。

在人工智能的世界里,做这件事就像是在跑一场马拉松,但每跑一秒钟,你都必须停下来进行 100 次微小而谨慎的呼吸(数学计算)。这既缓慢、昂贵,又耗能。

DISK 登场了。

这篇论文介绍了一种名为 DISK(动态推理跳过,Dynamic Inference SKipping)的新方法。把 DISK 想象成一个智能且具有适应性的副驾驶,它坐在 AI 旁边并说道:“嘿,我们现在不需要进行沉重的呼吸。让我们顺势滑行吧。”

以下是它的工作原理,使用简单的类比:

1. “平稳滑行” vs. “颠簸路面”

想象你在高速公路上驾驶。

  • 平稳滑行: 如果你在一条空旷、笔直的道路上行驶,你的方向盘几乎不动。你不需要每毫秒都检查一次路况,你可以直接继续行驶。
  • 颠簸路面: 如果你正接近一个急转弯、施工区或正在汇入车辆,你需要保持注意力。你需要检查后视镜,转动方向盘,并仔细计算你的速度。

DISK 正是这样做的。 它观察着 AI 的“思考过程”(背后的数学运算)。

  • 当场景很简单时(比如在笔直的高速公路上巡航),DISK 告诉 AI:“跳过繁重的数学计算!直接复用上一次的预测结果即可。” 这节省了大量的时间。
  • 当场景变得复杂时(比如突然的变道),DISK 会说:“停!现在进行完整的计算。”

2. “双人自行车”难题

棘手之处在于,这个 AI 有两个协同工作的“大脑”:一个负责视频(我们看到的画面),另一个负责轨迹(我们的去向)。

  • 如果“视频”大脑因为路况看起来很无聊而跳过了一个步骤,但“轨迹”大脑却决定做一个复杂的转向,就会出现故障。车可能会在视频中突然“瞬移”,或者视频显示了一场并未发生的碰撞。

DISK 通过一个“安全门”解决了这个问题。
把“轨迹”大脑想象成驾驶员,把“视频”大脑想象成拍照的乘客。

  • 如果驾驶员(轨迹)看到了复杂的动作并决定“努力工作”(进行完整计算),安全门会立即通知乘客(视频):“停止跳过步骤!你也必须现在拍张照片,这样我们才能保持同步。”
  • 然而,如果乘客看到了有趣的事物,但驾驶员只是在巡航,乘客仍然可以跳过步骤以节省时间。这让两者保持完美的同步,且不会浪费能量。

3. 结果:更快且不失质量

研究人员在庞大的驾驶场景数据集(NuPlan 和 NuScenes)上,使用高性能计算芯片(NVIDIA L40S)对该方法进行了测试。

  • 速度提升: 通过跳过不必要的数学步骤,DISK 使轨迹预测速度提高了 2 倍,视频生成速度提高了 1.6 倍。
  • 质量检查: 尽管跳过了大约 40-50% 的计算,但结果与缓慢的全速版本几乎完全一致。
    • 车辆并没有更频繁地发生碰撞。
    • 视频质量保持在高水平(你无法分辨出快速版本和慢速版本之间的区别)。
    • 车辆的规划决策依然安全且准确。

核心结论

DISK 是一种**无需重新训练(training-free)**的升级方案。你不需要重新教 AI 任何知识,也不需要改变它的“大脑”。你只需要在现有的 AI 系统之上添加这个“智能副驾驶”层即可。

这就像是给超级计算机戴上了一副太阳镜,让它能够忽略路面上无聊的部分,从而将精力集中在那些有趣(且危险)的部分,使整个过程更快、更便宜,同时又不损失其安全驾驶的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →