DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models
DeltaV 是一个统一的大型多模态模型,它通过由时间相似性路由器引导的紧凑视觉更新范式来取代全图像生成,从而提升推理效率和性能,并由名为 StructCoT 的新型大规模交错推理数据集提供支持。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在和一位机器人朋友玩一场复杂的“西蒙说”(Simon Says)游戏,但你不只是在听,你还得在白板上画出游戏的每一个步骤,向你的朋友展示发生了什么。
旧的方法:过度绘画的艺术家
目前,大多数试图解决图像问题(比如破解迷宫或数学谜题)的高级 AI 模型,其工作方式就像一个非常细致但效率略低的艺术家。假设游戏开始时,画面是一个桌子上放着一个杯子。
- 第 1 步: AI 画出了整个桌子和杯子。
- 第 2 步: 游戏规则说:“把杯子向左移动。”然而,AI 会擦掉整个白板,然后重新画出整个桌子,包括杯子、桌腿、背景和阴影,仅仅是为了展示杯子移动了一英寸。
- 第 3 步: “旋转杯子。”AI 擦掉一切,再次重新画出整个桌子。
这种做法被称为“全图生成”(full-image generation)。作者认为这是一种巨大的能量和空间浪费。这就像每当你想要修改句子中的一个词时,都要重写整本字典一样。AI 花费了大量时间在重新绘制那些根本没有改变的东西上,这使得它速度变慢,有时还会导致细节出错(比如因为它忘了杯子之前的样子,而不小心改变了杯子的颜色)。
新的方法:DeltaV,“贴纸”艺术家
论文介绍了一种名为 DeltaV 的新模型。DeltaV 不会重新绘制整个场景,它更像是一个聪明的贴纸艺术家。
- 第 1 步: 它画出桌子和杯子(即“基础状态”)。
- 第 2 步: 当杯子需要移动时,DeltaV 不会重画桌子。它只是画出一个显示杯子向左移动的小“贴纸”,并把它贴在原来的位置上。它忽略了桌腿和背景,因为这些部分并没有改变。
- 第 3 步: 当杯子旋转时,它只需添加一个微小的“旋转贴纸”。
这种方法被称为视觉更新(visual updates)。论文指出,通过只绘制变化的部分(即“增量”,Delta),AI 节省了大量的劳动。在测试中,这种方法在不降低图像质量的前提下,将“绘图标记”(用于创建图像的数字墨水)的数量平均减少了 55.6%。
智能“停止”按钮:TSIM 路由
你可能会问:“如果变化很大怎么办?如果整个场景都爆炸了怎么办?”
DeltaV 有一个内置的智能管理者,叫做 TSIM 路由(TSIM Router)。你可以把它想象成一个监督员,负责观察新场景与旧场景之间的差异有多大。
- 如果变化很小(比如移动一个杯子),监督员会说:“只用几个贴纸就行。”
- 如果变化巨大(比如整个房间都变了),监督员会说:“好吧,多用一些贴纸以确保准确。”
研究人员通过检查 AI 重建图像的能力来衡量这一点。他们发现,如果他们在某个点之后继续增加标记,图像并不会变得更好。因此,TSIM 路由会在“额外投入”不再产生回报时停止添加标记。这确保了 AI 在处理简单步骤时不会浪费时间,而在处理复杂步骤时也不会偷工减料。
训练场:StructCoT
为了教会 DeltaV 如何这样做,研究人员不能只使用旧的益智书。他们构建了一个庞大的新训练集,名为 StructCo-T。
- 它包含 105 万个样本。
- 它涵盖了 44 种不同类型的任务,从逻辑谜题、数学问题到机器人规划和科学问题。
- 论文认为,以往的数据集规模太小,或者只专注于迷宫等特定领域,而 StructCoT 为 AI 提供了更广泛的关于视觉状态如何随时间变化的教育。
结果:奏效了吗?
论文报告称,当测试 DeltaV 时:
- 它在多模态推理问题上的表现比旧的“重画一切”方法高出 3.3%。
- 尽管 DeltaV 是一个较小的模型(20 亿参数),但它在这些推理任务上平均击败了规模大得多的开源模型,领先幅度达 8.4%。
- 它在外部基准测试中也比同类模型 Qwen3-VL-2B 高出了 5.9%。
论文排除的可能性
作者非常明确地指出哪些做法是行不通的。他们明确反对“在每一步推理中都需要生成一张完整的、高分辨率图像”的观点。他们认为,尝试这样做会产生“视觉标记冗余”(浪费数字墨水),并且实际上会干扰 AI 的推理能力,因为它会被重新绘制无关紧要的事物所分心。他们还指出,虽然这种方法对于推理非常出色,但对于需要极细微特征的任务(比如发现一颗微小的尘埃),全图生成可能仍然是必要的。
底线
论文表明,AI 推理的未来不在于一遍又一遍地绘制整个世界。相反,它在于思考“什么是变化的?”通过专注于更新内容,DeltaV 变得更快、更高效,并且在解决复杂谜题方面比那些沉重的、进行全图绘制的同类模型表现得更加出色。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。