← 最新论文
💻 computer science

ChronoVision: Temporal Reasoning via Latent State Reconstruction

ChronoVision 是一个多模态框架,它通过将视觉逻辑与潜状态重建及强化学习相结合,增强了大型语言模型的时序推理能力,并在新引入的 Vbvr-VQA 数据集以及具有挑战性的 IntPhys2 基准测试中实现了最先进的性能。

原作者: Yifan Shen, Jian Xu, Boyi Li, Yuner Zhang, Tianjiao Yu, Bingxuan Li, Houze Yang, Rushi Wang, Xu Cao

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifan Shen, Jian Xu, Boyi Li, Yuner Zhang, Tianjiao Yu, Bingxuan Li, Houze Yang, Rushi Wang, Xu Cao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一个魔术表演:一个球消失了,然后又出现在另一个地方。人类并不仅仅是看到了两张独立的图片;人类会在脑海中填补那段看不见的间隙,模拟球的飞行路径,以理解它是如何到达那里的。这种在脑海中运行“心理电影”以理解事物随时间变化的能力被称为视觉想象力(visual imagery),它是人类认知的一种超能力。几十年来,科学家们一直致力于教计算机如何观察并描述这个世界,这些模型被称为多模态大语言模型(MLLMs)。它们就像是超级聪明的机器人,可以看一张照片并为此写一首诗。然而,在处理复杂的事件序列时——比如预测一叠积木会如何倒塌,或者液体会如何流出——这些机器人经常会跌跤。它们擅长描述一个静止的瞬间,却极不擅长理解连接前后瞬间的连续时间流和物理规律。它们试图通过猜测文字模式来解决这些谜题,这就像是通过阅读地图的文字描述来尝试走通迷宫,而不是亲自走一遍路。

于是,ChronoVision 应运而生,这是一个旨在为这些 AI 模型提供属于它们自己的“心理电影放映机”的新型框架。ChronoVision 不再仅仅基于文本进行猜测,而是教会模型在内部重建事件的视觉结果,就像人类在事情发生前想象场景最终状态一样。研究人员构建了一个特殊的训练程序,在这个程序中,AI 不仅仅是观察被打乱顺序的图片并猜测顺序;它还必须在其数字大脑中“梦见”最终的图像,然后检查其猜测是否与现实相符。他们还教会了模型对场景中特定的运动部件进行局部放大,从而忽略静态的背景噪音。为了确保模型真正学会了思考而非仅仅是死记硬背,他们创建了一个新的测试,名为 Vbvr-VQA。这个测试非常棘手:它给出一个起始图片和六张关于后续发生情况的乱序图片,AI 必须将它们按完美的时序进行排列。这里没有可以依赖的多项选择选项;AI 必须完成整个序列的排序。

结果表明,这种方法效果显著。在他们开发的新测试中,ChomoVision 在处理已知任务时达到了 74.8% 的准确率,在处理完全陌生的新场景时达到了 71.6%。与相比之下在这些物理谜题上经常难以突破 50%(即本质上的随机猜测)的其他顶尖模型相比,这是一个巨大的飞跃。团队还在一个名为 IntPhys2 的基准测试上对模型进行了测试,该测试涉及重力和弹跳球等现实世界的物理现象,ChronoVision 在该测试中达到了 55.0% 的准确率,超越了他们测试的所有开源及商业模型。

论文反对这样一种观点,即仅仅通过编写更多的文本或使用“思维链”(Chain of Thought,即逐步通过语言讨论问题)就足以解决视觉谜题。他们发现,语言在准确描述连续物理运动方面过于笨拙;你无法仅用文字完美地描述一个 3D 旋转,而不丢失关键的空间细节。相反,ChronoVision 使用了一个“重构视觉头”(Reconstructive Visual Head)来直接预测最终状态的潜在(隐藏)视觉表示。它还使用了一个“感兴趣区域”(Region of Interest)模块,迫使模型专注于图像中实际发生运动的部分,而不是被整个画面分散注意力。最后,他们使用了一种强化学习技术,模型获得的奖励不仅在于得到正确答案,还在于其具有正确的“视觉焦点”,以及其内部推理步骤与实际视觉变化的一致性。

简而言之,论文指出,要真正理解时间和物理学,AI 需要学会去“想象”未来,而不仅仅是“谈论”未来。通过训练模型在它们的潜在空间中模拟最终结果,并让它们关注正确的运动部分,ChronoVision 弥合了被动观察与主动推理之间的鸿沟。虽然该模型仍有成长空间——尤其是在最难的物理问题上——但它证明了赋予 AI 一种“想象”未来的方式,是让它们成为更聪明、更可靠的动态世界观察者的有力一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →