← 最新论文
💬 NLP

STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models

STORMS 是一个两阶段框架,通过训练视频语言模型将动态视觉证据内化为有界连续潜在轨迹,从而增强其时空推理能力,进而相较于依赖外部工具或显式文本思维链的方法,在显著降低推理延迟的同时实现更高的准确率。

原作者: Yiming Liang, Yixiao Chen, Yiyang Zhou, Yixuan Wang, Shoubin Yu, Andong Deng, Fuxiao Liu, Qin Zhang, Chen Chen, Mohit Bansal, Huaxiu Yao

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiming Liang, Yixiao Chen, Yiyang Zhou, Yixuan Wang, Shoubin Yu, Andong Deng, Fuxiao Liu, Qin Zhang, Chen Chen, Mohit Bansal, Huaxiu Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于TORM论文的解读,将其拆解为简单概念并辅以日常类比。

核心难题:视频难以“思考”

想象你正在观看一个人制作三明治的视频。要回答“他们接下来会做什么?”这样的问题,你的大脑必须追踪手的动作、食材的顺序,以及场景每秒的变化。

当前的 AI 模型(视频 - 语言模型)非常擅长处理图片,但在处理视频时却显得力不从心,因为视频是一个动态的拼图。

  • 旧方法: 为了解决这个问题,当前的 AI 通常试图通过“说话”来解决问题。它会停下来,写下一长串思维(像文字日记),挑选特定帧重新查看,甚至调用外部工具来协助。
  • 缺点: 这就像试图通过在纸上写下每一步来解一道数学题,然后擦掉,再重新写一遍。这种方法既缓慢又笨拙,而且消耗大量能量(计算能力)。

解决方案:TORM(“内部电影”)

作者提出了TORM(通过内部化建模进行时空推理)。

TORM 不再强迫 AI 写出它的想法或寻求帮助,而是教导 AI 利用一种隐藏的紧凑代码,在自身的“大脑”中模拟视频

可以这样理解:

  • 旧 AI: 像一名侦探,必须停下来,拿出放大镜,给证据拍照,写一份报告,然后再拍一张照片。
  • TORM AI: 像一名侦探,闭上眼睛,在脑海中完美地重播场景,然后瞬间给出答案。

工作原理:两阶段训练

这篇论文描述了一种巧妙的两步训练过程,以教会 AI 这种“思维电影”技能。

第一阶段:“老师”展示电影

在训练期间,系统会生成一个特殊的“思维视频”。

  1. 它获取一段真实视频和一个问题。
  2. 它利用强大的 AI 生成一段简短的新视频,该视频显示与答案相关的部分(例如,仅显示搅拌饮料的手)。
  3. 模型会观看这个“思维视频”,并被告知:“你的隐藏大脑状态(潜在令牌)必须看起来像这段视频。”
  4. 类比: 想象一位老师给学生看一段关于足球进球的完美短片。老师说:“不要写一段关于进球的段落。相反,要在脑海中想象球击中球网的感觉,并确保你的‘心理图像’与这段短片相匹配。”

第二阶段:“沉默”练习

一旦 AI 学会了将其内部大脑状态与这些视频片段相匹配,训练就会发生变化。

  1. “思维视频”被移除。
  2. AI 再次被问到该问题。
  3. 它被指示:“继续在你的脑海中思考(使用你学到的那些内部状态),但不要向我展示视频。直接给我最终答案。”
  4. 类比: 老师停止播放短片。现在,学生必须闭上眼睛,重播第一阶段学到的心理电影,然后大声喊出答案。他们不再被允许做笔记或查看屏幕。

结果:快速且高效

当 AI 接受测试(推理)时:

  • 不会生成新视频。
  • 不会重看帧。
  • 不会调用外部工具。

它只是在隐藏代码中运行一个简短、快速的“模拟”(潜在展开),然后说出答案。

为什么这更好?

  • 速度: 因为它不需要生成庞大的视频文件或搜索帧,所以速度快得多。论文显示,其速度比依赖外部工具的方法快约30 倍
  • 准确性: 它实际上能更好地回答复杂的视频问题,因为它学会了在内部“感受”运动和时序,而不仅仅是用语言描述。

总结

TORM 是一种教导 AI 理解视频的新方法。它不再让 AI 写长故事或利用外部工具来弄清楚接下来会发生什么,而是教导 AI 运行一个无声的内部模拟。它通过在训练期间观看“思维视频”来学习这一点,但在实际测试中,它仅利用内部的“思维电影”来给出快速、准确的答案。

关键要点: 它将视频推理从“大声做功课”(缓慢且混乱)转变为“默默思考”(快速且高效)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →