STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
STORMS 是一个两阶段框架,通过训练视频语言模型将动态视觉证据内化为有界连续潜在轨迹,从而增强其时空推理能力,进而相较于依赖外部工具或显式文本思维链的方法,在显著降低推理延迟的同时实现更高的准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于TORM论文的解读,将其拆解为简单概念并辅以日常类比。
核心难题:视频难以“思考”
想象你正在观看一个人制作三明治的视频。要回答“他们接下来会做什么?”这样的问题,你的大脑必须追踪手的动作、食材的顺序,以及场景每秒的变化。
当前的 AI 模型(视频 - 语言模型)非常擅长处理图片,但在处理视频时却显得力不从心,因为视频是一个动态的拼图。
- 旧方法: 为了解决这个问题,当前的 AI 通常试图通过“说话”来解决问题。它会停下来,写下一长串思维(像文字日记),挑选特定帧重新查看,甚至调用外部工具来协助。
- 缺点: 这就像试图通过在纸上写下每一步来解一道数学题,然后擦掉,再重新写一遍。这种方法既缓慢又笨拙,而且消耗大量能量(计算能力)。
解决方案:TORM(“内部电影”)
作者提出了TORM(通过内部化建模进行时空推理)。
TORM 不再强迫 AI 写出它的想法或寻求帮助,而是教导 AI 利用一种隐藏的紧凑代码,在自身的“大脑”中模拟视频。
可以这样理解:
- 旧 AI: 像一名侦探,必须停下来,拿出放大镜,给证据拍照,写一份报告,然后再拍一张照片。
- TORM AI: 像一名侦探,闭上眼睛,在脑海中完美地重播场景,然后瞬间给出答案。
工作原理:两阶段训练
这篇论文描述了一种巧妙的两步训练过程,以教会 AI 这种“思维电影”技能。
第一阶段:“老师”展示电影
在训练期间,系统会生成一个特殊的“思维视频”。
- 它获取一段真实视频和一个问题。
- 它利用强大的 AI 生成一段简短的新视频,该视频仅显示与答案相关的部分(例如,仅显示搅拌饮料的手)。
- 模型会观看这个“思维视频”,并被告知:“你的隐藏大脑状态(潜在令牌)必须看起来像这段视频。”
- 类比: 想象一位老师给学生看一段关于足球进球的完美短片。老师说:“不要写一段关于进球的段落。相反,要在脑海中想象球击中球网的感觉,并确保你的‘心理图像’与这段短片相匹配。”
第二阶段:“沉默”练习
一旦 AI 学会了将其内部大脑状态与这些视频片段相匹配,训练就会发生变化。
- “思维视频”被移除。
- AI 再次被问到该问题。
- 它被指示:“继续在你的脑海中思考(使用你学到的那些内部状态),但不要向我展示视频。直接给我最终答案。”
- 类比: 老师停止播放短片。现在,学生必须闭上眼睛,重播第一阶段学到的心理电影,然后大声喊出答案。他们不再被允许做笔记或查看屏幕。
结果:快速且高效
当 AI 接受测试(推理)时:
- 它不会生成新视频。
- 它不会重看帧。
- 它不会调用外部工具。
它只是在隐藏代码中运行一个简短、快速的“模拟”(潜在展开),然后说出答案。
为什么这更好?
- 速度: 因为它不需要生成庞大的视频文件或搜索帧,所以速度快得多。论文显示,其速度比依赖外部工具的方法快约30 倍。
- 准确性: 它实际上能更好地回答复杂的视频问题,因为它学会了在内部“感受”运动和时序,而不仅仅是用语言描述。
总结
TORM 是一种教导 AI 理解视频的新方法。它不再让 AI 写长故事或利用外部工具来弄清楚接下来会发生什么,而是教导 AI 运行一个无声的内部模拟。它通过在训练期间观看“思维视频”来学习这一点,但在实际测试中,它仅利用内部的“思维电影”来给出快速、准确的答案。
关键要点: 它将视频推理从“大声做功课”(缓慢且混乱)转变为“默默思考”(快速且高效)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。