← 最新论文
💬 NLP

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

该论文提出了“视频思维”新范式,利用视频生成模型(如 Sora-2)将视频帧作为统一的多模态推理媒介,并通过构建 VideoThinkBench 基准测试验证了其在视觉和文本任务中超越现有模型(如 GPT-5)的卓越推理能力,表明视频生成模型有望成为统一的多模态理解与生成模型。

原作者: Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

发布于 2026-04-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种非常有趣的新想法:让 AI 像人类一样“用视频来思考”

为了让你轻松理解,我们可以把 AI 的推理过程想象成**“解题”**。

1. 以前的 AI 是怎么“思考”的?

  • 用文字思考 (Thinking with Text): 就像你在做数学题时,在草稿纸上一步步写下公式和推导过程。现在的很多大模型(LLM)就是这样,通过写很长的文字来一步步推理。
  • 用图片思考 (Thinking with Images): 就像你在解题时,画个草图或者在脑海里想象一个画面。有些模型能生成图片来辅助思考,但这有个大问题:图片是静止的。它只能捕捉“一瞬间”,就像一张照片,无法展示“过程”或“变化”。

局限性: 如果你要解一道关于“光线反射”或者“迷宫怎么走”的题,光靠一张静止的图片,很难把“光线怎么弹跳”或者“路怎么绕”这种动态过程讲清楚。而且,文字和图像通常是分开的,不够统一。

2. 这篇论文提出了什么新招?

“用视频思考” (Thinking with Video)

作者们认为,视频才是完美的“思考载体”。

  • 比喻: 想象一下,以前 AI 解题是“写日记”(文字)或者“拍照片”(图片)。现在,AI 开始**“拍电影”**了。
  • 核心优势: 视频可以展示动态过程
    • 比如解几何题,AI 可以在视频里画线,展示光线是怎么反射的。
    • 比如解迷宫,AI 可以在视频里画出一条路径,一步步走给你看。
    • 比如做数学题,AI 可以在视频里像老师一样,在黑板上写字,一步步写出解题过程,最后大声说出答案。

这就好比 AI 不再只是给你看“最终答案”,而是给你看它**“思考的全过程”**。

3. 他们做了什么实验?

为了验证这个想法,他们做了一个叫 VideoThinkBench 的“考试”,专门考 AI 用视频解题的能力。

  • 考什么?
    • 视觉题: 比如让你画个三角形,或者找出光线反射的点。
    • 文字题: 比如数学应用题、常识题。
  • 谁参加了考试?
    • 主角是 Sora-2(一个强大的视频生成模型)。
    • 对手是现在的顶级 AI(如 GPT-5, Claude, Gemini 等)。

4. 考试结果怎么样?

结果非常令人惊讶:

  • 在“画图解题”上,Sora-2 是个天才:
    • 在需要画线、找交点、看光线反射的题目上,Sora-2 的表现甚至超过了 GPT-5
    • 比喻: 就像让一个只会写字的教授(传统 AI)和一个会画动态演示图的画家(Sora-2)去解几何题,画家直接画出了光路,一眼就能看出答案,而教授还在纸上比划。
  • 在“文字解题”上,Sora-2 也意外地强:
    • 虽然 Sora-2 主要是个视频模型,但它也能在视频里手写解题步骤,并口述答案。
    • 在数学题(如 GSM8K)上,它的准确率高达 92%,和顶级 AI 不相上下。
    • 关键点: 研究发现,Sora-2 之所以能解数学题,很大程度上是因为它内部有一个“翻译官”(提示词重写器),先把复杂的数学题“翻译”成了简单的、分步骤的视频指令,然后视频生成部分再把这些步骤画出来。

5. 发现了什么有趣的规律?

  • 多试几次更准 (Self-Consistency): 就像人做题一样,如果让 Sora-2 生成 5 个不同的解题视频,然后选大家意见最统一的那个答案,准确率会大幅提升(从 68% 涨到 90%)。这说明“视频生成”也可以像“多次推理”一样,通过自我修正来提高准确性。
  • 少样本学习 (Few-Shot Learning): 给 Sora-2 看几个例子,它就能学会新规则。虽然它还不能像人类专家那样完美,但已经能猜出大概的逻辑了。

6. 总结:这意味着什么?

这篇论文告诉我们,视频生成模型(如 Sora)可能不仅仅是用来“拍电影”的,它们未来可能成为最强大的“全能思考者”

  • 统一了理解与生成: 以前,AI 理解世界(看图)和生成内容(写文章/画图)是分开的。现在,视频模型可以用同一种方式(生成视频)来理解问题(看到题目)并解决问题(画出过程)。
  • 未来的 AI 老师: 想象一下,未来的 AI 老师不再只是给你发文字答案,而是直接给你生成一个动态的、手把手的教学视频,演示它是怎么一步步思考、怎么画图、怎么计算的。

一句话总结:
这篇论文发现,让 AI 通过**“拍视频”**来解题,比单纯“写文字”或“画图片”更聪明、更直观,甚至可能成为未来 AI 统一理解和思考世界的新方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →