← 最新论文
🤖 AI

MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention

该论文介绍了 MOSS-Video-Preview,这是一个实时视频理解框架,它采用双通道交叉注意力架构将感知与生成解耦,从而实现持续感知、答案修正和及时的静默,同时在性能下降极小的情况下,实现了相对于离线基准模型的显著加速。

原作者: Pengyu Wang, Chenkun Tan, Shaojun Zhou, Wei Huang, Qirui Zhou, Zhan Huang, Zhen Ye, Jijun Cheng, Xiaomeng Qian, Yanxin Chen, Xingyang He, Huazheng Zeng, Chenghao Wang, Pengfei Wang, Hongkai Wang, Shan
发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Pengyu Wang, Chenkun Tan, Shaojun Zhou, Wei Huang, Qirui Zhou, Zhan Huang, Zhen Ye, Jijun Cheng, Xiaomeng Qian, Yanxin Chen, Xingyang He, Huazheng Zeng, Chenghao Wang, Pengfei Wang, Hongkai Wang, Shanqing Gao, Yixian Tian, Chenghao Liu, Xinghao Wang, Botian Jiang, Xipeng Qiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在电视上观看一场实况体育比赛。

旧的方式(离线模式): 你等到比赛完全结束,然后转向你的朋友说:“好了,刚才发生了什么。” 在你说话的过程中,你错过了比赛的精彩瞬间。
目前的“流式传输”方式: 你在比赛进行时说话,但只要你开口说话,你就停止了观看屏幕。如果你在说话的中途进球了,在你说完那句话之前,你并不知道发生了什么。你必须停下来,然后重新开始以纠正自己的说法。
新的方式(MOSS-Video-Preview): 你在说话的同时也在观看屏幕。如果有人在你说“这支队伍表现得很好”时进球了,你会立即中断自己,说“等等,他们进球了!”,并更新你的描述。如果没什么有趣的事情发生,你就会保持沉默,只是继续观看。

这篇论文介绍了一种名为 MOSS-Video-Preview 的新 AI 模型,它的设计目的正是如此:实现边看边说,且两者互不干扰。

以下是他们是如何实现的,使用了简单的类比:

1. 问题所在:“交通堵塞”

如今大多数 AI 模型就像是一条单车道公路。为了理解一段视频,模型必须先读取每一帧,然后停止读取去写出答案,接着停止写作再去读取更多帧。这造成了交通堵塞。模型无法在“说话”的同时“看”到新事物。

2. 解决方案:“双车道高速公路”

作者构建了一个双通道架构。想象一条拥有两条独立车道的公路:

  • 车道 A(眼睛): 这条车道专门用于观看视频。它不断地接收新的帧(车辆)。
  • 车道 B(嘴巴): 这条车道专门用于说话(生成文本)。

在旧模型中,“眼睛”和“嘴巴”共享同一条车道,所以它们必须轮流使用。而在这个新模型中,“眼睛”从侧面将信息传递给“嘴巴”,就像维修团队在赛车行驶过程中为赛车手更换新轮胎一样。车(AI)无需停止行驶即可获取新信息。

3. 核心秘诀:“交叉注意力机制 (Cross-Attention)”

为了让这个双车道系统协同工作,他们使用了一种称为交叉注意力机制的技术。

  • 旧方式: 想象你在读一本书,而有人在你耳边大声朗读下一页的内容。你必须停止阅读去听,然后停止听去阅读。
  • 新方式: 想象你在读一本书,而你的朋友站在你旁边。当你需要知道下一页内容时,你只需瞥一眼朋友手中的书。你不需要停止阅读自己的书来完成这个动作。朋友(视频)始终在那里,随时可以被瞥一眼,而不会中断你的阅读流程。

4. 教会 AI 如何“闭嘴”

一个主要的挑战是,如果 AI 观看一段视频,它可能会觉得有义务描述它看到的一切,即使什么也没发生。

  • 解决方法: 团队创建了一种特殊的训练方法。他们教会了 AI 一个新规则:“如果没什么有趣的事情发生,就保持沉默。”
  • 他们使用了一个特殊的标记(token)叫做 <|silence|>。当 AI 看到静态场景时,它会学习说出这个标记。这就像一名保安,只有在看到小偷时才会说话;否则,他只是站在那里观察。

5. 结果:更快、更聪明

作者测试了这个模型(他们称之为“预览版”或“概念验证”),并发现:

  • 速度: 由于“眼睛”和“嘴巴”不会互相阻塞,该模型运行速度更快。在高性能计算机上,它开始说话的速度比领先的现有模型快 5 倍,持续说话的速度快了 2.7 倍,尽管他们的模型实际上规模更大。
  • 准确性: 它非常擅长理解事情发生的时间地点(空间和时间推理),这对于实时交互至关重要。
  • 权衡: 与当今最大、最著名的模型相比,它在处理通用常识或识别图像中的文字方面稍逊一筹。作者承认,这是因为他们专注于新架构实时行为,而不是仅仅通过扩大模型规模或喂入更多数据来提升性能。

总结

MOSS-Video-Preview 是一个旨在充当实时观察者的 AI 原型。它不会等待视频结束,也不会为了说话而停止观看。它观察、说话,并在情况发生变化时立即自我纠正,并在无话可说时保持沉默。

该论文声称,这证明了只要拥有正确的架构,实时视频理解是可能的,即便该模型目前还不是世界上最聪明的模型。这是一个“概念验证”,为未来能够真正与现实世界同步互动的 AI 助手打开了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →