MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention
该论文介绍了 MOSS-Video-Preview,这是一个实时视频理解框架,它采用双通道交叉注意力架构将感知与生成解耦,从而实现持续感知、答案修正和及时的静默,同时在性能下降极小的情况下,实现了相对于离线基准模型的显著加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在电视上观看一场实况体育比赛。
旧的方式(离线模式): 你等到比赛完全结束,然后转向你的朋友说:“好了,刚才发生了什么。” 在你说话的过程中,你错过了比赛的精彩瞬间。
目前的“流式传输”方式: 你在比赛进行时说话,但只要你开口说话,你就停止了观看屏幕。如果你在说话的中途进球了,在你说完那句话之前,你并不知道发生了什么。你必须停下来,然后重新开始以纠正自己的说法。
新的方式(MOSS-Video-Preview): 你在说话的同时也在观看屏幕。如果有人在你说“这支队伍表现得很好”时进球了,你会立即中断自己,说“等等,他们进球了!”,并更新你的描述。如果没什么有趣的事情发生,你就会保持沉默,只是继续观看。
这篇论文介绍了一种名为 MOSS-Video-Preview 的新 AI 模型,它的设计目的正是如此:实现边看边说,且两者互不干扰。
以下是他们是如何实现的,使用了简单的类比:
1. 问题所在:“交通堵塞”
如今大多数 AI 模型就像是一条单车道公路。为了理解一段视频,模型必须先读取每一帧,然后停止读取去写出答案,接着停止写作再去读取更多帧。这造成了交通堵塞。模型无法在“说话”的同时“看”到新事物。
2. 解决方案:“双车道高速公路”
作者构建了一个双通道架构。想象一条拥有两条独立车道的公路:
- 车道 A(眼睛): 这条车道专门用于观看视频。它不断地接收新的帧(车辆)。
- 车道 B(嘴巴): 这条车道专门用于说话(生成文本)。
在旧模型中,“眼睛”和“嘴巴”共享同一条车道,所以它们必须轮流使用。而在这个新模型中,“眼睛”从侧面将信息传递给“嘴巴”,就像维修团队在赛车行驶过程中为赛车手更换新轮胎一样。车(AI)无需停止行驶即可获取新信息。
3. 核心秘诀:“交叉注意力机制 (Cross-Attention)”
为了让这个双车道系统协同工作,他们使用了一种称为交叉注意力机制的技术。
- 旧方式: 想象你在读一本书,而有人在你耳边大声朗读下一页的内容。你必须停止阅读去听,然后停止听去阅读。
- 新方式: 想象你在读一本书,而你的朋友站在你旁边。当你需要知道下一页内容时,你只需瞥一眼朋友手中的书。你不需要停止阅读自己的书来完成这个动作。朋友(视频)始终在那里,随时可以被瞥一眼,而不会中断你的阅读流程。
4. 教会 AI 如何“闭嘴”
一个主要的挑战是,如果 AI 观看一段视频,它可能会觉得有义务描述它看到的一切,即使什么也没发生。
- 解决方法: 团队创建了一种特殊的训练方法。他们教会了 AI 一个新规则:“如果没什么有趣的事情发生,就保持沉默。”
- 他们使用了一个特殊的标记(token)叫做
<|silence|>。当 AI 看到静态场景时,它会学习说出这个标记。这就像一名保安,只有在看到小偷时才会说话;否则,他只是站在那里观察。
5. 结果:更快、更聪明
作者测试了这个模型(他们称之为“预览版”或“概念验证”),并发现:
- 速度: 由于“眼睛”和“嘴巴”不会互相阻塞,该模型运行速度更快。在高性能计算机上,它开始说话的速度比领先的现有模型快 5 倍,持续说话的速度快了 2.7 倍,尽管他们的模型实际上规模更大。
- 准确性: 它非常擅长理解事情发生的时间和地点(空间和时间推理),这对于实时交互至关重要。
- 权衡: 与当今最大、最著名的模型相比,它在处理通用常识或识别图像中的文字方面稍逊一筹。作者承认,这是因为他们专注于新架构和实时行为,而不是仅仅通过扩大模型规模或喂入更多数据来提升性能。
总结
MOSS-Video-Preview 是一个旨在充当实时观察者的 AI 原型。它不会等待视频结束,也不会为了说话而停止观看。它观察、说话,并在情况发生变化时立即自我纠正,并在无话可说时保持沉默。
该论文声称,这证明了只要拥有正确的架构,实时视频理解是可能的,即便该模型目前还不是世界上最聪明的模型。这是一个“概念验证”,为未来能够真正与现实世界同步互动的 AI 助手打开了大门。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。