LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
本文介绍了 LLaVA-OneVision-2,这是一种下一代视觉语言模型,它通过采用新颖的编解码器流分词策略、统一的 3D RoPE 坐标系以及大规模开放监督,在视频、空间和时序定位任务中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图向朋友描述一部 30 分钟的电影,但你只有足够的时间给他们展示 30 张图片。
大多数当前的 AI 模型(包括这个新模型之前的那些)都采取保守策略:它们均匀地挑选 30 张图片,即每分钟一张。如果第 10 分钟到第 11 分钟之间发生了令人兴奋的事情,AI 就会完全错过,因为它没有在那一确切秒数进行观察。这就像试图通过每分钟只看一次记分牌来理解一场快节奏的足球赛;你会错过进球。
LLaVA-OneVision-2 是一种新型“超级观察者”,它改变了规则。它不再将视频视为一系列静态快照,而是将其视为一种压缩数字文件(就像手机用来节省空间的那种格式)。
以下是它的工作原理,使用简单的类比说明:
1. “比特成本”指南针
当你压缩视频(例如将原始电影转换为 MP4)时,计算机必须更努力地描述视频中动作快速或变化剧烈的部分(例如车祸或舞者旋转)。它会在这些部分花费更多的“数字能量”(比特)。而在毫无变化的枯燥部分(例如静止的墙壁),它花费的能量极少。
LLaVA-OneVision-2 会读取这张“能量地图”。
- 旧方法:“我看 1 秒视频,然后跳过 1 秒,再看一次。”
- 新方法:“我看到视频文件此刻正在消耗大量能量,因为动作很激烈!我会将注意力集中在那里。我看到这里的能量很低;我会跳过这部分。”
它将“脑力”(token)精确集中在动作发生的地方,而不是均匀分布。
2. “运动侦探”
该模型还会寻找“残差”。想象你在观看一个人走路的视频。背景(房间)保持不变。模型意识到:“我不需要在每一帧中重新解释房间。”它只关注那些发生变化的部分(移动的人)。
它创建一个“视觉画布”,将最重要的运动部分高效地拼接成一幅拼贴画。这使得它能够观看 15 分钟的视频而不会不堪重负,因为它忽略了枯燥、重复的部分,并聚焦于“故事”。
3. “跳绳”测试
为了证明这行之有效,研究人员创建了一项名为JumpScore的新测试。想象一段有人跳绳的视频。他们上下跳跃数百次。对于普通 AI 来说,每一次跳跃看起来都完全一样。很难分辨用户具体问的是哪一次跳跃。
- 旧 AI 感到困惑并随机猜测,得分约为100 分中的 30 分。
- LLaVA-OneVision-2 捕捉到了绳子触地或人的脚部位置发生变化的微小、瞬间时刻。它获得了100 分中的 75 分。
它看到的不仅仅是“跳跃”,而是跳跃发生的确切时刻。
4. “空间导航员”
该模型在理解空间方面也变得非常出色。如果你问它:“指出咖啡杯和笔记本电脑之间的空白空间”,它能以高精度做到这一点。它甚至可以在视频中追踪移动物体(例如一只猫跑过房间),并持续锁定它们而不跟丢,即使猫被部分遮挡。
全局视角
研究人员不仅构建了一个更大的“大脑”,更构建了一种更聪明的观看方式。
- 以前:AI 就像一位徒步旅行者,每分钟拍一张照片,希望不会错过风景。
- 现在:AI 就像一位向导,确切知道风景在哪里,因此只在景色真正发生变化时才停下来拍照。
其结果是一个能够理解长视频、在快速动作中定位特定时刻,并在空间推理方面远超以往模型的模型,同时使用的计算资源与之前相同。他们已将所有代码、数据和模型本身公开,供任何人免费使用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。