← 最新论文
💻 computer science

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

本文介绍了 LLaVA-OneVision-2,这是一种下一代视觉语言模型,它通过采用新颖的编解码器流分词策略、统一的 3D RoPE 坐标系以及大规模开放监督,在视频、空间和时序定位任务中实现了最先进的性能。

原作者: Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhan
发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhang, Chunsheng Wu, Chunjiang Ge, Zimin Ran, Dehua Song, Chunyuan Li, Shikun Feng, Ming Hu, Zhangquan Chen, Junbo Niu, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向朋友描述一部 30 分钟的电影,但你只有足够的时间给他们展示 30 张图片。

大多数当前的 AI 模型(包括这个新模型之前的那些)都采取保守策略:它们均匀地挑选 30 张图片,即每分钟一张。如果第 10 分钟到第 11 分钟之间发生了令人兴奋的事情,AI 就会完全错过,因为它没有在那一确切秒数进行观察。这就像试图通过每分钟只看一次记分牌来理解一场快节奏的足球赛;你会错过进球。

LLaVA-OneVision-2 是一种新型“超级观察者”,它改变了规则。它不再将视频视为一系列静态快照,而是将其视为一种压缩数字文件(就像手机用来节省空间的那种格式)。

以下是它的工作原理,使用简单的类比说明:

1. “比特成本”指南针

当你压缩视频(例如将原始电影转换为 MP4)时,计算机必须更努力地描述视频中动作快速或变化剧烈的部分(例如车祸或舞者旋转)。它会在这些部分花费更多的“数字能量”(比特)。而在毫无变化的枯燥部分(例如静止的墙壁),它花费的能量极少。

LLaVA-OneVision-2 会读取这张“能量地图”。

  • 旧方法:“我看 1 秒视频,然后跳过 1 秒,再看一次。”
  • 新方法:“我看到视频文件此刻正在消耗大量能量,因为动作很激烈!我会将注意力集中在那里。我看到这里的能量很低;我会跳过这部分。”

它将“脑力”(token)精确集中在动作发生的地方,而不是均匀分布。

2. “运动侦探”

该模型还会寻找“残差”。想象你在观看一个人走路的视频。背景(房间)保持不变。模型意识到:“我不需要在每一帧中重新解释房间。”它只关注那些发生变化的部分(移动的人)。

它创建一个“视觉画布”,将最重要的运动部分高效地拼接成一幅拼贴画。这使得它能够观看 15 分钟的视频而不会不堪重负,因为它忽略了枯燥、重复的部分,并聚焦于“故事”。

3. “跳绳”测试

为了证明这行之有效,研究人员创建了一项名为JumpScore的新测试。想象一段有人跳绳的视频。他们上下跳跃数百次。对于普通 AI 来说,每一次跳跃看起来都完全一样。很难分辨用户具体问的是哪一次跳跃。

  • 旧 AI 感到困惑并随机猜测,得分约为100 分中的 30 分
  • LLaVA-OneVision-2 捕捉到了绳子触地或人的脚部位置发生变化的微小、瞬间时刻。它获得了100 分中的 75 分

它看到的不仅仅是“跳跃”,而是跳跃发生的确切时刻

4. “空间导航员”

该模型在理解空间方面也变得非常出色。如果你问它:“指出咖啡杯和笔记本电脑之间的空白空间”,它能以高精度做到这一点。它甚至可以在视频中追踪移动物体(例如一只猫跑过房间),并持续锁定它们而不跟丢,即使猫被部分遮挡。

全局视角

研究人员不仅构建了一个更大的“大脑”,更构建了一种更聪明的观看方式。

  • 以前:AI 就像一位徒步旅行者,每分钟拍一张照片,希望不会错过风景。
  • 现在:AI 就像一位向导,确切知道风景在哪里,因此只在景色真正发生变化时才停下来拍照。

其结果是一个能够理解长视频、在快速动作中定位特定时刻,并在空间推理方面远超以往模型的模型,同时使用的计算资源与之前相同。他们已将所有代码、数据和模型本身公开,供任何人免费使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →