← 最新论文
💻 computer science

InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding

本文提出了实例感知预训练框架 InstAP 及其配套的大规模双粒度数据集 InstVL,通过联合优化全局与细粒度实例级对比对齐,显著提升了视觉语言模型在时空理解中的实例推理能力,同时增强了其零-shot 全局理解性能。

原作者: Ashutosh Kumar, Rajat Saini, Jingjing Pan, Mustafa Erdogan, Mingfang Zhang, Betty Le Dem, Norimasa Kobori, Quan Kong

发布于 2026-04-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Ashutosh Kumar, Rajat Saini, Jingjing Pan, Mustafa Erdogan, Mingfang Zhang, Betty Le Dem, Norimasa Kobori, Quan Kong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 InstAP 的新系统,以及一个名为 InstVL 的超大数据集。简单来说,它的目标是教会人工智能(AI)像人类一样,不仅能“看懂”整个视频的大概内容,还能精准地“认出”视频里具体的某个人、某只狗或某个物体,并知道它们在什么时候、哪里出现了。

为了让你更容易理解,我们可以用几个生动的比喻来拆解这项技术:

1. 以前的 AI 像“模糊的广角镜头”

在 InstAP 出现之前,大多数视频理解 AI 就像是一个拿着广角镜头的摄影师

  • 它能看到什么? 它能告诉你:“这是一条街道,有人在走路,还有一辆车开过去了。”
  • 它的弱点是什么? 如果问你:“那个穿红衣服的小孩把球扔给了哪只狗?”这个 AI 可能会晕头转向。因为它只关注“整体画面”,分不清画面里具体的“张三”和“李四”。它把所有东西混在一起,就像把一锅汤搅匀了,你尝不出哪块是肉,哪块是菜。

2. InstAP 像“拿着放大镜的侦探”

InstAP 给 AI 装上了一副超级侦探的眼镜

  • 它是怎么做的? 它不再只盯着整个视频看,而是学会了把注意力集中在具体的个体上。
  • 核心能力: 当它看到字幕说“一只金毛犬在追球”时,它不仅能理解这句话,还能在视频里精准地框出那只金毛犬,并追踪它从第 1 秒跑到第 5 秒的轨迹。它能把文字里的每一个词(如“金毛”、“球”)和画面里的具体物体一一对应起来。

3. 关键创新:InstVL 数据集(一本“双重标注”的百科全书)

为了训练这个侦探,作者们制作了一个巨大的新教材,叫 InstVL

  • 以前的教材: 只有一行字,比如“一个孩子在公园玩”。(这是全局描述
  • InstVL 教材: 既有“一个孩子在公园玩”的大概描述,还有密密麻麻的脚注
    • 脚注 1:“那个穿蓝衬衫的孩子(ID:0)正在跑。”
    • 脚注 2:“那个红色的球(ID:1)在空中飞。”
    • 脚注 3:“那只棕色的狗(ID:2)在追球。”
  • 比喻: 就像以前学画画只让你临摹整幅画,现在 InstVL 要求你不仅要画整幅画,还要给画里的每一棵树、每一只鸟都贴上标签,并描述它们的具体动作。

4. 训练方法:如何把“侦探”练成?

InstAP 的训练过程分为两步走,就像培养一个实习生:

  • 第一步:自学成才(自我监督)
    让 AI 先看大量的视频,把视频里的某些部分“遮住”(比如把画面涂黑),然后让它根据剩下的部分猜被遮住的是什么。这就像玩“大家来找茬”或“看图说话”的游戏,强迫 AI 去理解画面中物体之间的空间和时间关系。

  • 第二步:师徒结对(实例对齐)
    这是最关键的一步。系统会同时给 AI 看视频和文字,并问它:“文字里说的‘红球’,在视频里对应的是哪一块?”

    • 以前的做法: 只要视频和文字大概意思对得上就行(比如视频里有球,文字里也有球,就算对)。
    • InstAP 的做法: 必须精准匹配。如果文字说“红球”,AI 必须把注意力死死锁定在那个红色的球上,而不能是旁边的蓝球,也不能是背景里的树。如果匹配错了,就要受到“惩罚”(损失函数)。

5. 结果:不仅更聪明,而且更全能

实验结果显示,InstAP 非常厉害:

  • 找东西更准: 在“根据文字找视频片段”的任务中,它比以前的最强模型强了很多。
  • 不仅没变笨,反而更聪明了: 这是一个反直觉的发现。通常人们认为,让 AI 关注细节(微观)可能会让它忽略整体(宏观)。但 InstAP 发现,当你教会 AI 精准识别每一个小物体时,它对整个场景的理解反而更深刻了。
    • 比喻: 就像你如果认识了一个城市里的每一条街道和每一栋楼(微观),你对这个城市的整体印象(宏观)反而比只看过一张地图的人更清晰、更准确。

总结

这篇论文的核心思想就是:不要只让 AI 看“面”,要让它看清“点”和“线”。

通过 InstAP 和 InstVL,我们让 AI 从只会看“热闹”(整体场景),进化到了能看懂“门道”(具体物体的时空关系)。这对于未来的自动驾驶(识别具体的行人和车辆)、视频搜索(搜索“那个穿红裙子的女孩”)、以及机器人辅助(“把那个红色的杯子拿给我”)都有着巨大的意义。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →