← 最新论文
💻 computer science

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

本文提出了 TIPSv2,一种通过引入 patch 级蒸馏、改进的 iBOT++ 预训练目标以及多粒度合成字幕采样策略,显著增强基础视觉 - 语言模型中密集图像块与文本对齐能力的新型图像 - 文本编码器模型家族。

原作者: Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washin
发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, André Araujo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 TIPSv2 的新 AI 模型。为了让你轻松理解,我们可以把训练 AI 识别图片的过程想象成教一个学生(AI)看世界并描述它

以前的 AI 模型就像是一个**“只懂大方向,不懂细节”**的导游。

  • 如果你问它:“这张图里有什么?”它能回答:“哦,这是一只熊猫。”(这是全局理解,做得很好)。
  • 但如果你指着熊猫的耳朵问:“这是哪?”或者指着熊猫的脚问:“这是哪?”它可能会指错,或者把熊猫的脚和旁边的竹子搞混。(这是局部/细节理解,以前做得不好)。

TIPSv2 就是为了解决这个“指哪打哪”的难题而诞生的。它通过三个“独门秘籍”,让 AI 不仅知道“这是什么”,还能精准地知道“哪里是什么”。


秘籍一:让“优等生”给“差生”补课,但要把课讲透(Patch-Text Alignment & Distillation)

以前的做法:
在训练时,老师(大模型)只负责教学生(小模型)看被遮住的部分(比如把图片遮住一半,让学生猜被遮住的像素是什么)。这就像老师只考学生“填空题”,学生只要把空填对就行,至于没遮住的部分,学生可能根本没认真看,导致对细节的掌握很模糊。

TIPSv2 的发现:
研究人员惊讶地发现,如果让大模型(老师)去教小模型,并且不再遮住图片,让老师盯着图片的每一个像素点(包括没被遮住的)都跟文字对应起来,小模型反而学得更好,甚至超过了老师自己!

比喻:
想象你在学画画。

  • 旧方法:老师只让你练习画被黑布盖住的那部分,剩下的你随便画。结果你画出来的画,被盖住的地方很准,但露出来的地方乱七八糟。
  • TIPSv2 方法:老师让你看着整张画,把画里的每一根线条、每一块颜色都跟“这是熊猫的耳朵”、“这是熊猫的脚”这些文字对应起来。结果你不仅画得准,连细节都栩栩如生。

秘籍二:升级“填空题”规则(iBOT++)

基于上面的发现,研究人员改进了训练规则,提出了一个叫 iBOT++ 的新方法。

  • 旧规则 (iBOT):只惩罚学生做错的“填空题”(被遮住的像素)。如果学生把没遮住的像素画错了,老师不管,只要填空题做对就行。
  • 新规则 (iBOT++):老师要求所有像素(不管有没有被遮住)都必须和文字对应上。

比喻:
这就好比考试。

  • 旧规则:只要把试卷上挖空的词填对,就能得满分。
  • 新规则:试卷上每一个字(包括你没挖空的地方)都要写对,才能得满分。
    这迫使 AI 必须时刻关注图片的每一个细节,而不是只盯着被遮住的区域。结果就是,AI 对图片细节的理解能力(比如分割图像)突飞猛进。

秘籍三:换个更聪明的“复习策略”和“教材”(Head-only EMA & Multi-Granularity Captions)

除了改规则,TIPSv2 还在“怎么复习”和“用什么教材”上做了优化:

  1. 只复习“重点笔记” (Head-only EMA)

    • 旧做法:老师(大模型)每次都要把整个大脑(所有参数)都备份一份,慢慢更新,非常占内存,像背着一座大山走路。
    • 新做法:既然有文字监督(AI 知道自己在描述什么),就不需要备份整个大脑了,只需要更新“输出笔记的笔尖”(投影层)。
    • 比喻:以前是每次复习都要把整本百科全书抄一遍;现在只需要更新最后写结论的那支笔。这样既省内存,速度又快,还能训练出同样聪明的 AI。
  2. 使用“多版本教材” (Multi-Granularity Captions)

    • 旧做法:教材里的描述太单一。比如一张熊猫图,教材只写“熊猫”。
    • 新做法:引入了不同详细程度的描述。
      • 简单版:“熊猫”。
      • 详细版:“一只熊猫正躺在树枝上睡觉,腿垂下来。”
      • 甚至更详细的:“这是 2004 年拍的照片,熊猫在动物园里。”
    • 比喻:以前老师只教学生认“苹果”;现在老师既教“苹果”,也教“红富士苹果”、“挂在树上的苹果”、“被咬了一口的苹果”。这让 AI 能理解不同层面的细节,变得更 robust(鲁棒/强壮)。

总结:TIPSv2 厉害在哪里?

如果把以前的 AI 模型比作一个**“大概知道这是什么的大概先生”,那么 TIPSv2 就是一个“既能一眼看出整体,又能拿着放大镜看清每一根毛发细节的专家”**。

  • 效果:在 9 项任务、20 个数据集的测试中,TIPSv2 的表现要么是最好的,要么和最好的差不多。特别是在**“零样本分割”**(即没见过的图片,直接让 AI 把物体抠出来)这项任务上,它把以前的记录甩开了好几条街。
  • 意义:这意味着未来的 AI 不仅能跟你聊天,还能真正“看懂”图片里的每一个物体,甚至帮你把图片里的物体精准地抠出来、数出来、定位出来。

一句话总结:
TIPSv2 通过让 AI 在训练时**“盯着每一个像素点跟文字对号入座”,并配合“更省钱的复习法”“更丰富的教材”**,成功让 AI 从“大概知道”进化到了“精准理解”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →