Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation
本文提出了一种名为“隐而见”的新型视觉语言模型蒸馏框架,该框架通过采用显著性推理前缀掩蔽和自步调度来迫使学生在思考过程中依赖视觉证据,从而增强紧凑学生模型的多模态推理能力,进而超越现有的蒸馏和自蒸馏方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教导一名年轻学徒(学生)通过观察一位大师(教师)如何解开一个复杂的谜题。
在人工智能的世界里,这些“谜题”是视觉问题,比如观察一张三角形的图片并计算其角度。最近,人工智能模型通过采用“大声思考”的方法,在这类问题上表现得非常出色:它们不仅给出答案,还会先写出一长串逐步推理的过程。
然而,这里存在一个问题。当学徒试图模仿大师那冗长的“大声思考”笔记时,他们变得懒惰。他们开始阅读大师之前的句子来猜测下一个词,完全忽略了眼前的实际图片。这就像一名参加考试的学生在读老师放在桌上的笔记,而不是查看考试手册中的图表。他们虽然答对了答案,但实际上并没有学会如何看见解决方案。
本文介绍了一种巧妙的技巧,称为掩蔽知识蒸馏(Masking-KD,意为“藏起来以便看见”),以解决这一问题。
类比:“遮盖笔记”策略
想象大师正在白板上写下他们的解决方案,而学徒正试图逐行抄写。
- 旧方法(朴素蒸馏): 学徒可以看到大师之前的所有工作。如果大师写下“三角形有一个直角”,学徒只需照抄。他们不需要看三角形图像,因为文字已经告诉他们了一切。他们变得“依赖文本”,忘记了查看视觉证据。
- 新方法(掩蔽知识蒸馏): 当学徒试图抄写下一行时,老师用一张纸遮住自己笔记中最重要的部分。
- 学徒仍然可以看到图片。
- 但关键的文本线索(如“直角”或“边长”)被隐藏了。
- 为了弄清楚接下来该写什么,学徒被迫再次查看图片,并利用视觉线索来填补缺失的文本。
人工智能如何实现它(“秘密配方”)
本文描述了人工智能决定隐藏什么以及隐藏多少的两种聪明方式:
1. 隐藏“明星”线索(基于 Token 的显著性掩蔽)
教师笔记中的并非所有词语都同等重要。有些词语是承载最多含义的“明星”(如"90 度”或“斜边”)。
- 人工智能分析教师的笔记,识别出这些“明星”词语。
- 它仅针对学徒隐藏这些特定的词语。
- 结果: 学徒无法仅仅复制那些简单、显而易见的文本。他们必须查看图片,以理解那些被隐藏词语的含义。
2. 调整难度(自步掩蔽)
推理过程中的某些步骤很容易猜测,而另一些则很难。
- 如果学徒在猜测下一个词方面表现得很出色(意味着教师的笔记太容易抄写),人工智能会隐藏更多文本以增加难度。
- 如果学徒感到吃力(该步骤非常困难),人工智能会隐藏较少的文本,以免他们完全迷失。
- 结果: 训练得到了完美的调整。它在学徒 tempted 依赖文本捷径时,迫使他们去查看图片。
结果
本文声称,通过这种“藏起来以便看见”的方法:
- 学徒学会查看图片: 人工智能不再仅仅复制文本,而是开始关注问题的视觉部分(三角形、图表、示意图)。
- 性能提升: 这些经过训练的小型人工智能模型在解决视觉推理问题方面,实际上比同规模的其他模型表现得更好。
- 不再“视觉遗忘”: 冗长的推理链通常会导致人工智能忘记图像。这种方法迫使人工智能在整个思考过程中将图像保持在“脑海”中。
总结
本文认为,要教会人工智能进行“视觉思考”,不能仅仅让它复制教师的笔记。你必须偶尔隐藏笔记,迫使人工智能查看图片以弄清楚接下来该做什么。这是一种简单而有力的方法,可确保人工智能学会看见答案,而不仅仅是阅读它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。