← 最新论文
💻 computer science

Visual-Advantage On-Policy Distillation for Vision-Language Models

本文介绍了视觉优势在线策略蒸馏(VA-OPD),这是一种针对视觉 - 语言模型的新型训练方法,它利用令牌级视觉优势信号在蒸馏过程中区分并优先处理对视觉至关重要的令牌,从而在不同规模的教师模型下显著提升数学推理和视觉理解基准测试的性能。

原作者: Ruiqi Liu, Xiaolei Lv, Gengsheng Li, Ximo Zhu, Zhiheng Wang, Zhengbo Zhang, Junkai Chen, Zhiheng Li, Bo Li, Jun Gao, Shu Wu

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruiqi Liu, Xiaolei Lv, Gengsheng Li, Ximo Zhu, Zhiheng Wang, Zhengbo Zhang, Junkai Chen, Zhiheng Li, Bo Li, Jun Gao, Shu Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《视觉优势策略蒸馏用于视觉语言模型》的通俗解释,并辅以日常类比。

核心问题:“照猫画虎”的学生

想象你有一位才华横溢的老师(一个大型人工智能模型),它非常擅长利用图表解决数学问题。你希望训练一个更小、更便宜的学生 AI 来做到同样的事情。

通常,你会让学生尝试解决问题,如果它答对了,你就会说:“干得好!现在,看看老师是怎么解决的,并模仿它的步骤。”这被称为蒸馏

其中的陷阱:
论文发现了这一过程中的一个隐藏缺陷。在典型的带图数学题中,AI 写出的大部分词汇只是“填充”或“脚手架”(例如说“首先,让我们看看图表”或“角度之和是……")。只有极少数词汇真正基于图片(例如读取一个具体数字:"130 度”)。

当使用标准的训练方法时,它会认为学生写出的每一个字都同样重要。这就像老师批改学生的作文时,对单词"The"(定冠词)的关注程度与对关键数字"130"的关注程度完全一样。

结果: 学生学会了完美地模仿文字,但它并没有真正学会看图。它变成了一个“照猫画虎”的模仿者,复制老师的文本却忽略了视觉细节。如果你给它看一张略有不同的图片,它可能会失败,因为它从未学会依赖图像。

解决方案:引入“视觉优势”(VA)

研究人员发明了一种新方法,用来衡量老师实际上在多大程度上需要图片才能写出每一个特定的词。他们称之为视觉优势(Visual Advantage, VA)

把它想象成一个**“假如”测试**:

  1. 老师看着完整、高质量的图片写出一句话。
  2. 然后,老师看着同一张图片的模糊、像素化版本(其中小细节已消失),并尝试再次写出同样的句子。
  3. 差异所在: 如果老师即使面对模糊图片也能轻松写出单词"The",那么这个词的视觉优势很低(它只是语言)。但如果老师因为模糊图片隐藏了细节而在数字"130"上卡住或猜错,那么这个词的视觉优势很高

论文发现,高视觉优势的词汇非常罕见(仅占所有词汇的约 10%),但它们是唯一能真正教会学生去观察图像的部分。

VA-OPD 的工作原理:“聚光灯”方法

这种新方法称为VA-OPD,它改变了训练规则,让学生专注于那些罕见但重要的词汇。它通过两种巧妙的方式实现这一点:

1. “最佳尝试”奖励(生成层面)

有时,学生会针对同一个问题生成几个不同的答案。

  • 旧方法: 平等对待所有尝试。
  • VA-OPD 方法: 它会检查哪一个尝试最依赖图片(即具有最高的“视觉优势”)。它会给那个特定的尝试一个加权奖励,告诉学生:“这是你真正观察图像的那一次;请格外注意从这一次中学习。”

2. “贵宾区”(词元层面)

在单个答案内部,该方法将词汇分为两组:

  • 贵宾(高 VA): 依赖图片的词汇(例如从图表中读取的数字)。
  • 普通成员(低 VA): 填充词汇(例如“因此”、“是”、“和”)。

VA-OPD 不再对所有词汇平均分配学习信号(这会稀释贵宾词汇的重要性),而是单独计算贵宾词汇的学习分数。它确保学生获得强烈的“推动力”去学习视觉部分,而不会被成千上万个无聊的填充词汇淹没。

结果:更聪明,而不仅仅是更快

研究人员在数学和视觉推理任务上测试了这种方法。结果如下:

  • 更高的准确率: 使用 VA-OPD 训练的学生比使用旧方法训练的学生得分更高。
  • 真正的视觉学习: 最重要的发现是,学生们不仅仅是死记硬背答案。当研究人员进行检查时,VA-OPD 学生实际上开始更多地依赖图像来解决问题。随着它们变得更聪明,它们的“视觉优势”分数也随之上升。
  • 可扩展性: 当使用更大、更聪明的老师或更多的训练数据时,该方法效果更好。它不会感到困惑,只是变得更擅长识别重要的视觉线索。

总结类比

想象你在教一个孩子识别篮子里的水果。

  • 标准训练: 你给他们看一张苹果的图片,说:“这是一种红色的、圆形的、长在树上的水果。”孩子记住了句子“红色的、圆形的、长在树上”,但并没有真正学会识别苹果的形状颜色
  • VA-OPD 训练: 你意识到孩子只需要关注“红色”和“圆形”这两个词,因为那是证明它是苹果的部分。你忽略“长在树上”这个词(因为梨也长在树上),并且每当孩子正确识别出“红色”和“圆形”部分时,就给他们特别的奖励。
  • 结果: 孩子学会了真正看见苹果,而不仅仅是复述描述。

简而言之: 这篇论文修复了 AI 训练中的一个盲点,教会较小的模型停止照搬文本,转而真正去观察图片。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →