VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation
本文介绍了视觉归因蒸馏(Visual Attribution Distillation, VAD),这是一种反事实算法,旨在从多模态在策略蒸馏中混合的教师信号中分离出视觉可归因的修正,从而重构出更有效、与证据对齐的训练目标,其在细粒度视觉基准测试上的表现优于现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何当侦探。你有一位超级聪明的老师,能完美地观察犯罪现场,还有一个试图学习如何破案的学生机器人。老师观察线索并说道:“嫌疑人戴着一顶红色的帽子!”但有时,老师的大脑会有些嘈杂。也许老师同时还在想:“嫌疑人戴着一顶红色的帽子,而且我也很喜欢红色的帽子,今天天气真不错。”如果你只是照抄老师的原话,学生可能会学会说“红色的帽子”,但也可能不小心开始谈论天气或老师喜欢的颜色。这就是“来源混合”(source-mixed)信息的问题:学生得到正确答案的同时,也混入了额外的、令人困惑的噪音。
在人工智能领域,特别是在多模态大语言模型(能够看图并阅读文本的 AI)中,研究人员正试图教这些模型更加关注视觉细节。一种常用的方法叫做“在策略蒸馏”(On-Policy Distillation)。把这想象成学生机器人在尝试解一个谜题,每当它卡住或做出猜测时,老师都会观察同一个谜题(但视角更清晰),并纠正学生的下一步行动。目标是通过展示正确的路径来让学生变得更聪明。然而,如果老师的纠正是一个“观察这个特定细节”与“仅仅是我的个人观点”的混乱混合体,学生就会感到困惑。这就是为什么研究人员对此非常关注:他们想确切知道老师的建议中,哪一部分是源自视觉证据(图片),哪一部分仅仅是老师自己的习惯或语言技巧。
于是,一种名为 VAD(视觉归因蒸馏,Visual Attribution Distillation)的新方法出现了,它充当了老师建议的“真相过滤器”。VAD 不再盲目地复制老师的整个纠正,而是提出了一个聪明的“如果……会怎样”的问题。它获取学生的当前猜测,并询问老师两件事:“如果我给你看完整且清晰的图片,你会说什么?”以及“如果我把我们正在讨论的特定线索模糊处理掉,你会说什么?”通过比较这两个答案,VAD 可以精确计算出老师的建议中有多少变化是因为那个视觉线索而产生的。
想象一下,老师是一位正在纠正学生汤品配方的厨师。老师说:“多加点盐,而且这碗汤应该盛在蓝色的碗里。”VAD 就像一个神奇的测试,它会问:“如果我们藏起蓝色碗,老师还会说‘加盐’吗?”如果即使没有了蓝色碗,老师仍然说“加盐”,那么 VAD 就意识到“蓝色碗”的评论只是多余的闲聊,而不是视觉上的必要条件。VAD 随后会剔除掉“蓝色碗”的部分,只保留“加盐”的部分来教导学生。它重构了一个更干净、更锐利的教训,专注于图片真正证明的内容。
研究人员在两种不同规模的 AI 模型(一个拥有 40 亿参数,另一个拥有 90 亿参数)上测试了这个想法,涵盖了六种不同的视觉谜题,范围从在高分辨率照片中发现微小细节到识别复杂现实场景中的物体。他们发现 VAD 比以往的方法表现得好得多。对于 40 亿参数的模型,与次优方法相比,它将平均准确率提高了约 2.4 个点;对于 90 亿参数的模型,则提高了 2.8 个点。事实上,使用 VAD 训练的较小的 40 亿参数模型,其表现甚至优于一些规模更大、更昂贵的闭源大型模型。
论文指出,通过将“视觉证据”与“老师的噪音”分离,AI 学会了更多地信任图片,而较少地依赖老师的习惯。当学生犯错时(例如将一种图案误判为“格子纹”,而实际上是“条纹”),VAD 在利用视觉线索将学生从错误答案推向正确答案方面表现得尤为出色。这项研究表明,这种“反事实”(counterfactual)方法——即对比有证据和无证据时的情形——比仅仅复制老师完整的、混乱的纠正,能创造出更好的学习目标。虽然该方法并非完美的魔杖(它仍然依赖于单一的一对视图,且无法完美分离每一种类型的噪音),但结果有力地表明,这种过滤并重建老师建议的方法,是让 AI 视觉变得更敏锐、更可靠的一个强大的新工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。