Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
本文提出了上下文视觉对比优化(In-Context Visual Contrastive Optimization, IC-VCO),这是一个通过视觉对比蒸馏和精确硬负样本生成进行增强的数学严谨框架,旨在通过解决现有视觉偏好方法的局限性,有效地缓解视觉语言模型中的多模态幻觉问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是对论文《通过细粒度视觉差异学习:通过上下文视觉对比优化缓解多模态幻觉》(IC-VCO)的解释,采用了通俗易懂的语言和创意类比。
问题所在:会“白日梦”的 AI
想象一位非常聪明的学生(AI)正在参加一场关于图片的测试。这个学生擅长阅读和表达,但有时在看照片时,他们会分心并开始“做白日梦”。他们可能会描述并不存在的事物,或者忽略图片中实际存在的内容,转而依赖于他们认为在这种情况下“通常会发生什么”。这就是所谓的多模态幻觉。
长期以来,老师们(研究人员)试图通过仅仅纠正学生的“语言”来解决这个问题。他们会说:“你说那里有一只猫,但图片里显示的是一只狗。再试一次。”但该论文指出,这样做是不够的,因为老师并没有强制要求学生去真正“仔细观察”图片,而只是纠正了文本。
旧方法:“替换并遗忘”法
以往修复此问题的方法涉及一种“视觉偏好”法。想象向学生展示两张不同的照片:
- 照片 A: 一张真实的狗的照片。
- 照片 B: 一张完全不同的猫的照片。
老师问:“哪张照片符合‘这里有一只狗’这句话?”
- 缺陷 1(数学问题): 旧方法试图将学生对照片 A 的回答与照片 B 进行比较。然而,由于两张照片差异巨大,背后的数学计算变得“混乱不堪”。这就像是为了决定哪种水果更好,而去比较苹果的价格和汽车的价格。这种比较是不公平且在数学上不严谨的。
- 缺陷 2(作弊码): 那张“错误”的照片(照片 B)往往过于明显地不同(例如不同的风格、光照或背景),导致学生可以作弊。学生并没有学会识别狗,而是学会了:“哦,如果图片看起来很奇怪或者背景不同,那就是错误答案。”他们通过走捷径而非学习细微特征来应对。
新解决方案:IC-VCO
作者提出了一种名为 IC-VCO(上下文视觉对比优化)的新框架。可以将其想象成一个更聪明、更严格的训练营。
1. “并排对比”(上下文视觉对比)
与其在不同的日子向学生展示两个独立的测试,IC-VCO 将两张照片同时放在同一张桌子上。
- 设置: 学生看到照片 A(狗)和照片 B(猫)并排摆放。
- 指令: 老师指着说:“对于这个特定问题,请只看第一张照片。”然后,对于下一个问题,他们说:“现在请只看第二张照片。”
- 为什么有效: 因为两张照片都在同一个“上下文”(同一张桌子)中,数学运算变得完美无缺。学生无法通过观察背景风格来作弊,因为背景是完全相同的;他们必须专注于老师所指的特定物体。这解决了“数学混乱”的问题。
2. “外科手术式编辑”(对比样本编辑)
为了防止学生走捷径,作者创造了一种制造“错误”照片的新方法。
- 旧方法: 他们会从头生成一张全新的图像。这就像是把整个教室都换掉了。学生很容易察觉到:“这不是原来的房间了。”
- 新方法(外科手术式编辑): 他们对原始照片进行极其微小、精确的修改。
- 示例: 如果照片里有一个红苹果,他们会通过“外科手术式”的操作将其变为绿苹果,但保持桌子、光照和背景完全不变。
- 结果: 学生无法通过观察背景来作弊。他们必须仔细观察才能发现苹果是绿色的而不是红色的。这迫使 AI 去学习细粒度的细节,而不是根据整体感觉来瞎猜。
3. “桥梁”(视觉对比蒸馏)
这里有一个问题:训练是在桌上有两张照片的情况下进行的,但在现实世界中,AI 通常一次只能看到一张照片。
- 问题: 如果你只针对“并排对比”进行训练,当学生独自面对一张照片时,他们可能会感到困惑。
- 解决方法(蒸馏): 作者增加了一个“桥梁”步骤。他们利用学生在“并排对比”测试中的表现作为引导,帮助他们提高在“单张照片”测试中的表现。这就像教练观察学生与搭档练习,然后给出建议,告诉他们如何将这些技能应用到独自练习中。
实验结果
作者在五个旨在捕捉 AI 幻觉的“考试”(基准测试)上测试了这种新方法。
- 结果: IC-VCO 方法的表现优于所有以往的方法。
- 秘诀所在: “外科手术式编辑”(对原图进行微小的、精确的改动)是关键。事实证明,当你给 AI 提供那些看起来几乎一模一样但有一个微小差异的“困难”案例时,AI 会学会更好地关注细节。
总结
简而言之,这篇论文指出,要阻止 AI 对图片进行凭空捏造,不要只是给它看不同的图片。要让它将两张图片并排展示,并强迫它进行对比。此外,制造“错误”图片的方法应该是微调原图中的一个微小细节,而不是替换整个场景。这迫使 AI 停止猜测,开始真正地观察。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。