Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization
本文指出标准的直接偏好优化(DPO)对上下文信息的利用不足,导致多模态大语言模型中出现物体幻觉问题,并据此提出了上下文校准 DPO(C²-DPO),该方法通过显式地最大化上下文偏好增益,在显著减少幻觉的同时保留了通用的推理能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个超级聪明的机器人如何描述它周围的世界。你给它看一张狗的照片,并问:“你看到了什么?”理想情况下,机器人应该说:“我看到一只狗。”但有时,这些 AI 模型会变得有点过于“有创意”。它们可能会说:“我看到一只戴着红帽子的狗”,尽管照片里根本没有帽子。这被称为“幻觉”(hallucination)。这就像机器人在观察实际存在的事物时,却在白日做梦。
为了解决这个问题,科学家们使用了一种叫做“偏好优化”(Preference Optimization)的训练方法。把它想象成一场“热与冷”的游戏。你向机器人展示两个答案:一个是真实的(“热”答案),另一个是编造的(“冷”答案)。机器人学习去选择那个“热”的答案。最近,研究人员尝试通过提供额外的线索(比如图片的文字描述)来让这种方法变得更好,希望它能利用这些线索来停止白日做梦。但这里有一个巨大的疑问:机器人是真的在使用这些线索,还是仅仅在忽略它们并进行瞎猜?
这正是论文《DPO 中的上下文盲性》(Context Blindness in DPO)所调查的问题。作者们是来自高丽大学和韩国科学技术院(KAIST)的研究团队,他们发现即使有了这些额外的线索,许多 AI 模型仍然遭受着“上下文盲性”的困扰。他们发现,标准的训练方法实际上并没有教会机器人去关注额外的辅助信息。为了解决这个问题,他们发明了一种新的训练技术,叫做 C2-DPO(上下文校准直接偏好优化)。C2-DPO 不仅仅是告诉机器人哪个答案更好,它还教导机器人:当拥有额外线索时,要对正确答案表现得更加自信,并且即使在缺少线索时也要保持这种逻辑一致性。他们的实验表明,这种新方法显著减少了机器人的“白日做梦”现象,使其成为一个更可靠的观察者。
问题所在:机器人的白日做梦习惯
多模态大语言模型(MLLMs)就像是带有大脑的超级相机。它们可以观察照片并进行交谈。但它们有一个讨厌的习惯:经常编造细节。如果你给它们看一个纯白盘子的照片,它们可能会自信满满地说:“盘子里有一片比萨。”这句话听起来很完美,但它是谎言。这就是“物体幻觉”(object hallucination)。
为了阻止这一点,科学家们使用了一种叫做**直接偏好优化(DPO)**的方法。想象你是一位正在批改学生作文的老师。你有两个版本:一个是准确的,另一个是充满谎言的。你告诉学生:“我更喜欢准确的那一个。”随着时间的推移,学生就会学会像写准确的版本那样去写作。在 AI 世界中,研究人员给模型成对的答案——一个是真实的,一个是幻觉产生的——并训练它始终选择真实的那一个。
最近,一些研究人员尝试通过提供更多的帮助来辅助 AI。他们在提问前向图片添加了一个“辅助文本”(比如一段说明文字)。其初衷是:“如果机器人既阅读了说明文字,又观察了图片,它就不会编造东西。”但本文的作者提出了一个怀疑性的问题:机器人是真的在阅读这段文字,还是仅仅在忽略它并进行瞎猜?
发现:“盲目”的机器人
为了找到答案,作者创建了一个简单的测试,称为上下文偏好增益(CPG)。把 CPG 想象成一个“信心计”。
测试流程如下:
- 全上下文(Full Context): 你给机器人展示一张图片加上一段有用的说明文字。你问:“盘子里有比萨吗?”机器人回答:“没有,它是空的。”你检查它有多自信。
- 退化上下文(Degraded Context): 你拿掉说明文字。你只给机器人展示图片,并问同样的问题。机器人回答:“没有,它是空的。”你再次检查它的自信程度。
如果机器人真的在关注上下文,它在拥有说明文字时应该更加自信。这个“信心计”(CPG)应该上升。这才是聪明、具备落地能力的机器人该有的表现。
然而,当作者测试标准 AI 模型(使用常规的 DPO 训练)时,他们发现了一些令人震惊的事情。信心计几乎没有移动。无论机器人拥有说明文字还是没有,它感受到的自信程度都完全一样。机器人是上下文盲目的。它忽略了额外的帮助,转而依赖自己的猜测,这导致了那些讨厌的幻觉。
作者发现了一个强关联:当给予额外线索时,模型的信心计上升得越高(高 CPG),它所说的谎言就越少。但标准模型在面对这种情况时,其 CPG 接近于零。它们本质上对所要使用的上下文是“盲目”的。
解决方案:C2-DPO(“上下文校准”训练器)
那么,如何教一个盲目的机器人去观察呢?作者提出了一种新的训练方法,叫做 C2-DPO。
C2-DPO 不仅仅是说“选出正确答案”,它改变了游戏的规则。它迫使机器人学习一个特定的教训:“当你拥有额外线索时,你必须比没有线索时对你的答案更加确定。”
他们通过一个特殊的数学技巧(损失函数)来实现这一点,该函数会奖励机器人扩大其不同置信度之间的差距。
- 场景 A(全上下文): 机器人看到了图片和说明文字。它必须对答案的正确性感到非常确定。
- 场景 B(退化上下文): 机器人只看到图片。它仍需保持自信,但训练确保了“全上下文”下的自信度要显著高于此场景。
这就像是在训练一名侦探。一名普通的侦探在有证人或没证人的情况下都能破案。但一名 C2-DPO 侦探接受的训练是:如果我有证人,我百分之百确定!如果没有证人,我仍然很有把握,但我知道我需要更多证据。这迫使 AI 真正去使用额外的信息(证人/说明文字)来强化其推理过程。
结果:减少白日做梦,增加真实性
作者在几个著名的 AI 模型上测试了这种新方法,包括 LLaVA-v1.5-7B 和 Qwen2-VL-Instruct-2B。他们将 C2-DPO 与旧的标准方法在名为 Object HalBench 的测试(旨在捕捉编造物体的机器人)上进行了对比。
结果令人印象深刻:
- 对于 Qwen2-VL-Instruct-2B 模型,C2-DPO 将幻觉响应率降低了 36%,并将幻觉提及(特定词汇)的比例降低了 60%。
- 在 AMBER 基准测试中,幻觉得分从使用旧方法的 39.9 降至 C2-DPO 的 16.1。
- 至关重要的是,这些模型并没有在其他任务上变得“变笨”。它们回答一般问题和解决逻辑谜题的能力与之前一样出色。它们只是不再胡编乱造了。
作者还展示了这种技巧在没有图片的情况下也同样有效。当他们将同样的逻辑应用于纯文本模型(仅使用问题和答案)时,它仍然提高了准确性。这表明问题不仅仅在于“看”图像,而在于模型如何学习去重视它所获得的信息。
这为什么很重要
这篇论文表明,我们目前训练 AI 变得“诚实”的方式可能缺少了一个关键要素。我们一直在给它们提供额外的线索,并希望它们能使用这些线索,但训练方法并没有强制它们去关注。通过简单地调整训练,以奖励“具备上下文意识的自信心”,作者证明了我们可以显著提高 AI 模型的可靠性,而无需大规模的新数据集或复杂的全新架构。
这提醒我们,有时,阻止机器人“白日做梦”最好的方法不是给它更多的数据,而是教会它如何去重视它已经拥有的数据。正如作者所发现的,当我们将模型校准为尊重上下文时,幻觉就会消退,机器人开始讲述真相。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。