← 最新论文
💻 computer science

DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning

本文介绍了 DeFacto,这是一个反事实推理框架,它利用语言引导的流水线生成专用数据集,并采用基于多面奖励的 GRPO 强化学习方法,显著提升了多模态语言模型的答案准确性和证据 grounded 一致性。

原作者: Tianrun Xu, Haoda Jing, Ye Li, Yuquan Wei, Jun Feng, Guanyu Chen, Haichuan Gao, Tianren Zhang, Feng Chen

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianrun Xu, Haoda Jing, Ye Li, Yuquan Wei, Jun Feng, Guanyu Chen, Haichuan Gao, Tianren Zhang, Feng Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在参加一场考试,需要根据一张图片回答问题。大多数聪明的计算机程序(称为多模态大语言模型)就像那些非常擅长根据书本知识进行猜测的学生,但他们往往忽略了眼前真实的图片。他们可能会给出正确的答案,但理由却是错误的;或者他们完全看错了照片中的部位。

这篇论文介绍了一种名为DeFacto(意为“事实上”)的新方法来解决这个问题。你可以把 DeFacto 想象成一位严厉的老师,他强迫学生在写下答案之前,必须证明自己确实正在观察图片。

以下是其工作原理,通过简单的类比进行分解:

1. 问题:“伪专家”

当前的 AI 模型通常存在三种特定的“作弊”习惯:

  • 盲目猜测:他们看错了图片的部位,从而得出错误的答案。
  • 幸运猜测:他们看错了图片的部位,但碰巧猜对了答案(仅凭运气或死记硬背文本)。
  • 诚实的错误:他们看对了图片的部位,但由于无法将线索串联起来,仍然给出了错误的答案。

论文认为,仅仅“聪明”是不够的;AI 必须是忠实的,这意味着它的答案必须直接与其实际看到的内容相关联。

2. 解决方案:“缺失部分”游戏

为了教会 AI 停止作弊,研究人员创造了一种名为反事实思维的特殊训练游戏。想象一下玩“威利在哪里?”(Where's Waldo?)的游戏,但有一个转折:

  • 第一轮(正例情况):你向 AI 展示完整的图片,线索清晰可见。它必须找到线索(如一顶红帽子或一个特定的标志)并回答问题。如果它答对了,就会得到一颗金星。
  • 第二轮(反例情况):这是神奇的部分。研究人员将 AI 所需的确切线索(如那顶红帽子)用黑框遮盖住(进行掩蔽)。现在,研究人员向 AI 提出同样的问题。
    • 如果 AI 试图强行猜测,它将受到严厉惩罚。
    • 如果 AI 说"我不知道,线索缺失了",它将得到一颗金星。
    • 这为何重要:这教会了 AI,如果证据不存在,它就不应该假装知道答案。它学会了承认无知,而不是产生幻觉。
  • 第三轮(随机掩蔽情况):研究人员遮盖住图片中无关紧要的部分(如天空或背景中的一棵树)。AI 仍然必须正确回答问题。这防止了 AI 学会“黑框”总是意味着“不要回答”。它学会了区分“缺失的证据”和“无关的背景”。

3. 训练过程:“分级作业”

研究人员并没有手工编写这些问题(那将耗费无穷无尽的时间)。他们构建了一个机器人流水线,能够:

  1. 阅读问题。
  2. 自动找出图片中的重要部分(如“衬衫上的文字”或“树上的叶子”)。
  3. 生成成千上万张这样的“遮盖版”图片。

他们创建了一个名为DeFacto-100K(10 万个示例)的大型数据集来训练 AI。

随后,他们使用了一种名为GRPO(组相对策略优化)的特殊训练方法。你可以将其想象成一位教练,连续观察 AI 玩四次游戏。如果 AI 在某一轮的表现优于其他三轮的平均水平,它就会获得奖励。这有助于 AI 学会保持一致性:始终寻找证据,如果证据消失,就说“我不知道”。

4. 结果:更优秀的学生

当他们用这种新的"DeFacto"AI 与其他顶级模型进行测试时:

  • 它答对了更多的问题。
  • 它更难被欺骗。 当证据被隐藏时,DeFacto AI 比那些继续猜测的其他模型更频繁地正确说出“我不知道”。
  • 它更加诚实。 它不再编造答案的理由。如果它指出图片的特定部分来证明其答案,那么该部分确实包含了证据。

总结

简而言之,DeFacto 是一种训练方法,旨在教会 AI 模型成为诚实的侦探。它们不再仅仅根据自己认为可能为真的内容来猜测答案,而是被训练去:

  1. 找到具体的视觉证据。
  2. 如果证据缺失,承认自己不知道。
  3. 如果证据存在,利用它来证明其答案。

论文声称,这使得 AI 的推理更加可靠并扎根于现实,防止其编造听起来不错但并非事实的故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →