← 最新论文
💬 NLP

CRAFT: A Unified Counterfactual Reasoning Framework for Tabular Question Answering and Fact Verification

本文介绍了 CRAFT,这是一个统一的框架,通过采用双向反事实推理过程来增强大语言模型的表格推理和事实验证能力,旨在克服单向推理的局限性,并在复杂数据集上实现卓越性能。

原作者: Chenshuo Pan, Yu Zhao, Jie Zhang, Changzai Pan, Zhenhe Wu, Jiayi Liang, Yujie Mao, Shuangyong Song, Yongxiang Li, Zhongjiang He

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenshuo Pan, Yu Zhao, Jie Zhang, Changzai Pan, Zhenhe Wu, Jiayi Liang, Yujie Mao, Shuangyong Song, Yongxiang Li, Zhongjiang He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在试图通过一张填满了关于体育、金钱或历史事实的巨大且混乱的电子表格来破解谜题的侦探。这就是计算机(特别是大语言模型,简称 LLM)在被要求根据这些表格回答问题时所面临的困境。通常,它们的表现就像是一个只从一个角度观察证据的侦探:它们阅读问题,猜出一个答案,然后就此停止。如果它们在第一次猜测时犯了错,即使证据并不完全吻合,它们也会固执己见。

这篇论文介绍了一个名为 CRAFT(反事实推理框架)的新系统。不要把 CRAFT 看作是一个单一的侦探,而要把它看作是一个互相挑战彼此理论的侦探团队。

以下是 CRAFT 的工作原理,使用侦探类比将其分解为简单的步骤:

1. 设定:将问题转化为断言

问题: 计算机被给出了一个问题,例如:“哪个国家获得的铜牌比中国多?”
CRAFT 的招式(重写器): 系统不仅仅是进行猜测,它首先将那个问题转化为一个具体的陈述,即一个假设。它会说:“好吧,让我们假设答案是日本。”现在,我们不再是一个模糊的问题,而是一个需要测试的具体断言。

2. 转折:那个“如果……会怎样?”的情景

问题: 如果计算机只检查“日本”是否是答案,它可能会忽略“韩国也赢得了更多奖牌”这一事实。
CRAFT 的招式(逆转器): 这是神奇的一步。系统创建了一个**“反事实”(Counterfactual)**——一个“如果……会怎样?”的情景。它获取原始的断言,并将其翻转或改变,从而创造出一条不同的思考路径。

  • 原始路径: “日本获得的奖牌比中国多。”
  • 反事实路径: “如果日本并没有获得更多奖牌会怎样?或者如果我们看这样一个陈述:‘日本和韩国都获得了更多奖牌’会怎样?”

这就像律师向陪审团展示两种不同的理论:

  • 理论 A: 嫌疑人有罪。
  • 理论 B: 如果嫌疑人是无辜的,或者如果另有其人呢?
    通过迫使计算机去探索“如果……会怎样”的路径,它就被迫去寻找那些在第一条路径中可能被忽略的证据。

3. 收集证据(提取器)

现在,系统将这两种理论(原始理论和“如果……会怎样”理论)重新发送回表格。它深入挖掘行与列,为双方寻找证据。

  • 它找到了日本拥有 77 枚奖牌的证据。
  • 它找到了韩国拥有 65 枚奖牌的证据。
  • 它意识到“仅限日本”的理论是不完整的,因为“如果……会怎样”的路径揭示了韩国也是一个有效的答案。

4. 最终决定(重新思考者)

最后,一个“法官”(重新思考者模块)会审视来自两条路径的证据。

  • 如果两条路径达成一致,答案就很简单。
  • 如果它们不一致,法官会权衡证据。它会问:“哪条路径的证据更充分?”或者“我们能否结合这些发现?”
    在我们的例子中,法官看到“如果……会怎样”的路径发现了韩国,因此最终答案变成了:“日本和韩国。”

为什么这更好?

论文声称,以往的方法就像是一个直线行走的人;如果撞到了墙,他们可能会继续撞上去。CRAFT 迫使计算机同时向两个方向行走

  • 它能捕捉到更多的错误: 通过检查相反或替代的观点,系统不太可能遗漏重要的细节。
  • 它适用于任何类型的“计算机大脑”: 论文测试了这种方法在不同类型 AI 模型(有的聪明,有的没那么聪明)上的表现,并发现 CRAFT 帮助了它们全部提升,通常缩小了“聪明模型”与“没那么聪明的模型”之间的差距。
  • 它不仅仅是增加猜测次数: 作者证明了,仅仅让计算机猜测 10 次并选择最常见的答案,效果并不如 CRAFT 那种从两个截然不同的逻辑角度看待问题的方法好。

核心结论

CRAFT 是一个教导 AI **进行自我“唱反调”**的框架。它不再仅仅接受自己的第一个想法,而是创建一个该想法的“如果……会怎样”的版本,检查两者的事实,然后结合最好的证据来给出更准确、更完整的答案。这使得 AI 在阅读复杂的表格并正确回答问题方面表现得出色得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →