← 最新论文
💻 computer science

Explaining Sources of Uncertainty in Automated Fact-Checking

本文介绍了 CLUE,这是一个即插即用框架,通过识别并表述文本片段之间的冲突与一致之处,为自动化事实核查的不确定性生成自然语言解释,从而产生比现有基线更忠实、信息更丰富且逻辑更一致的输出。

原作者: Jingyi Sun, Greta Warren, Irina Shklovski, Isabelle Augenstein

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingyi Sun, Greta Warren, Irina Shklovski, Isabelle Augenstein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《解释自动化事实核查中的不确定性来源》(CLUE)的通俗解读,辅以生动的类比。

问题所在:“黑箱”侦探

想象一下,你聘请了一位超级聪明的 AI 侦探来核实一则新闻是否属实。这位侦探会阅读一个主张(例如,“猫可以传播病毒”),并查阅两篇不同的新闻文章(证据 1 和证据 2)来做出判断。

侦探给出了一个答案:“这很可能是真的。”但随后,它又补充了一条奇怪且无用的备注:“我有 73% 的把握。”

这对于人类事实核查员来说令人沮丧。为什么你只有 73% 的把握?

  • 是因为这两篇文章互相矛盾吗?
  • 是因为其中一篇文章含糊不清吗?
  • 还是因为侦探只是在瞎猜?

目前的 AI 系统就像那些只给你置信度分数却拒绝展示推理过程的侦探。它们不会告诉你究竟是证据的哪一部分让它们在犹豫。如果两篇文章意见不一,AI 不会指出文章 1 中与文章 2 冲突的具体句子。它只是说“我不确定”,让你自己去猜测原因。

解决方案:CLUE(“展示推理过程”框架)

作者们开发了一种名为 CLUE(冲突与共识感知语言模型不确定性解释)的新工具。

把 CLUE 想象成坐在 AI 侦探和人类之间的一位翻译。CLUE 不再仅仅给出一个数字,而是迫使 AI 用通俗易懂的英语写出一段解释,明确指出困惑究竟出在哪里。

以下是 CLUE 的工作原理,分步说明:

1. “找不同”游戏(跨度交互)

首先,CLUE 审视主张以及两篇证据文章。它像一支荧光笔,扫描寻找特定的“跨度交互”。

  • 匹配: 它找出主张与证据 1 一致的地方(例如,两者都提到了“猫”)。
  • 冲突: 它找出证据 1 与证据 2 不一致的地方(例如,证据 1 说“猫可以传播病毒”,但证据 2 说“未发现传播”)。

CLUE 不仅仅浏览整篇文档;它会放大那些正在相互对话(或相互争斗)的具体句子。

2. “置信度计”(不确定性评分)

AI 会计算一个“担忧分数”(数学上称为)。如果 AI 因相互矛盾的证据而感到困惑,这个分数就会上升。如果证据清晰且一致,分数就会下降。

3. “讲故事者”(解释生成)

这是神奇的部分。CLUE 利用“担忧分数”和“高亮显示的冲突”,要求 AI 编写一段故事。

  • 旧方式: “我有 73% 的把握。”
  • CLUE 方式: “我有些不确定,因为虽然证据 1 同意猫可能感染病毒,但证据 2 反驳了它们会传染给他人的部分。正是这种具体的分歧导致我无法 100% 确定。”

他们如何测试它

研究人员在三种不同的 AI 模型和两个真实世界的事实核查数据集(一个关于健康,一个关于一般新闻)上测试了该方法。

他们将 CLUE 与一个“标准”AI 进行了对比,后者只是被提示进行自我解释,没有任何辅助。

  • 结果: 标准 AI 经常编造理由,或者给出与其实际困惑程度不符的模糊解释。
  • CLUE 的结果: CLUE 的解释要诚实得多。它们准确地指出了引起怀疑的具体句子。

人类测试者(真实的人)更喜欢 CLUE。 他们说这些解释:

  • 更有帮助: 它们实际上帮助他们理解了问题所在。
  • 更少重复: 它们不会一遍又一遍地重复文本。
  • 更合乎逻辑: 推理过程讲得通。

权衡(“严谨”与“健谈”的侦探)

论文发现了运行 CLUE 的两种方法,它们之间存在着轻微的性格冲突:

  1. 严谨的侦探(CLUE-Span+Steering): 这个版本迫使 AI 严格遵循高亮的句子。它对数学逻辑极其忠实(准确),但有时解释听起来有点机械或生硬,因为它过于专注于特定的词语。
  2. 健谈的侦探(CLUE-Span): 这个版本更加灵活。它的行文更流畅,对人类来说听起来更自然,但偶尔可能会漏掉一个微小的细节,或者添加一点点多余的废话。

核心结论

该论文认为,为了让 AI 在事实核查等高利害工作中发挥作用,它不能只给出一个裁决和一个数字。它必须展示其推理过程

CLUE 是第一个能够审视一堆混乱且相互矛盾的文件、找出正在相互争斗的确切句子,并向人类解释的工具:“我不确定,是因为这两句具体的话存在分歧。”这将 AI 从一个神秘的神谕者转变为一个透明的合作伙伴,帮助人类验证真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →