← 最新论文
💬 NLP

ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence

本文介绍了 ConflictScore,这是一种新颖的指标和基准,旨在通过将回答分解为原子级断言,并测量冲突断言的比例以及支持性证据与矛盾性证据之间的平衡,来量化语言模型在多大程度上能够承认其依据文档中的冲突证据。

原作者: Siyi Liu, Aaron Halfaker, Dan Roth, Patrick Xia

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Siyi Liu, Aaron Halfaker, Dan Roth, Patrick Xia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在试图破解谜题的侦探,但你面对的不是一个证人,而是满屋子十个人在提供证词。有人发誓嫌疑人在公园;也有人言之凿凿地看到他在图书馆。

问题所在:“是的,但是……”盲点
目前的 AI 模型(比如你正在使用的聊天机器人)非常擅长寻找信息。但当它们遇到相互矛盾的故事时,它们往往表现得像个固执的孩子,只挑声音最大的那个人听,而忽略了其他所有人。它们可能会说:“嫌疑人在公园!”然后就此打住,完全忘记了还有另外五个人持有异议。

现有的检查 AI 是否在说实话的工具就像是一个简单的“通过/失败”测试。它们会问:“是否有任何证人支持这个故事?”如果有一个人说了“公园”,AI 就会得到一个合格的分数,即使其他九个人都说了“图书馆”。这会给人一种虚假的安全感。

解决方案:ConflictScore
这篇论文的作者引入了一个名为 ConflictScore 的新工具。你可以把它想象成一个“冲突侦探”,它不仅仅是询问一个故事是否得到了支持,而是询问:“这个故事是否受到了其他证人的反驳?”

它是如何运作的,分为三个简单的步骤:

  1. 拆解(主张分解):
    想象 AI 写了一段很长的文字。ConflictScore 会将这段文字拆解成一个个微小的、独立的句子(原子主张)。这就像把一个大蛋糕切成一小块一小块,以便逐一检查。

  2. 证人席(证据评估):
    对于每一个单独的句子,该工具都会对照 AI 使用的每一份文档进行检查。它会问:“文档 A 支持这个句子吗?文档 B 是否反驳了这个句子?”

    • 支持 (Support): 文档表示同意。
    • 反驳 (Contradict): 文档表示不同意。
    • 无关 (Irrelevant): 文档没有提到这件事。
  3. 计分卡(指标):
    该工具会给出两个分数:

    • ConflictScore-Count (CS-C): 这就像是一个“麻烦计数器”。它会告诉你 AI 的句子中有多少百分比是在与证据发生冲突。如果 6 个句子中有 4 个遭到了证人的反驳,那么分数就会很高(意味着 AI 遇到了麻烦)。
    • ConflictScore-Ratio (CS-R): 这是一个“平衡秤”。它衡量证据是如何分布的。是 50/50 的对峙(一场真正的辩论),还是 9 比 1 的碾压(一边倒)?这有助于理解分歧的严重程度。

实战演练:ConflictBench
为了测试这个新侦探工具是否有效,作者建立了一个名为 ConflictBench 的健身房。他们收集了数千个答案非常混乱的问题:

  • 歧义性 (Ambiguity): 比如“克利夫兰有多大?”(世界上有很多个叫克利夫兰的城市)。
  • 矛盾性 (Contradiction): 文档明确表达了相反的意思(例如,“活动在 1990 年举行”对比“活动在 1995 年举行”)。
  • 观点 (Opinion): 在这些问题上,人们确实存在分歧(例如,“这种网页设计技术好吗?”)。

他们用这个“健身房”测试了他们的工具,发现该工具在识别 AI 是否忽略了那些持反对意见的证人方面表现得非常出色。

他们的发现

  • AI 过度自信: 即使文档明显存在分歧,AI 模型也倾向于选择其中一方,并将其当作绝对真理。它们经常忽略“图书馆”的证人,却对着“公园”大声疾呼。
  • “说话”并不能解决问题: 作者尝试在指令中给 AI 提供“温柔的提醒”(比如“请谨慎并考虑各方观点”)。这虽然有一点帮助,但 AI 仍然经常出错。这就像告诉一只固执的狗要“友善一点”,但它还是会咬邮递员。
  • “重做”技巧: 最令人兴奋的发现是在 TruthfulQA 实验中。当他们使用 ConflictScore 告诉 AI,“嘿,你漏掉了一个矛盾点,再试一次”时,AI 竟然变得更好了。这就像学生在考试中得到了红笔批改,意识到自己的错误并重新写出了正确的答案。

底线
ConflictScore 是一种衡量 AI 是否在诚实面对现实世界中复杂性和冲突性的新方法。它不仅检查 AI 是否拥有一些证据,还检查 AI 是否足够勇敢,能够承认证据本身是混乱且相互矛盾的。

局限性(代价)
作者承认,运行这个工具需要大量的计算能力,因为它必须检查每一个句子与每一份文档的关系。这就像雇佣一支由 100 名律师组成的团队来审查一个段落——它很准确,但也很昂贵且缓慢。此外,该工具将所有文档视为同等地位;它不知道一份文档是著名的报纸,而另一份只是一个随机的博客。它只看到“文档 A”对比“文档 B”。

简而言之,ConflictScore 帮助我们看清,AI 是如何因为忽视了眼前的争论,而变得自信满满地犯错。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →