← 最新论文
💬 NLP

COMMUNITYNOTES: A Dataset for Exploring the Helpfulness of Fact-Checking Explanations

本文介绍了 COMMUNITYNOTES,这是一个大规模多语言数据集以及一个自动提示词优化框架,旨在预测社区生成的事实核查解释的帮助程度及其潜在原因,并最终证明此类见解可以增强现有的事实核查系统。

原作者: Rui Xing, Preslav Nakov, Timothy Baldwin, Jey Han Lau

发布于 2026-01-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Rui Xing, Preslav Nakov, Timothy Baldwin, Jey Han Lau

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个巨大且混乱的城镇广场(就像社交媒体平台 X,即前身为 Twitter),人们在那里大声叫喊着各种说法。有些说法是真的,但很多则是误导性的或虚假的。

在过去,一小群“专家图书管理员”会站在广场上,阅读每一个说法,并写下一份说明来解释该说法是否虚假。但由于说法实在太多,几位图书管理员根本应付不过来。于是,小镇决定让每个人都成为图书管理员。这被称为“社区笔记”(Community Notes)。

然而,这个新系统有两个大问题:

  1. 缓慢的排队: 一个笔记需要数小时甚至数天的时间才能获得足够的投票从而被发布。大多数笔记(超过 9 0%)因为卡在排队中而从未被看到。
  2. 模糊的规则: 当人们投票决定一个笔记是否“有帮助”时,他们并没有一个清晰的词典来定义到底什么是“有帮助”。是因为它很有趣?因为它包含事实?还是因为它很友善?如果没有明确的规则,创作者就很难知道该写什么,投票者也难以进行判断。

解决方案:“规则手册”与数据集

该论文的作者决定通过创建一个庞大的训练手册和一套新规则来解决这个问题。

1. 数据集(“模拟考试”)
他们收集了 104,000 个真实的帖子及其对应的笔记示例。他们对每一个示例进行了标注:

  • 该笔记是否有帮助?(是/否)
  • 为什么它有帮助(或没有帮助)?(例如:“它澄清了事实”、“它带有太多偏见”或“它遗漏了关键点”。)

把这个数据集想象成一叠巨大的模拟考试卷,向计算机展示了成千上万个优秀与拙劣笔记的例子。

2. AI “教练”(自动提示词优化)
最大的障碍在于,关于一个笔记为何好或坏的“理由”过于模糊。作者构建了一个特殊的 AI 教练,它主要做两件事:

  • 编写词典: 它观察这些示例,并自动编写出关于什么是“有帮助”或“无帮助”的清晰、简单的定义。
  • 润色词典: 然后,它扮演一名严厉编辑的角色,通过将这些定义与数据进行对比测试,不断重写这些定义,直到它们趋于完美。

3. 结果:更聪明的计算机
他们教会了计算机模型使用这些全新的、超清晰的定义。

  • 之前: 计算机在猜测一个笔记是否有帮助方面表现尚可(准确率约为 88%),但在解释“为什么”方面表现糟糕(准确率低于 65%)。
  • 之后: 通过向计算机输入这些“经过润色的定义”,它在判断结论和理解背后的“原因”方面都变得更加出色。这就像是给学生一份清晰的学习指南,而不是仅仅给一个模糊的主题列表。

为什么这很重要?

该论文表明,这个新系统不仅仅适用于 X。他们在其他事实核查任务(如检查有关气候变化的说法)上也进行了测试,发现了解证据为何“有帮助”有助于计算机做出更好的决策。

核心结论

作者构建了一个庞大的现实世界案例库,并创建了一个能够自动编写“什么是好的事实核查笔记”之清晰规则的 AI 系统。这有助于计算机更好地理解人类的推理过程,从而最终加速阻止网络虚假信息传播的过程。

重要提示: 作者非常明确,他们的工具旨在辅助人类审核内容,而非取代人类。他们警告说,计算机仍可能犯错或继承人类的偏见,因此这些工具应被用作“第二意见”,而非最终的裁判。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →