← 最新论文
💬 NLP

UTS at CheckThat! 2026: Cite-Frame Engineering for Generated Fact-Checking Articles

UTS 系统通过采用一种由领域归因引用框架(domain-attribution cite frame)和影子验证锚点选择器(shadow-validated anchor picker)增强的确定性基于模板的生成器,在 CheckThat! 2026 Task 3 中获得了第二名,其中两者均仅利用小型大语言模型进行引用验证而非文本生成,以最大化蕴含得分和覆盖率得分。

原作者: Dima Galat, Marian-Andrei Rizoiu

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Dima Galat, Marian-Andrei Rizoiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代信息生态系统中,验证一项说法仅仅是成功的一半;向人类读者解释其为何真实或虚假则是另一半。这属于自动化事实核查的领域,在这个领域中,计算机试图模仿记者严谨的工作。挑战不仅在于寻找正确的证据,还在于将这些证据编织成一篇人类可以信任、且计算机可以验证的连贯文章。最近的一项竞赛 CheckThat! 2026,要求参赛队伍构建能够自动生成此类事实核查文章的系统。这些系统必须针对一个特定的说法,从一组网页链接中寻找支持性证据,并撰写一份引用这些链接的短篇报告。评分标准是毫不留情的:一个计算机程序会根据文章与人类编写范例的匹配程度进行评分,并且至关重要的是,它会检查每一句引用来源的句子是否确实得到了该来源文本的支持。如果系统捏造了一个细节或误引了来源,哪怕只是极其微小的偏差,计算机都会对其进行严厉惩罚。

来自悉尼科技大学的一个团队带着一个与众不同的系统参加了这次比赛。当其他团队试图使用强大的人工智能从头开始撰写整篇文章时,悉尼团队构建了一个依赖于僵化、可预测的模板来生成正文,仅将人工智能作为严格的守门人来检查来源的系统。他们的这种方法使他们在 11 支队伍中获得了第二名。成功的关键不在于生成更具创造性的散文,而在于准确理解计算机评委的工作原理。他们发现,评委非常保守,会奖励那些紧贴所提供事实的文章,并拒绝任何添加了额外修饰或未经证实细节的句子。通过设计系统以尊重这些严格的规则,他们创造出了一种能够可靠地生成事实核查文章的机器,尽管这些文章并不特别优雅,但却非常准确。

研究人员首先测试了一个最显而易见的想法:让一种能够撰写流畅文本的大型语言模型(一种类型的人工智能)来起草整篇文章。他们尝试了不同规模的模型,希望机器能学会像专业的核查员一样说话。结果失败了。这些模型生成的文章始终无法通过计算机的评分系统。问题在于结构。计算机评委寻找文本中的特定模式,特别是如何引用来源的方式。当人工智能试图自然地写作时,它经常会改变提及来源的方式,或者添加一些计算机无法在原始证据中验证的词汇。即使是微小的变化,比如添加一个评论者的名字或一个原文中没有的日期,都会导致计算机拒绝该句子。人工智能的写作能力越强,它就越容易偏离评委所要求的严格模式。团队意识到,试图让机器“写得更好”实际上反而降低了它的表现。

与其尝试改进写作,不如决定改进结构。他们构建了一个从简单、不变的模板开始的系统。这个模板创建了一篇包含标题、针对每条证据的一句话以及结论的基础文章。这个“草稿桩”很枯涩,但它是安全的。它完美地遵循了规则。随后,团队向该系统添加了两个特定的工具,充当质量控制检查员。第一个工具,他们称之为“领域归属框架”,它简单地将每个引用包裹在一个标准的短语中,例如“根据该网站,[事实]”。这一小步改变让句子听起来更像人类编写的范例,同时又没有改变事实。第二个工具是一个“影子验证器”。在系统最终确定一个句子之前,它会要求一个小型人工智能模型检查该特定句子是否确实得到了来源链接的支持。如果模型回答“否”,系统就会尝试来源文本中的下一个句子。如果尝试失败,它就会保留原始的、安全的句子。这确保了系统产生的每一个引用都是计算机评委能够接受的内容。

他们方法的成果是清晰且可衡量的。在比赛前用于测试系统的验证数据上,他们的方法相比基础模板在整体得分上有了小幅但显著的提升。当他们结合了框架工具和影子验证器时,提升幅度更大。该系统并不试图表现得聪明;它只是确保每一句话都是可验证的,并遵循正确的格式。在最终比赛中,他们的系统获得了 0.484 的分数,在 11 支队伍中排名第二。获胜团队的分数更高,而两者之间的差距完全在于一个特定的指标:引用精准度。获胜团队能够以更高的准确度引用来源,这很可能是因为他们选择了省略那些他们不确定的引用,而悉尼团队则引用了他们收到的每一条证据。悉尼团队的系统非常可靠,几乎引用了所有可用的证据,但由于它没有舍弃那些不确定的证据,因此其精准度得分较低。

该团队的工作为自动化事实核查的未来揭示了两个重要教训。首先,当一个计算机评委被设计为对验证过程极其严格时,增加额外的词汇或试图让文本听起来更像人类往往会损害得分。最有效的策略是保持文本简单,并严格与证据挂钩。其次,用于选择引用哪个句子的工具往往具有误导性。团队发现,标准的挑选来源中“最佳”句子的方法(例如寻找最长的句子或与说法最相关的句子)往往会选中被计算机评委拒绝的句子。唯一可靠的挑选句子的方法是询问评委本身。这一洞察表明,在以严格验证为衡量标准的任务中,最好的方法不是生成新内容,而是仔细筛选和验证现有内容。

研究人员还指出,他们的系统存在一个局限性。由于他们被要求引用提供的每一条证据,因此无法采用获胜团队的那种策略,即通过跳过不确定的来源来保持高准确度得分。悉尼团队假设,如果他们增加了一条规则,即丢弃任何评委不确定的引用,他们的得分可能会更高。然而,他们在比赛期间并未测试这一点。他们的工作证明,在涉及高风险的验证任务中,一个优先考虑准确性而非创造性的、简单的确定性系统,可以胜过试图模仿人类写作的复杂人工智能模型。论文总结道,对于下一代此类系统,重点应该从生成更好的散文转向开发更聪明的决策方式,即决定包含什么以及排除什么,从而确保机器写的每一个字都能被证明是真实的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →