← 最新论文
💬 NLP

Provenance Before Prose: Claim-Locked Reporting

本文引入了“断言锁定报告”(claim-locked reporting),一种“先溯源后文本”的协议,该协议在语言生成之前固定统计证据和断言参数,与现有的混合模板方法相比,显著提高了数值可复现性并降低了计算成本。

原作者: Xiao Fan, Jingyuan Li, Hongbin Guo, Yubo Han, Yi Zhang

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiao Fan, Jingyuan Li, Hongbin Guo, Yubo Han, Yi Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代科学领域,研究人员经常依赖强大的计算机程序将原始数据转化为书面报告。想象一下,一位科学家花费数月时间进行复杂的实验,以观察人类大脑如何随体重变化,或新药如何影响某种疾病。一旦数学计算完成,结果就变成了固定的数字:一个特定的连接计数、一个精确的变化测量值以及一个明确的影响方向。如今,科学家越来越多地要求人工智能根据这些固定的数字来撰写向公众或医生解释这些结果的叙述。人们希望这些计算机程序能够写得流畅且快速。然而,这一过程中隐藏着危险。即使起始数字是正确的,计算机有时也会改变它所讲述的故事。它可能会意外地交换数字、颠倒影响的方向,或者将微弱的发现描述为强烈的发现。这是因为计算机不仅仅是在写作,它还在做出关于强调哪些事实以及如何陈述其强度的选择,而这些选择在程序每次运行时都会发生变化。

西安电子科技大学的研究人员开发了一种新方法来阻止这种情况发生,确保计算机编写的故事与事实完美锁定。他们称这种方法为“声明锁定报告”(claim-locked reporting)。该方法不再让计算机决定使用哪些数字或如何表达它们,而是强制计算机首先就一份严格的声明列表达成一致。对于报告将要提出的每一个观点,系统首先会检查原始数据,以确认准确的数字、影响的方向以及证据的真实强度。只有在这一列表最终确定并锁定之后,计算机才开始编写连接性的句子。这就像是一个建筑队,在开始混合用于粘合砖块的砂浆之前,必须按照蓝图的要求将每一块砖精确地铺设在指定位置。在他们的研究中,研究人员在两种截然不同的科学写作类型上测试了这种方法:脑成像报告和临床药物试验摘要。他们发现,当使用这种新方法时,计算机每次运行时产生的数字和事实都完全相同,而旧方法则经常改变细节。

团队通过要求计算机根据来自肥胖人群脑扫描的真实数据和来自公开医疗药物试验记录的数据来编写报告,测试了他们的想法。在脑扫描测试中,他们将这种新方法与几种旧的利用人工智能的方法进行了对比。旧方法(包括允许计算机自行选择数字的简单指令或模板)生成的报告在彼此之间仅具有约61%的一致性。这意味着如果你运行两次相同的实验,计算机往往会给你不同的数字或不同的结论。相比之下,当研究人员使用这种声明锁定方法时,报告的一致性达到了98.5%。计算机不再选择包含哪些事实,它只是报告那些已经被批准的事实。这种一致性不仅在于重复数字,还意味着计算机停止了犯危险的错误,例如将微弱的联系描述为强烈的联系,或反转医疗效果的方向。

研究还观察了计算机在处理含义取决于其他因素的复杂情况时的表现。在一次涉及脑扫描的具体测试中,数据显示在观察人群组时存在大量变化,但当研究人员根据体重进行调整后,这个数字几乎降至零。这意味着如果不在报告中进行调整,最初的大数字会产生误导。旧方法通常在此处失败,会将大数字作为一种稳固的、独立的实事进行报告。然而,新方法捕捉到了这一点。因为系统在写作前将声明锁定在数据的完整语境中,它正确地报告了一旦考虑体重因素,那个大数字就会消失。它以正确的谨慎程度描述了结果,避免了在不存在直接因果关系的情况下声称存在直接原因的错误。

为了确保这些结果不仅仅是计算机代码的结果,研究人员还要求人类专家阅读报告。这些专家并不知道每份报告是由哪种方法编写的。他们寻找方向性错误以及过于强烈或缺乏支持的句子。人类评审员确认,新方法产生的错误远少于旧方法。在药物试验测试中,旧方法有时会颠倒结果的方向,比如在药物实际上有害时说它有益,反之亦然。新方法从未犯过这种错误;它每次都能保留正确的方向。人类审计员还注意到,当证据较弱时,新方法在运用谨慎语言方面表现得更好,而旧方法往往显得过于自信。

除了准确性之外,新方法还被证明更加高效。由于计算机不需要花时间决定使用哪些数字或为了修复错误而重写部分内容,它消耗的计算资源更少,完成工作也更快。在测试中,与那些试图在写作后检查其工作的旧方法相比,新方法所需的计算时间更短,所需的计算机能力也更少。这表明,先构建事实不仅更可靠,而且更便宜、更快速。

研究人员谨慎地指出,他们的方法并不能修复错误的数据或错误的科学研究。如果原始数字是错误的或者实验本身存在缺陷,报告仍然会反映出这些错误。该系统仅仅是确保计算机不会在现有的错误之上再增加自己的错误。它充当了事实的严格守门人,确保讲述的故事与证据完全吻合。通过将控制权从写作阶段转移到规划阶段,该团队展示了让人工智能编写既流畅又严谨地忠实于数据的科学报告是可能的。这种方法为如何使用计算机进行科学传播而不丢失科学发现所需的精确度提供了一条切实可行的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →