Attribution in Scientific Literature: New Benchmark and Methods
本文介绍了 REASONS,这是一个大规模基准测试和双指标框架,旨在通过在不同证据条件下平衡幻觉率与适当的弃权行为,来评估并提高大语言模型在科学引用归因方面的可靠性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代科学发现的版图中,研究人员越来越多地转向人工智能,以总结复杂的发现并将思想连接到庞大的文献库中。这些被称为大语言模型的智能系统经过海量文本训练,能够生成流畅且类人化的响应。它们在科学领域效用的一个关键特征是能够为其观点附上引文,引导读者查阅支持该陈述的原始论文。然而,一个持久的问题削弱了这种信任:模型有时会捏造不存在的参考文献,或者将真实的论文错误地归于错误的观点之下。这种现象通常被称为“幻觉”,它创造了一种危险的权威假象。科学家和开发人员面临的核心挑战不仅在于如何让这些系统在有把握时更加准确,更在于让它们理解何时应当承认自己不知道。如果一个模型无法区分“拥有足够证据回答问题”与“证据不足”这两种情况,它就有可能自信满满地将研究人员引向虚假事实的歧途。
一个研究团队通过创建一个名为 REASONS 的新测试场解决了这一不确定性问题,这是一个专门用于衡量这些模型处理科学引文能力的基准测试。该团队从涵盖计算机视觉到量子计算等十二个不同领域的十二万多条学术论文特定句子中收集了数据。该集合中的每一句话都与一个真实、经过验证的引文相连,提供了一个清晰的“地面真值”(ground truth)作为测试模型的标准。研究人员不仅仅是要求模型寻找正确的论文;他们设计了一系列实验,以观察当可用信息量发生变化时模型的行为表现。他们测试了模型在三种不同场景下的表现:首先,在没有任何外部信息的情况下,迫使模型仅依靠其记忆;第二,直接向模型提供经过验证的元数据,如论文标题和摘要;第三,使用先进的搜索工具,从数据库中检索相关文档以辅助回答问题。
结果揭示了一个在“提供帮助”与“保持诚实”之间存在的显著且一致的权衡。当模型没有任何额外信息时,许多模型会拒绝回答,研究人员将这种行为称为“弃权”(abstention)。虽然这种拒绝意味着它们没有犯错,但也意味着它们无法为用户提供价值。然而,一旦研究人员增加了上下文信息——无论是向模型提供论文详情,还是允许它们搜索数据库——模型变得更加愿意开口说话。不幸的是,这种响应性的提高是以沉重的代价换取的。模型不再说“我不知道”,而是开始以极高的信心提供答案,即便这些答案是错误的。在一次使用先进搜索工具的具体测试中,错误引用的比例跃升至接近 88%,而模型拒绝回答的比例则降至零。模型不再谨慎;它们是在自信地犯错。
这种行为在不同类型的科学领域中并不统一。研究发现,模型在量子计算和生物分子等专业领域表现明显逊于计算机视觉等覆盖广泛的领域。在这些小众领域,即使提供了额外信息,模型也更容易做出错误的猜测。研究人员还测试了一种分阶段向模型展示信息的方法,希望看到更多证据能帮助模型纠正航向。虽然这有助于减少一些错误,但并未解决根本问题:倾向于过度自信的模型仅仅是停止了过早的弃权,并继续断言错误的信息。该研究还包括对一千个模型输出进行的仔细人工审查,以确保自动化测量是准确的。人类专家证实,模型确实在制造事实错误,例如引用错误的作者或错误的论文,而不仅仅是使用不同的措辞来表达相同的意思。
研究结果表明,目前构建这些系统的方法缺失了拼图中的关键一块。仅仅增加更多的数据或更好的搜索工具并不会让模型更可靠;事实上,它往往通过抑制模型的自然犹豫感而使其变得更加危险。研究人员认为,一个真正值得信赖的系统,其评估标准不应仅限于它答对问题的频率,还应包括它在何时保持沉默的能力。研究结论指出,为了让人工智能成为科学发现中安全的伙伴,我们必须设计出将“认识论安全性”(epistemic safety)——即承认不确定性的意愿——看得与生成答案的能力同样重要的系统。若缺乏这种平衡,自信的伪造风险将始终是高风险科学工作中应用这些强大工具的主要障碍。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。