← 最新论文
💻 computer science

ARISMA: Guidelines for AI- and LLM-Assisted Systematic Reviews, Scoping Reviews, and Mapping Studies

本文介绍了 ARISMA,这是一个综合性的指南框架,它确立了原则、生命周期分类法以及报告标准,旨在将人工智能和大型语言模型作为可审计、人类监督的助手,整合到系统评价、范围界定评价和映射研究中,以确保方法论的严谨性和问责制。

原作者: Mahyar Tourchi Moghaddam, Mina Alipour

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Mahyar Tourchi Moghaddam, Mina Alipour

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在科学研究领域,有一种特定的工作被称为系统综述(systematic review)。想象一下,一个专家团队正试图回答一个复杂的问题,例如一种新药是否比旧药更有效,或者关于气候变化的知识现状如何。为了完成这项工作,他们不能仅仅阅读几篇有趣的论文;他们必须找到该主题下发表过的每一篇相关的研究,阅读所有论文,并将它们的发现结合起来,形成一个单一且可靠的结论。这一过程是现代医学和政策制定的基础,但其难度极大。随着每年科学论文数量的增长,寻找并阅读所有论文的任务变得越来越慢、越来越昂贵,也越来越难以跟上进度。

最近,被称为人工智能(AI)的强大计算机程序进入了这一领域。这些工具可以阅读文本、理解语言,并以人类无法企及的速度总结信息。研究人员开始使用它们来帮助寻找论文、决定保留哪些论文以及提取重要的数字。然而,这种速度的提升也带来了问题。没有人为如何安全地使用这些工具制定明确的规则。如果一个计算机程序遗漏了一项关键研究,或者在读取数字时出了错,整个综述就可能出错,从而导致依赖该综士的医生或决策者做出错误的判断。问题不仅在于这些工具是否有效,还在于如何在不失去对科学控制的情况下使用它们。

来自南丹麦大学的一个研究小组现在提出了一套名为 ARISMA 的新指南来解决这个问题。他们的工作并不将人工智能视为人类科学家的替代品。相反,他们将其定义为一个必须在每一步都受到监督、测试和记录的高级助手。其核心理念简单而严格:系统综述中的每一个重要决策都必须保持可理解、可检查,并且最终由人类承担责任。研究人员认为,虽然机器可以承担繁重的体力活,但不能让它们在没有任何监管的情况下决定什么才算作证据。

该论文概述了一个在使用这些工具时进行综述的完整生命周期。它始于规划阶段,即人类团队在任何计算机介入之前,必须清晰地定义他们正在寻找的内容。指南建议,人工智能在构思搜索术语或建议主题的同义词方面非常有帮助,但最终的搜索策略必须由人类专家进行检查。研究人员强调,如果在测试运行期间计算机遗漏了已知的、重要的研究,则该搜索策略被视为失败,必须在应用于实际数据之前进行修复。这确保了搜索不仅是快速的,而且是完整的。

一旦搜索完成,团队将面临筛选数千个标题和摘要以决定阅读哪些全文的巨大任务。这是人工智能展现出最大潜力的地方,也是指南最为谨慎的地方。论文解释说,计算机可以用于对论文进行排序或建议排除哪些论文,但它不能独立做出最终决定。研究人员提出了一个“信任等级”系统。在低信任场景中,计算机仅建议人类阅读的顺序。在中等信任场景中,它可能会推荐排除对象,但人类必须检查其中的每一项建议。在涉及指导医疗方案的高风险综述中,计算机仅作为第二双眼睛,由人类团队做出最终决定。至关重要的是,在允许计算机执行这些操作之前,必须在人类已经评分的一组小规模论文集上对其进行测试。如果计算机在测试集上的错误过多,则不允许继续进行。

指南还涉及了数据提取这一棘手的任务,即研究人员从论文文本中提取特定数字,如患者人数或治疗结果。在这里,研究人员的态度更加保守。他们指出,虽然计算机擅长寻找描述性内容,但在处理隐藏在表格或复杂句子中的精确数字时往往表现不佳。论文建议,计算机可以填写包含描述性细节的草拟表格,但用于计算最终结果的每一个数字都必须由人类进行逐行检查。如果人类没有验证数字的来源,那么该数字就不能用于最终的综述。这条规则旨在防止计算机产生“幻觉”,即编造看似合理但并不存在于原文中的事实。

在整个过程中,指南要求建立一条书面记录(paper trail)。每当使用计算机工具时,研究人员必须记录使用了什么工具、软件的版本、给出的指令以及输出结果。如果计算机出错,或者人类团队决定更改计算机的工作方式,该变更必须注明日期并进行解释。这创造了综述的历史记录,使任何阅读最终报告的人都能清楚地看到计算机在何处提供了帮助,以及人类在何处接管了控制权。论文还涉及了法律和伦理方面,提醒团队要小心,不要将私人或未发表的数据发送到公共计算机服务中,因为这些数据可能会以团队并非初衷的方式被存储或使用。

研究人员通过与包括科学家和信息专家在内的二十一名领域专家进行交流,开发了这些指南。他们测试了这些想法,并根据反馈进行了完善,重点在于使规则具有实用性和清晰度。其结果是一个框架,允许团队在利用人工智能速度的同时,不牺牲科学综述所需的准确性和可靠性。论文最后指出,目标不是实现完全自动化,而是提高其可审计性。通过将人工智能视为一种受监督和受限制的工具,而非自主决策者,这些指南确保了综述的最终结论始终立足于经过验证的证据,并且始终有人类在环路中负责解释真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →