Local AI pre-screening for human triple-blind peer review in health sciences
本文提出了一种透明的三盲式健康科学同行评审框架,该框架利用本地托管的开源权重大语言模型进行多阶段预筛选,以缓解与未披露人工智能使用相关的风险及审稿人短缺问题,同时确保人类专家保留最终决策权。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
科学依赖于一种安静而至关重要的仪式:在新的发现与世界分享之前,其他专家必须仔细阅读它,以确保其可靠性。这一过程被称为同行评审,是科学界决定哪些作品值得发表的方式。几十年来,这一系统通过将提交的论文与少数人类专家进行匹配来运作,这些专家在秘密状态下阅读论文,并就方法是否正确以及结论是否成立提供判断。但该系统目前正因自身的重量而变得不堪重负。近年来,提交给主要会议的论文数量爆炸式增长,单次活动的论文量甚至达到了21,575篇,而愿意阅读这些论文的有资质专家的数量却未能跟上步伐。其结果是一个瓶颈:优秀的科学研究在等待数月之久,而压力已大到一些研究人员已经开始悄悄使用人工智能来撰写这些评审意见,且通常不告知任何人。这种隐秘的变化带来了新的风险,例如计算机编造虚假参考文献,或者被作者利用隐藏在文本中的指令所误导,从而强行获得正面评价。
为了应对这一日益严重的危机,研究人员罗德里戈·M·布斯(Rodrigo M. Boos)提出了一种组织评审流程的新方法,旨在将人工智能的使用公开化,同时让专家牢牢掌握主导权。该论文概述了一个专门为健康科学期刊设计的系统,在这些领域,患者安全和研究诚信的风险极高。其核心思想是使用三组人工智能程序对每一篇论文进行初步筛选,然后再交给人类审稿人。这些程序并不做出发表或拒绝论文的最终决定;相反,它们充当过滤器,检查一份手稿是否已经准备好接受人类的关注。至关重要的是,该系统旨在保护未发表工作的隐私。与许多将数据发送到互联网的商业工具不同,该提案要求人工智能在期刊自己的本地计算机上运行,从而确保新的医学研究文本永远不会离开期刊的安全基础设施。这种设计直接回应了主要资助机构目前的担忧,因为这些机构禁止审稿人使用外部人工智能工具,因为无法保证未发表数据的存储位置。
该系统通过引导提交的手稿经过五个不同的阶段来运作。首先,论文会被自动清洗,以移除任何可能试图欺骗计算机的隐藏文本或秘密指令。接着,三个独立的模型会阅读匿名后的论文,并根据特定的标准进行评分,例如研究设计是否支持结论,或者统计数据是否严谨。这些模型不允许自行做出最终判断;它们仅提供分数和结构化的解释。如果分数过低,论文将被退回给作者,并附上需要修改的反馈。如果分数足够高,论文将进入下一阶段,由三位人类专家进行阅读。这些人类审稿人并不知道人工智能给出的分数;他们只知道论文通过了初步的计算机检查。这种分离至关重要,可以防止人类仅仅是简单地认同计算机的观点。最后,由一名编辑审查人工智能和人类的工作,以做出最终的发表决定。
该提案的一个特别新颖之处在于,它提供了一个功能,允许作者选择在论文尚未准备就绪时如何处理。在标准的评审中,作者会收到来自人类编辑的拒绝信,这可能是一种痛苦且带有污名化的经历,会挫伤他们继续研究的积极性。这个新系统提供了一个选项:如果三组人工智能模型一致认为论文尚未准备就绪,作者可以预先同意将论文退回进行修改,而无需任何人类看到它。这创造了一种私密的、“无见证”的拒绝,避免了作者在作品完善之前因受到人类评判而产生的社交羞耻感。论文作者承认这是一个需要测试的假设;目前尚未证实这种方法是否真的减轻了拒绝带来的情感负担,但这是一种针对当前系统中已知心理伤害的刻意尝试。
论文谨慎地指出,这是一个设计提案,而非尚未在真实医学期刊上测试过的成品。作者承认,用于决定论文是否通过计算机检查的具体评分标准是基于经验的推测,一旦系统投入实际使用,则需要进行校准。此外还存在已知的局限性:用于此本地系统的人工智能模型在功能上略逊于互联网上最先进的商业模型,这是为了确保完全隐私而做出的权衡。此外,作者指出,虽然该系统旨在捕捉明显的错误,但目前还不能保证绝不会遗漏细微的缺陷或被复杂的攻击所误导。该提案并不声称要取代人类判断(人类判断仍然是强制性的最后一步),而是旨在作为一个结构化的、透明的层级,帮助管理庞大的投稿量。通过使人工智能的角色变得可见且受控,作者认为科学界可以使用这些工具来加速流程,同时不牺牲同行评审所旨在保护的信任与诚信。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。