LLM assisted writing deserves empirical evaluation
本文认为,应当基于学术质量和问责制来评估大语言模型辅助写作,而非将其视为一个检测问题,并引用了对超过 69,000 篇健康信息学论文的分析,该分析将工具的使用与更集中的陈述、更广泛的引用以及全球分布的作者身份联系起来。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
科学一直是一场对话,这种对话依赖于清晰的写作来跨越国界和语言分享发现。几十年来,研究人员一直依赖导师、专业编辑和翻译服务,以确保他们的工作能被全球社区理解。今天,一个新参与者加入了这场对话:大型语言模型。这些是经过海量文本训练的计算机程序,能够以卓越的流畅度阅读、总结和重写人类语言。随着这些工具在实验室和办公室中变得普遍,一场关于其角色的辩论也随之出现。许多人担心使用这些工具可能会掩盖思想的真正作者,引入错误,或降低研究质量。因此,目前的讨论大多集中在如何检测机器何时协助撰写了论文,主要将其视为一个监管问题。然而,这种对检测的关注可能会忽视一个更重要的问题:这些工具的实际使用是如何改变科学传播的方式,以及谁有权参与其中?
为了回答这个问题,来自威尔康奈尔医学院和哥伦比亚大学的研究小组决定观察证据而非理论。他们检查了健康信息学领域(研究数据和技术如何应用于医学和公共卫生)的 69,209 篇科学论文的大规模集合。研究人员将这些论文分为三组,以观察它们的差异。第一组包含在 2022 年底(即最先进聊天机器人公开发布之前)撰写的论文。第二组包括在那个日期之后撰写且没有显示使用这些工具迹象的论文。第三组由同一近期时期的论文组成,研究人员识别出这些论文曾受到大型语言模型的辅助。为了找到这些受辅助的论文,他们使用了一个专门的计算机程序,该程序经过训练,能够识别人类写作与经由 AI 重写或生成的文本之间的细微差别。
分析显示,受这些工具辅助的论文并非批评者所担心的那种低质量、缺乏严肃性的作品。相反,数据呈现了另一种现实。这些论文在表达上往往更加聚焦。典型的科学论文可能会在多个不同主题间徘徊,而 AI 辅助的论文则更紧密地围绕单一、清晰的主题展开。它们的标题和摘要与研究主旨高度一致,使得读者更容易准确理解这项研究的内容及其在更广泛领域中的地位。这种清晰度并不意味着思想缺乏原创性;相反,它表明这些工具帮助作者将他们的工作更精准地定位在既有的科学对话之中。
在论文如何引用其他著作方面,出现了另一个显著变化。受 AI 辅助的论文比未经辅助的论文引用了更多的来源,且这些来源涵盖了更广泛的主题。这一发现挑战了“机器只是单纯提高写作速度而不增加价值”的观点。它表明研究人员正在利用这些工具去探索他们原本可能无法发现的文献,或许是通过总结复杂的文本或生成新的搜索术语。然而,研究人员指出,拥有较长的参考文献列表并不自动意味着研究更深入或更好。书目可以很广但很浅,或者包含与主论点仅有松散联系的引文。这些工具使收集广泛的信息变得更容易,但选择最相关且最准确来源的责任仍然落在人类作者身上。
或许最令人震惊的区别在于谁在撰写这些论文。研究显示,AI 辅助的论文其第一作者更有可能来自英语非母语的国家。这些论文还显示出不同大洲研究人员之间更高水平的协作,并包含了更多来自中低收入经济体的作者。这一模式表明,这些工具可能正在充当一座桥梁,帮助科学家克服那些让在国际期刊上发表论文变得困难且昂贵的语言障碍。通过提供即时的编辑和翻译帮助,这项技术可能正在拉平竞争环境,让更多元化的声音进入全球科学对话。
尽管在研究焦点、引用习惯和作者身份方面发生了这些转变,研究发现作品的可见度和影响力保持稳定。一个常见的担忧是,使用 AI 辅助撰写的论文可能会被忽视或引用较少。数据并不支持这一点。当研究人员比较论文发表后的被引用速度时,AI 辅助的论文表现得与未经辅助的论文一样出色。它们也发表在具有高声望的期刊上,与其他组相似。这表明科学界并未排斥这些论文;相反,它们正以与传统作品相同的速率被阅读和认可。
研究人员得出结论,关于人工智能在科学领域中的对话需要发生改变。与其专注于如何捕捉人们使用这些工具,或试图区分“真实的”学术研究与“辅助的”学术研究,科学界应该关注研究本身的质量。研究表明,这些工具本身并没有本质上的好坏之分;它们仅仅是写作过程中的一个新组成部分,就像拼写检查器或统计软件一样。它们的影响完全取决于如何使用。如果它们帮助作者进行更清晰的沟通并纳入更多元化的视角,它们可以成为一种强大的向善力量。如果它们被用于走捷径或掩盖错误,它们则可能有害。证据显示,这些工具已经在重塑科学是如何被书写以及由谁书写的,而最好的前进方式是根据其准确性和完整性来评判作品,而不是根据用于起草它的软件。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。