A Vision for the Future of an AI-Integrated Research Ecosystem
本文认为,研究界不应仅仅侧重于人工智能披露政策,而应通过探讨关于论文、评审及激励机制之目的的根本问题,来主动演进科学传播生态系统,从而构建用于溯源、校准和问责的基础设施,进而使在人工智能融合的未来中,可信的学术成果成为一种默认状态。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,科学的世界就像一座巨大且繁忙的图书馆,研究人员是其中的作者、编辑和图书管理员。长期以来,这座图书馆一直遵循着一个简单的规则:人类撰写书籍,人类核实事实,人类决定哪些内容可以出版。但最近,一种新型的助手来到了这里:生成式人工智能(Generative AI)。把它想象成一个超快速、超智能的机器人助手,它可以编写草稿、寻找事实,甚至在几秒钟内总结整本书的内容。虽然这听起来像是实现高效工作的梦想,但也让这座图书馆陷入了一丝恐慌。每个人都在问:“如果机器人协助编写了书,那么真正的作者是谁?这个故事是真的吗?如果机器人也开始检查书籍,我们最终会不会得到一个充满谬误的图书馆?”本文通过切入这种混乱局面,提出了一个更大的问题:与其仅仅试图捕捉使用机器人的人,我们如何重新设计整个图书馆,使信任从一开始就内置其中?
作者 Ryan E. Dougherty 和 Natalie Kiesler 不仅仅是在凭空猜测;他们正在观察现有系统中的裂痕。他们认为,目前关注于“监管”AI——即确保人们承认自己使用了它——就像是通过在滴水处放个水桶来试图修复漏水的屋顶。这样做虽然必要,但并不能阻止降雨。他们指出,真正的问题在于我们分享科学的方式(论文、评审和奖励机制)本身已经在挣扎,而 AI 只是加剧了这种压力。
为了帮助我们理解未来可能走向何方,作者邀请我们进行一次前往 2036 年的旅行,去观察两个截然不同的未来。
光明前景
想象一下 2036 年的一位研究人员,他们发现了一个关于如何教授编程的惊人发现。在这个世界里,他们不会把一年时间浪费在处理文书工作中。相反,AI 工具充当了超有组织的助手团队。它们能瞬间检查数学计算、验证数据,并将这项新发现与我们已知的知识体系相连接。随后,人类专家会介入,提出宏观问题:“这真的重要吗?它有道理吗?”在这个未来,“论文”不仅仅是一个静态的文件;它是一个与原始数据和代码相连的、活生生的对象。知识流动得更快、更容易被找到,也更值得信赖,因为 AI 处理了那些枯燥且易出错的工作,让人类能够专注于大局。
黑暗前景
现在,想象另一个 2036 年。在这里,图书馆正处于溺水状态。AI 每天都在大量产出数以百万计的研究论文和评审。没有人能读完所有内容,因此人们依赖于另一个 AI 来对摘要进行摘要。虽然“科学”的数量巨大,但没人知道什么是真实的,什么是虚假的。发表论文的压力极其疯狂,对系统的信任已经崩溃。在这种情况下,挑战不在于寻找新的发现,而在于弄清楚哪些发现是可以相信的。人类精疲力竭,试图维持系统的运转,但噪音太大,以至于听不到真相的声音。
作者利用这两个故事强调了一个根本性的张力:同样的技术既可以让科学变得透明,也可能在如果我们不改变做事方式的情况下,让科学变成一团谎言的乱麻。他们并不声称其中一个未来是必然的;相反,他们用这两个故事表明,我们现在就有选择权。
四个大问题
为了应对这一选择,作者建议我们需要重新思考四个主要方面:
“论文”仍然是分享想法的正确方式吗?
目前,研究论文就像是一个项目的压缩快照。它假设读者无法看到其背后的原始数据或代码。但今天,我们拥有分享一切的工具。作者建议,论文不应再是主角。相反,真正的研究对象应该是数据和代码本身,并且这些内容应该是易于查找和复用的(即所谓的“FAIR”原则)。论文将仅仅是讲述该数据故事的一种方式。如果我们这样做,就能清晰地看出哪里是 AI 协助的,哪里是人类完成了繁重的工作。“评审”应该是什么样子的?
目前,同行评审(即专家在论文发表前进行检查)是破碎的。研究表明,不同的评审小组往往会对同一篇论文产生巨大的分歧。有时,评审仅仅是随机的猜测。此外,评审员通常是匿名的且没有报酬,这导致了粗心大意甚至是由 AI 生成的评审得以通过。作者认为,评审不应仅仅是一个结论(通过或失败);它本身就应该是一项有价值的贡献。我们需要将评审视为真正的学术工作:认可评审员的贡献,检查他们的工作,并确保他们是在提供实质性帮助,而不仅仅是在勾选选项。我们还需要人类评审员吗?
作者建议,AI 非常擅长处理评审中枯燥的部分,比如检查引文是否真实或数学逻辑是否成立。但人类对于评审中的“灵魂”部分是不可或缺的:判断一个想法是否重要、公平且具有创造性。如果 AI 负责验证,也许我们就没必要让那么多人类去做同样的琐碎检查。然而,我们绝对需要人类来识别偏见并决定什么才是重要的。危险在于,如果我们让 AI 处理一切,我们可能会失去那份保持科学诚信的人类判断力。我们在为谁的利益服务?
系统中的每个人都有不同的诉求:作者希望快速发表,评审员希望减少工作量,而编辑则希望获得高质量的论文。AI 让自动化处理每个人工作中烦琐的部分变得轻而易举,但如果我们只是通过自动化来逃避艰苦的工作,整个系统可能会加速,却学不到任何东西。作者认为,我们需要改变规则,让从事优秀、诚实的科学研究成为获得奖励的标准,而不仅仅是追求速度。
三大挑战
作者总结道,我们不能仅仅用单一的工具来“修复”这个问题。他们提出了整个科学界需要共同应对的三个重大挑战:
- 校准信任(Calibrated Trust): 我们需要一种衡量 AI 工具可靠性的方法。目前,仅仅说“AI 提供了帮助”只是一个说法。我们需要标准化的测试,来看 AI 编造事实或遗漏错误的频率,这样我们才知道何时可以信任它。
- 溯源(Provenance,即纸质记录/来源追踪): 我们需要能够自动记录使用了哪些工具以及如何使用的系统。想象一下,每篇论文都附带一份数字收据,准确显示了哪里使用了 AI,以及在哪里由人类介入。这需要内置在研究人员使用的软件中。
- 合成世界中的完整性(Integrity in a Synthetic World): 当 AI 可以撰写任何内容时,我们不能仅仅依靠“检测”AI 来阻止滥用。这是一场注定失败的战斗。相反,我们需要建立一种文化,无论谁或什么东西撰写了内容,都能让工作的“价值”变得清晰可见。
前进之路
本文并没有提供一根魔杖。相反,它建议进行一种思维方式的转变。我们需要停止尝试监管 AI,转而开始构建让“可信科学”成为默认状态的基础设施。这意味着要像重视论文一样重视数据,将评审视为真正的劳动,并创造衡量信任的新方法。
作者最后向整个科学界发出了行动号召:让我们针对我们究竟在乎什么进行一场大讨论。我们想要的是速度,还是真理?我们想要更多的论文,还是更好的想法?无论如何,技术都会让我们变得更快,但技术是否能让我们变得“更好”,取决于我们今天所做的选择。科学的未来不仅关乎机器人能做什么,更关乎我们作为人类,决定与它们共同构建出什么样的未来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。