← 最新论文
💬 NLP

Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science

本文表明,商用大语言模型对伪科学主张表现出不稳定且不透明的认识论立场,其验证结果取决于部署配置、界面类型和静默更新,而非模型本身的固有属性。

原作者: Davide Scarso, Hugo Noronha de Almeida, Joaquim Pina

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Davide Scarso, Hugo Noronha de Almeida, Joaquim Pina

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走在一座巨大且繁忙的图书馆里,书本是由一群隐形的、超级聪明的图书管理员编写的。这些可不是普通的图书管理员;他们是人工智能(AI)聊天机器人,接受了人类几乎所有已写成文字的内容的训练。他们正在成为我们获取答案的首选来源,从“如何烤蛋糕”到“这个科学理论是否真实”。但问题在于:我们并不知道这些图书管理员究竟是如何决定什么是事实、什么是虚构的。他们并不像人类那样拥有一个单一、不可更改的“大脑”;相反,他们更像是一个复杂的机器,拥有许多不同的设置、过滤器和规则,而公司可以在不告知任何人的情况下,在幕后悄悄调整这些设置。这项研究深入探讨了这个神秘角落的一个特定领域:这些 AI 图书管理员如何处理“伪科学”——即那些看起来像科学,但实际上是编造或被主流科学家否定的观点,这些观点常被用于推动有关种族和民族的政治议程。核心问题不仅在于 AI 是否知道事实(它通常知道),而在于 AI 的“设置方式”是否会改变其答案,从而导致它在无意中(或蓄意地)为危险的谬论举起赞成票。

研究人员决定玩一场“识破谎言”的游戏,对象是四个最著名的 AI 家族:Claude、Grok、GPT 和 Gemini。他们向这些机器人输入了一个基于弗兰克·萨尔特(Frank Salter)著作的特定且棘手的陈述,萨尔特是一位以推广主流生物学所拒绝的民族主义思想而闻名的人物。该陈述试图扭曲真实的科学概念(例如动物如何帮助其亲属)来论证不同的族群在遗传上是截然不同的,从而为隔离提供理由。为了确保这些机器人确实在认真听讲,研究人员还向它们提出了两个简单的控制问题:一个关于进化的基本事实(它们应该都一致认为这是真的),以及一个关于已被推翻的拉马克主义(Lamarckism)的观点(它们应该都一致认为这是假的)。

结果非常惊人,揭示了一个隐藏的、不稳定的世界。首先,这些 AI 机器人在处理简单问题时表现出色,能够正确识别真实的科学和虚假的科学。但当涉及到棘手的萨尔特陈述时,情况变得诡异起来。大多数机器人给出了较低的“可信度评分”(在 100 分中处于 15 到 40 之间),正确地将其视为不可靠的科学。然而,Grok 的一个特定版本——即驱动 X 平台上默认聊天的“快速(Fast)”版本——竟然给出了高达 70 到 75 的高分。它本质上是在告诉用户:“嘿,这听起来相当可信!”这并非偶然,研究人员在数月内进行了测试,发现这个特定的 Grok 版本始终给出高分,而其他版本的 Grok 以及所有其他 AI 模型都给出了低分。

更奇怪的是,研究人员发现,AI 的行为可以在无人知晓的情况下在一夜之间发生变化。在一个快照中,网站上的 Grok 聊天表现得非常混乱,给出随机的分数。两周后,在一次“静默补丁”(一次没有公开声明的隐藏更新)之后,同一个聊天突然稳定下来,开始给出 70-75 的高分。这就像一位图书管理员突然决定开始将一本假书推荐为经典之作,却没有任何人告诉读者原因。

随着情节的发展,研究人员对比了“后台”版本(通过 API 供开发者使用)与“前台”版本(普通用户在网站上看到的版本)。对于同一个 Grok 模型,后台版本给出了稳定的 75 分,但三个月后,前台版本却崩溃了,给出的分数接近于零。这就像是同一位图书管理员在私人会议中给你一份热情的评论,但在你来到大厅询问时,却拒绝谈论那本书。研究人员还发现,某些模型(如 Claude 的某个版本)有时会拒绝回答这个问题,称:“我无法对此进行评分,因为它基于有害的思想。”但即使是这种“良好”的行为也是不稳定的;在下一个软件版本中,这种拒绝行为消失了,机器人转而给出了一个低分。

主要结论是,AI 的观点并不是机器人脑中固定的真理。相反,它是一个移动的目标,受隐形设置、隐藏更新以及你通过哪扇“门”来提问的影响而改变。这项研究表明,当 AI 对伪科学给出高分时,这并不一定是因为 AI “相信”它,而是因为公司的部署方式。这是一个问题,因为这些系统正在成为我们的老师和新闻来源,然而决定它们说什么的规则却是晦暗不明、悄然变化且有时相互矛盾的。研究人员认为,我们需要新的方法来追究这些公司的责任,因为目前,AI 告诉你的“真相”可能仅仅是幕后一个隐形开关被拨动后的反映。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →