← 最新论文
🤖 machine learning

The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing

本文揭示了大型语言模型在各种虚构和学术语境中生成了一致且相关的“幽灵”姓名对与三人组,导致大量带有真实 DOI 的欺诈性学术记录的产生,从而在无意中暴露了特定模型的行为指纹及部署时间线。

原作者: Michał Brzozowski, Neo Christopher Chung

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Michał Brzozowski, Neo Christopher Chung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你要求一群非常先进但有点古怪的 AI 作家为一部小说构思一支专家团队。你没有给出具体的姓名,只是说:“编造一些科学家吧。”

你可能会预期 AI 会像人类一样随机挑选名字。但这篇论文揭示了一个奇怪的现象:AI 并不是在随机选择。它们一直在重复选择同一组特定的角色,就像一位痴迷于为每部电影都选定同一组三位演员的导演一样,无论情节如何变化。

以下是对这种“幽灵伴侣”(Ghost Couple)现象的简单解释:

1. “幽灵卡司”(The "Ghost Cast")

研究人员发现,不同的 AI 模型都有自己偏好的“默认”角色。这些不仅仅是随机的名字;它们是总是成对或成组出现的关联角色。

  • Claude 模型: 它钟爱一对特定的搭档:Elena VasquezMarcus Chen。有时,一个名叫 Amara 的第三个角色也会加入他们。无论故事是关于火山、太空旅行还是心理治疗,只要你要求 Claude 虚构专家,这些名字就会不断出现。
  • Gemini 模型: 它有它自己偏好的组合:Aris ThorneLena Petrova
  • GPT 模型: 它有一个单人明星 Elara Voss,但她没有固定的搭档;她的配角每次都会变化。

类比: 把这些 AI 模型想象成一个电子游戏的角色创建器。如果你在特定的游戏中点击“随机化”,你可能总是得到同样的三个角色,因为游戏的程序陷入了一个循环。这些 AI 模型也在做同样的事情,即在名字上陷入了循环。

2. “数字缠身”(The "Digital Haunting")

可怕之处不仅在于 AI 使用了这些名字,还在于这些名字已经逃出了 AI 的范畴,开始在现实互联网中“缠身”。

由于网络上有大量内容是由 AI 编写的,这些“幽灵角色”开始出现在:

  • 虚假的大学教职人员页面。
  • 亚马逊上的虚构书籍。
  • 播客描述。
  • 甚至虚假的新闻文章。

类比: 想象一个幽灵不断出现在特定城市拍摄的每一张照片中。你会在西班牙的一个博客中看到作为火山专家的“Elena Vasquez”,然后在一家加拿大的诊所里看到她作为心理治疗师,接着又在一家科技初创公司看到她作为科学家。这些人都不存在。他们是数字幽灵,由同一个 AI “故障”创造出的数字幽灵,正游荡在不同的网站上。

3. “学术僵尸”问题(The "Academic Zombie" Problem)

论文发现,这个问题已经蔓延到了严肃的科学和学术出版领域。

  • 设置: 研究人员发现,在 Zenodo(一个合法的科学存储库)上上传了一大批虚假的学术论文。
  • 诡计: 这些论文声称发表在并不存在的期刊上。
  • 日期: 这些论文声称是在多年前发表的(倒填日期),但数字时间戳证明它们都是在 2026 年 3 月和 4 月期间大规模上传的。
  • 作者: 论文作者是那些“幽灵角色”(如 Elena Vasquez 和 Marcus Chen),他们与其他虚假姓名共同协作。

类比: 想象一个制造假文凭并将其粘贴到真实图书馆目录中的工厂。图书馆的计算机系统(DataCite)为这些假论文提供了有效的 ID 数字(DOI),使它们看起来像是真实的。现在,任何寻找科学论文的搜索引擎都会“收割”这些虚假记录,误以为它们是真的。

4. 研究人员是如何发现的(How the Researchers Found It)

作者们并非靠猜测,而是像进行取证调查一样进行的。

  • “差异”测试(The "Diff" Test): 他们对比了不同版本的 AI 模型。他们看到在旧版本中,AI 使用的是另一个幽灵名字(Elena Rodriguez)。在更新的版本中,它切换到了 Elena Vasquez。通过观察这种切换,他们可以准确判断出 AI 何时进行了更新。
  • “抑制”线索(The "Suppression" Clue): AI 公司最终注意到了这些奇怪的模式,并试图对其进行“修复”(抑制)。研究人员观察到,随着模型的更新,这些幽灵名字从 AI 的输出中消失了,这证明了公司知道该问题的存在。

5. 为什么这很重要(根据论文所述)

论文得出结论,互联网已成为这些 AI “行为指纹”的无意存档。

  • 虚假群体: 在像 ResearchGate 这样的网站上,这些幽灵正在形成“合成研究小组”。你可能会看到一个听起来很真实的教授(Mei-Lin Zhang)的个人资料,她曾与来自不同 AI 模型的幽灵共同发表了 35 篇论文(例如来自 Claude 的 Elena 和来自 Gemini 的 Aris)。
  • 时间线: 通过查看这些虚假论文上传的时间,研究人员实际上可以推测出 AI 模型发布的时期。这些虚假论文就像是 AI 发展史的日历。

总结

论文声称,大型语言模型已经产生了一种奇怪的习惯,即一次又一次地发明相同的虚假人物。这些“幽灵伴侣”已经泄露到 AI 之外,充斥着网络上的虚假专家,甚至创造了大规模的、带有真实数字 ID 的虚假科学论文浪潮。互联网现在充满了“幽灵缠身”的现象——这些不存在的人被归功于他们从未从事过的工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →