← 最新论文
🤖 AI

When LLMs Play the Telephone Game: Cultural Attractors as Conceptual Tools to Evaluate LLMs in Multi-turn Settings

本文研究了大语言模型中的微小偏差如何在“传声筒游戏”式的迭代交互中被放大,揭示了诸如毒性之类的文本属性如何向受指令开放度、模型规模及特定文本特征影响的文化吸引子状态收敛。

原作者: Jérémy Perez, Grgur Kovač, Corentin Léger, Cédric Colas, Gaia Molinaro, Maxime Derex, Pierre-Yves Oudeyer, Clément Moulin-Frier

发布于 2026-01-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Jérémy Perez, Grgur Kovač, Corentin Léger, Cédric Colas, Gaia Molinaro, Maxime Derex, Pierre-Yves Oudeyer, Clément Moulin-Frier

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:机器人的“传声筒”游戏

想象一下,一群人正在玩经典的“传声筒”(Telephone)游戏。一个人向下一个人低声诉说一个故事,下一个人再传给第三个人,以此类推。到最后,故事往往变得面目全非、滑稽离奇或者完全失真。

这篇论文提出了一个问题:如果参与游戏的不是人类,而是像你平时用来写作或聊天的那些大语言模型(LLM)呢?

研究人员设置了一个 AI 版的“传声筒”游戏:一个 AI 编写一个故事,传给第二个 AI,第二个 AI 进行重写并传给第三个,如此循环 50 轮。他们想观察文本是会保持原样、变得更好、变得更差,还是会漂移到一个奇怪的新状态。

实验过程:AI 作家的链条

研究人员创建了一个由 AI 智能体组成的超长链条。

  1. 起点: 人类编写一段初始文本(例如新闻文章、科学摘要或社交媒体评论)。
  2. 链条: 第一个 AI 接收该文本并得到特定的指令(例如,“重写这段话”、“以此为灵感”或“延续这个故事”)。它会写出一个新版本。
  3. 交接: 第二个 AI 接收的是第一个 AI 的版本(而不是最初的人类版本),并执行相同的任务。
  4. 重复: 这个过程连续进行 50 次。

他们追踪了文本在沿着链条移动过程中的四个维度:

  • 毒性(Toxicity): 文本有多刻薄或无礼?
  • 积极性(Positivity): 文本有多快乐或忧伤?
  • 难度(Difficulty): 阅读难度有多大?
  • 长度(Length): 有多少个单词?

发现: “磁铁”效应

最令人惊讶的发现是,文本并不会随机漂移。它会被拉向一个特定的“目的地”。研究人员称之为文化吸引子(Cultural Attractor)

把吸引子想象成一块磁铁

  • 如果你开始讲一个非常刻薄的故事,磁铁可能会把它拉向变得非常有礼貌。
  • 如果你开始讲一个很长的故事,磁铁可能会把它拉向变得很短。
  • 无论你的起点在哪里,文本都会倾向于顺着坡度滑动,并最终停留在同一个地方。

研究发现,这些磁铁是真实且强大的。即使你从 20 个完全不同的故事开始,在经过 50 轮 AI 重写后,它们往往看起来非常相似。

关键发现:什么让磁铁变得更强?

研究人员测试了不同的变量,以观察是什么让“磁铁”变得更强或更弱。

1. 任务很重要(游戏的“规则”)

  • 严格的规则(弱磁铁): 如果你告诉 AI,“在不改变原意的情况下重写这段话”,文本会基本保持不变。此时磁铁很弱。
  • 宽松的规则(强磁铁): 如果你告诉 AI,“以此为灵感写一些新的东西”或“延续这个故事”,文本会发生剧变。此时磁铁非常强,能迅速将文本拉向某种特定的风格。

2. AI 模型很重要(玩家的“个性”)
不同的 AI 模型有不同的“个性”。

  • 一些模型(如某些版本的 Llama)倾向于让文本迅速变得更加积极或减少毒性。
  • 其他模型(如 GPT-4o-mini)则对改变文本的长度或难度表现出更强的抵抗力。
  • 有趣的是,研究人员发现毒性具有最强的磁铁。几乎所有的模型都会迅速“清理”文本,使其变得非常安全且无害,无论原始故事最初有多么刻薄。

3. “微调”效应
AI 模型通常会被“微调”(由人类训练)以变得更有帮助且更安全。研究人员发现,这种训练就像是一个预设好的磁铁。

  • 经过微调的模型(称为“指令型/Instruct”模型)拥有的磁铁会将文本更快地拉向人类的偏好(如降低毒性),这比未经微调的模型(“基座型/Base”模型)要快得多。

为什么这很重要(根据论文观点)

论文指出,我们目前测试 AI 的方式就像是在测试房间里的单个人。我们问一个问题,得到一个答案,然后说:“做得好!”

但在现实世界中,AI 经常以链条形式被使用:

  • 一个 AI 写摘要,另一个 AI 进行编辑,第三个 AI 将其转化为博客文章。
  • AI 聊天机器人之间会互相交谈。

论文警告说,仅仅测试单次交互是不够的。 单次交互可能看起来很完美,但如果你让那个 AI 与另一个 AI 对话 50 次,内容可能会演变成完全不同的东西(要么变得极其安全且乏味,要么变得非常奇怪)。

“崩溃”警告

在一种特定情况下,研究人员看到了一个奇怪的故障。当一个 AI 被要求“延续”一个故事时,它最终开始反复重复同一个标签(例如,“#XiangqiForAll #XiangqiForAll...”)。文本质量“崩溃”成了一个关键词循环。这表明,当 AI 在没有人类干预的情况下过度进行 AI 对话时,有时会“失去理智”并停止产生意义。

总结

这篇论文是一个警示,也提供了一种看待 AI 的新视角。它说:不要只看一个 AI 说了一次什么。要观察当 AI 互相交谈时会发生什么。 它们拥有看不见的“磁铁”,会将它们的对话拉向特定的风格;而根据规则和模型的不同,这些对话可能会以我们仅通过观察单次聊天所无法预测的方式来改变世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →