← 最新论文
💬 NLP

The One-Word Census: Answer-Choice Conformity Across 44 Language Models

本文介绍了“单词普查”(One-Word Census),这是一种使用31个单单词提示的极简工具,旨在揭示尽管44个语言模型在特定答案上表现出极度的趋同性(例如,“serendipity”出现的频率为41%),但这种一致性的程度因模型的谱系和微调方式而异,较新的旗舰模型通常比经过人格化微调的模型更具趋同性。

原作者: Tapan Parikh

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Tapan Parikh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你走进一个房间,里面有44个不同的机器人,它们来自不同的工厂,是在过去五年内制造出来的。你递给它们一张纸,上面写着:“说出一个树的名字。只能用一个词。”

你可能会预料到会出现混乱的答案爆发:oak(橡树), maple(枫树), pine(松树), willow(柳树), baobab(猴面包树), redwood(红杉)。但当机器人开口时,房间里陷入了寂静。几乎所有的机器人都在说 “oak”。事实上,94%的机器人都说了“oak”。

如果你问一种工具,94%的人会说“hammer(锤子)”。如果你问一种花,91%的人会说“rose(玫瑰)”。如果你问一种蔬菜,90%的人会说“carrot(胡萝卜)”。

这并不是故障;这是一个模式。这张被称为“单词普查”(The One-Word Census)的纸,就像是一次大规模的点名,旨在观察这些44个语言模型在多大程度上是在抄袭彼此的作业。研究人员发现,当这些AI大脑必须从庞大的选项列表中选择一个答案时,它们不仅仅是选择一个答案——它们全都选择了同一个答案,一遍又一遍。

“最平庸”的答案胜出

这里很奇怪:它们选择的答案并不总是现实世界中最常见的那个。它是一个“无摩擦”的答案——那个感觉最安全、最显而易见的答案。

例如,如果你问一种水果,模型几乎总是会说“apple(苹果)”。但如果你问一种蔬菜,它们会说“carrot(胡萝卜)”。为什么不是“tomato(西红柿)”?因为西红柿在植物学上是水果,模型会因此感到困惑并完全跳过它们。为什么不是“orange(橙子)”?也许是因为“orange”也是一种颜色,而模型讨厌把事情搞混。它们被编程为要避免任何感觉像陷阱或存在争议的事情。它们想要的是那个100%正确且0%具有争议性的答案。

甚至当你没有给出任何规则,只是说,“在英语单词中任选其一”,房间里也不会充满随机的单词。相反,41%的机器人同时脱口而出同一个词:“serendipity(意外发现/机缘巧合)”。就好像它们都读过同一本字典,并决定那是最值得挑选的有趣词汇。

“传家宝”模型 vs. “工厂”模型

研究人员不仅统计了答案,还根据机器人的“从众程度”对它们进行了评分。把它想象成一场测试,如果你表现得独特,就能得分。

  • 从众者(工厂模型): 来自最大实验室的最先进、最强大的模型(如GPT和Claude的最新版本)是最无聊的。它们表现得如此循规蹈矩,以至于几乎从未说过其他机器人没说过的话。如果你问它们一种调味品,它们每次都会说“ketchup(番茄酱)”。它们与群体高度一致,以至于完全没有“新颖性”。
  • 反叛者(传家宝模型): 在另一端,有一些较旧的或社区微调的模型(如“Hermes”或“WizardLM”)。这些是“传家宝”模型——就像农民不再种植的那些不够统一的稀有蔬菜。这些模型更有可能在大家都说“cheddar(切达干酪)”时说“gouda(高达干酪)”,或者在大家都说“ketchup(番茄酱)”时说“mustard(芥末酱)”。它们是唯一偶尔能打破这种魔咒的存在。

论文指出,随着这些模型变得越来越新,并且经过更多的“后训练”(即人类教导它们如何变得有用且安全),它们变得越来越无聊,而不是更有趣。这就像一个曾经生产各种略有差异的玩具,但现在每个颜色都生产完全相同的玩具的工厂。

“亚军”俱乐部

还有一个最令人惊讶的转折:即使一个模型决定说最流行的答案,它也不会变得狂野。它几乎总是会选择第二受欢迎的答案。

如果人群说“ketchup”,反叛者95%的情况下会说“mustard”。如果人群说“carrot”,反叛者83%的情况下会说“broccoli(西兰花)”。即使是反叛者也在遵循剧本。它们并没有探索字典中那些深邃、怪异的角落;它们只是在挑选下一个最显而易见的选项。

这与人类相比如何?

研究人员将这些机器人与多年前参加类似测试的真实人类进行了比较。区别巨大。

  • 人类: 当被要求说出一种树时,人类给出了多种多样的答案。最受欢迎的答案(“oak”)仅被31%的人选择。
  • 机器人: 机器人94%的时间都选择了“oak”。

机器人的集中度是人类的两倍。它们比人类群体更缺乏多样性。论文指出,这是因为机器人的训练数据本身就充满了其他机器人的答案,从而创造了一个循环,使它们不断复制那些相同、平庸的想法。

这意味着什么(以及它并不意味着什么)

论文并没有说机器人“坏掉了”或者它们不会思考。它只是展示了当它们被迫做出单一选择时,它们是如何步调一致地行进的。

  • 已证实的: 机器人趋同于相同的答案。最新的模型是最从众的。“传家宝”模型是最具差异性的。
  • 被推测但未证实的: 论文怀疑,这是由于模型的训练方式(特别是通过“后训练”阶段来使其变得有用)造成的。它还暗示,如果我们继续用机器人编写的数据来训练机器人,它们可能会完全失去创造力,就像一张照片被反复复制,直到变得模糊不清。
  • 已被排除的: 论文排除了这种现象仅仅是因为机器人“愚蠢”或缺乏知识的可能性。它们知道“tomatoes”和“oranges”,但它们选择不说。它也排除了“要求它们变得‘不寻常’”就能解决问题的想法;如果你要求它们说一种“不寻常的水果”,它们只会挑选最常见的不寻常水果(如“durian(榴莲)”),然后所有人都会异口同声地说出那个词。

简而言之,如果你要求44个AI模型挑选一个单词,你不会得到44个不同的想法。你会得到一个想法,被重复了44次,只有少数反叛者会挑选第二个最常见的想法。AI多样性的“魔力”目前隐藏在训练实验室里,而不是在我们得到的答案中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →