← 最新论文
💬 NLP

Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models

本文认为,大型语言模型的输出同质化并非主要由对齐过程引起,而是在预训练阶段就已经习得,并仅在随后的指令微调和对齐阶段被揭示或放大。

原作者: Alexandrine Fortier, Hazel Chen, Peter West

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexandrine Fortier, Hazel Chen, Peter West

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走进一座巨大的、繁忙的图书馆,那里每秒钟都有数百万本书籍正在被编写出来。这不是一个由纸张和墨水构成的图书馆,而是一个数字领域,在这里,被称为“大语言模型”(LLM)的计算机通过阅读互联网上几乎所有的内容来学习如何说话、写作和创造。把这些模型想象成极其快速、过度痴迷的学生,他们读遍了整个图书馆,只为了学习如何完成一个句子。但最近,人们注意到一件奇怪的事情:无论你问这些数字学生什么问题,他们的回答听起来都变得越来越一样。他们都选择同样的隐喻,使用同样的礼貌用语,并避开那些古怪、狂野或具有创造性的想法。这就像是你请十位不同的厨师去做三明治,结果他们竟然决定使用完全相同的面包、完全相同的火腿,甚至连切片的精确数量都一模一样。

科学家们称之为“输出同质性”或“语义收敛”。这是一个令人担忧的问题,因为如果我们的 AI 助手都开始以这种完全相同且狭隘的方式思考和交谈,我们可能会失去人类创造力的火花。长期以来,人们一直认为这种枯燥、重复的行为是因为模型在“阅读”完图书馆之后的“训练”过程造成的。这个第二阶段被称为“对齐”(alignment),就像一位严厉的老师介入其中,告诉学生:“别说那种古怪的话;说这种礼貌的话。”普遍观点认为,这个学生原本是一个狂野、有创造力的天才,是老师的规则扼杀了这种创造力。但如果这个学生在老师走进来之前就已经很无聊了呢?如果“老师”只是让这种无聊变得更响亮了呢?

这篇题为《收敛是必然的吗?》(Is Convergence Inevitable?)的论文进行了一场侦探式的搜寻,试图找出这种雷同感究竟始于何处。作者是来自不列颠哥伦比亚大学的研究人员,他们试图测试两个重大想法。首先,他们想看看“对齐”过程(即老师的规则)是否是杀死创造力的反派。第二,他们想看看“预训练”阶段(即学生阅读图书馆的过程)是否已经在模型的脑海中预先刻下了这种乏味。为了解决这个谜团,他们不仅向模型提问,还运行了一系列巧妙的实验,将“隐喻”作为测试对象。他们把模型当作科学实验室里的实验鼠,喂给它们特定的指令,以观察它们是被诱导出了创造力,还是陷入了循环。

以下是他们的发现,其中包含了一个剧情转折。

首先,他们观察了模型在不同“求学”阶段的表现。他们检查了模型在读完图书馆后的状态(“基座模型”)、学习遵循指令后的状态(“SFT”阶段),以及经过对齐以变得有用且安全后的状态(“DPO”和“RL”阶段)。结果令人震惊。甚至在学习遵循指令的第一步之后——在任何严格的安全规则或“有用性”过滤器被加入之前——模型就已经在吐出近乎相同的答案了。当被要求写一个关于“时间”的隐喻时,这些模型不仅听起来很相似,甚至听起来就像在读同一份剧本。作者认为,“对齐”过程并不是在扼杀多样性,它只是一个放大镜,揭示了一个早已存在、隐藏在明处的设计模式。

为了证明这一点,研究人员玩了一场“找不同”的游戏,并对训练数据进行了测试。他们拿出一个模型,并试图教它一种新的思考方式。他们创建了一组特殊的指令,告诉模型要使用一个特定的、古怪的关于“时间”的隐喻(比如“时间是一个三明治”),而这个模型以前从未见过这个概念。他们原本希望通过强迫模型记住这个新想法,可以打破这种模式。但模型拒绝改变。它忽略了那个新的“三明治”想法,而是继续固守着它最初似乎就很喜欢的、陈腐而无聊的“河流”隐喻。研究人员发现,模型可以被“放大”——让它把同样的话说得更大声——但如果一个想法不在它的记忆中,它就无法被“引入”新的思维方式。这就像试图教一只狗如何喵喵叫;无论你如何赞美它,它也做不到,因为它并不在它的基因里。

最后,他们回到了最开始:那些从未被教导如何遵循指令或保持礼貌的“基座模型”。他们曾以为这些原始的模型会是狂野且多样化的。但当他们使用一种特殊的技巧——假装成一个乐于助人的助手,或者给模型几个回答示例时——他们看到了同样的枯燥模式浮现出来。即使没有老师,原始模型在受到引导时,也会自然而然地坍缩到同一个“河流”隐喻中。这表明,趋向于收敛到相同答案的倾向并不是老师犯下的错误;这是模型在仅仅阅读图书馆时就学会的一种自然习惯。

那么,这一切意味着什么?论文指出,我们在 AI 中看到的这种雷同感不仅仅是使其安全或礼貌的副作用。相反,它似乎是这些模型学习预测句子中下一个词的一个基本组成部分。当你用海量的人类文本训练一个模型时,它会学到最“可能”的答案往往是最常见的答案。“对齐”过程只是放大了这种自然倾向的音量。作者得出结论,修复这个问题并不容易。你不能仅仅通过微调最终的“老师”规则来让 AI 更有创造力,因为创造力从一开始就从未真正存在过。这种“乏味”是直接刻进配方里的,而不只是在最后添加上去的。虽然这听起来有点令人沮丧,但这是一个至关重要的发现。它告诉我们,如果我们想要真正多样化且具有创造力的 AI,我们可能需要重新思考最初是如何教导它们的,而不是仅仅在事后试图修正它们的行为。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →