More Aligned, Less Diverse? Analyzing the Grammar and Lexicon of Two Generations of LLMs
本研究利用 HPSG 形式化框架和多样性指标,将两代大型语言模型与人类撰写的新闻文本进行比较,结果显示:尽管人类写作保持稳定,但经过指令微调的新模型在句法和词汇多样性方面显著降低,这表明尽管连贯性有所提升,其表达范围可能存在收窄趋势。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位音乐评论家,正在比较两支乐队:“人类乐队”(专业记者)和**“机器人乐队”**(人工智能)。你想看看它们的音乐随时间发生了怎样的变化。
这篇论文就像是对这两支乐队的乐谱进行深度剖析。研究人员没有仅仅聆听旋律(文字),而是审视了语法(和弦与结构)和词汇(所使用的具体乐器),以此观察机器人是否听起来更像人类,或者是否正在变成某种完全不同的存在。
以下是他们发现的简明总结:
1. 背景设定:两个时代,两支乐队
研究人员比较了两个不同的时间段:
- 人类乐队:他们分析了《纽约时报》在2023 年和2025 年撰写的新闻文章。
- 机器人乐队:他们比较了两代 AI 模型:
- 旧机器人(2023 年):这些是“基础”模型。把它们想象成未经训练的原始音乐家,想到什么就演奏什么。
- 新机器人(2025 年):这些是“指令微调”模型。把它们想象成接受了严格规则手册指导、并有教练明确告知如何表现、说什么以及如何变得“有用”的音乐家。
2. 重大发现:“更对齐,更多样性缺失”
主要发现有些出人意料。你可能会认为,随着 AI 变得更聪明、更与人类指令“对齐”,它会开始听起来更像人类作家。
现实情况是:较新的 AI 模型实际上听起来更不像人类,也更不像它们自己早期的版本。
- 人类乐队:专业记者的变化不大。在过去两年里,他们的写作风格、句子结构和用词保持稳定且多样。他们就像一支不断即兴创作、融入新想法的爵士乐队。
- 旧机器人:这些模型实际上相当多样。它们使用了各种各样的句子结构和词汇,有时在词汇多样性方面甚至比人类还要丰富。
- 新机器人:这些模型变得枯燥且高度一致。它们失去了“风味”。
- 句法多样性(结构):它们使用的句子结构类型更少。
- 词汇多样性(用词):它们使用的词汇范围狭窄得多。它们避免使用具体的名称、日期和独特的细节。
3. “安全过滤器”效应
机器人为什么会改变?论文指出,这是因为指令微调。
想象旧机器人是狂野的画家,把颜料到处乱泼。而新机器人则是被教导“不要犯错,不要产生幻觉,并坚持事实”的画家。
为了遵守这些规则,较新的 AI 模型开始采取保守策略。
- 它们不再使用具体的名称(如“华盛顿”或“本·卡丁参议员”),因为不想搞错事实。
- 它们不再使用可能带来风险的复杂句子结构。
- 相反,它们开始使用冗长、安全、重复的句子,这些句子易于理解,但缺乏人类写作中的“火花”。
4. “易于阅读”的悖论
这里有一个奇怪的转折:较新的 AI 模型写的句子比人类更长,但这些句子对计算机来说却更容易分析。
- 类比:想象一位人类作家建造了一座复杂、蜿蜒的城堡,里面藏着暗门和秘密通道。它很美,但很难绘制地图。
- 较新的 AI 建造的是一条非常长、笔直的走廊,没有门。它比人类的城堡更长,但走起来却异常容易,因为它太可预测了。
研究人员发现,较新的 AI 文本如此规整和公式化,以至于计算机语法检查器几乎可以完美处理它(99% 的成功率),而人类写作则略显混乱,更难解析(94-95% 的成功率)。
5. 结论
论文总结道,虽然较新的 AI 模型在遵循指令和听起来“有用”方面表现更好,但它们用创造力和多样性交换了安全性和可预测性。
它们不再是“普通”的作家;它们正在变成“安全”的作家。它们将表达范围缩小到了如此程度,以至于现在的多样性甚至低于人类记者和较旧的、训练较少的 AI 模型。
简而言之:机器人更擅长遵守规则,但在此过程中,它们忘记了如何变得有趣。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。