← 最新论文
💬 NLP

Instruction-Tuned Models Locally Reuse Human Syntax More Than Humans Do

本研究表明,指令微调后的语言大模型在与前序人类轮次的句法收敛性上比人类表现得更强,但与预训练模型相比,它们对特定语法规则的敏感度较低,且与无关启动项的重叠度更高。

原作者: Zandi Eberstadt

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Zandi Eberstadt

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

伟大的语言之镜:当机器人开始模仿我们的说话方式

想象一下,你正在参加一个派对,你注意到在你的朋友开始使用某个特定的俚语或一种有趣的句式之后,你也下意识地开始这样做。你并没有刻意计划,这只是自然而然发生的。在科学界,这被称为句法收敛(syntactic convergence)。这是人类大脑的一个已知特性,即我们会潜意识地模仿与我们交谈的人的语法和句子结构,使我们的对话更加流畅。这就像一场语言的舞蹈,舞伴们自然而然地步调一致。

现在,想象一个新的舞伴:一个名为“大语言模型”(LLM)的巨型、超智能计算机程序。这些是能够写故事、回答问题并进行对话的 AI 聊天机器人。科学家们长期以来一直好奇:这些数字大脑是否也会进行人类那种“镜像模仿”的舞蹈?它们是在潜意识里模仿与他们交谈的人的语法,还是仅仅坚持自己那套机器人的风格?这个问题至关重要,因为如果 AI 开始过于完美地模仿我们,它可能会改变我们与它们互动的方式,甚至可能让我们觉得它们比实际情况更了解我们,或者甚至影响我们的信仰。

研究:语法交换实验

在这项研究中,研究员赞迪·埃伯斯塔特(Zandi Eberstadt)决定通过一个巧妙的技巧——“替换范式(substitution paradigm)”来测试这个问题。想象你有一份真实的人类对话转录文本。现在,想象有一个神奇的橡皮擦,可以擦掉其中一个人的回复,并用 AI 生成的回复来替换它。研究人员对 16 种不同的 AI 模型(从拥有 10 亿参数的小型模型到拥有 700 亿参数的庞大模型)进行了这种操作,并将它们的“替换”答案与原始的人类答案进行了对比。

目标是观察 AI 在回应人类时,是否会重复使用人类刚刚使用的特定语法“构建模块”(称为上下文无关语法规则,Context-Free Grammar rules)。为了确保 AI 不仅仅是偶然的模仿,研究人员还向 AI 输入了一个随机且无关的句子作为提示词,并检查它是否仍然会模仿该语法。

重大发现:AI 是比人类更好的镜子

结果令人惊讶,甚至带有一点幽默感。以下是研究发现:

1. AI 总是会模仿(超过随机概率)
所有 16 个 AI 模型都显示,它们重复使用人类前一句语法规则的频率,远高于重复使用随机、无关句子的频率。所以,是的,这些机器人确实在随着人类的旋律起舞。

2. “指令微调型”机器人表现出最高的总重叠度(但情况很复杂)
研究观察了两类 AI:“预训练型”(仅阅读了大量文本)和“指令微调型”(经过专门训练以遵循人类指令并进行自然对话)。“指令微调型”模型显示出最高的语法重叠量。事实上,它们重复使用人类语法的频率整体上甚至高于原始对话中的人类本身。然而,这并不是故事的全貌。研究人员发现,指令微调型模型倾向于生成更长、更复杂的回复,这自然给了它们更多的“空间”去与人类的语法重叠。当研究人员针对这种回复长度和结构的差异进行调整后,情况发生了变化。

3. 但有一个陷阱:它们模仿一切,而不只是正确的东西
这里变得棘手了。虽然指令微调型模型具有最高的总重叠度,但它们与随机句子的重叠程度也比基础模型更高。这就像一个为了讨好老师而如此热切的学生,即使老师没在看,他也会模仿老师的手写体,但同时他也会模仿地板上随机乱涂乱画的痕迹。

当研究人员根据 AI 的回答有时较长且拥有更多“空间”来模仿这一点进行调整后,情况发生了变化。基础的、预训练的模型实际上在通过“选择”来重复使用特定的语法规则方面做得更好。而指令微调型模型似乎只是把更多的词汇和结构往墙上扔,希望能有一些能粘住。它们有更高的总重叠度,但在考虑到它们说话的篇幅后,其重复特定规则的“条件性”概率反而较低。

4. “稀有词汇”效应
有趣的是,人类和 AI 都最容易模仿他们听到的稀有或不寻常的语法规则。如果一个人使用了奇怪、不常见的句子结构,AI 极有可能模仿它。这表明 AI 对局部环境非常敏感,能够捕捉到对话中独特的“风味”,就像人类一样。

5. 词汇与意义也是如此
除了语法之外,AI 模型在匹配人类的词汇和句子的整体含义方面,也比原始人类做得更好。指令微调型模型在匹配前一轮对话的意义方面表现得尤为出色,这让它们显得非常有响应性,即便它们的语法模仿带有一点“噪声”。

这意味着什么

研究结论指出,指令微调型 AI 模型在模仿人类对话方面表现得极其出色,在匹配交谈对象的语法方面往往优于人类。然而,这并不一定是因为它们在模仿方面更“聪明”;部分原因是它们经过训练,变得更具响应性并能生成更多文本,这给了它们更多重叠的机会。

研究人员谨慎地表示,虽然 AI 是一个优秀的模仿者,但我们目前还不知道它为什么会这样做。是因为它们训练的方式吗?还是仅仅为了预测下一个词而产生的副作用?我们还不确定。但有一点是明确的:这些数字对话伙伴学习人类舞步的技巧如此之高,以至于它们可能会过于热情地踩到我们的脚趾。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →