Large Language Models as Proxies for Theories of Human Linguistic Cognition
本文探讨了将当前的大型语言模型作为语言中性人类认知理论的代理,以评估语言模式习得的潜力,同时也承认它们在这一角色中的效用目前仍然相当有限。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:AI 聊天机器人是理解人类大脑的未来吗?
想象一下,语言学家(研究人类如何学习语言的科学家)正在试图解开一个谜团:为什么人类婴儿即使听到的例子并不足以让他们掌握所有复杂的规则,却依然能如此完美地学会说话?
几十年来,主流理论(我们称之为理论 A)认为:“人类天生在大脑中拥有一个特殊的、内置的‘语言芯片’。这个芯片对特定的语言规则有偏好,就像一个只能以一种方式嵌入的拼图块。”
最近,出现了一个新观点(我们称之为理论 B)。它认为:“也许我们不需要特殊的芯片。也许只要给计算机喂入足够的文本(就像婴儿听到的词汇量一样),它就能自己摸索出其中的规则。因此,目前的 AI 聊天机器人(即大语言模型或 LLur LLMs)实际上是解释人类如何学习的最佳模型。”
本文的作者说:“等等,这并不完全正确。”
他们提出了一个折中方案,称为**“代理观点”(Proxy View)。他们认为,虽然 AI 聊天机器人并不是人类大脑的完美模型,但它们可以作为一个“测试假人”或“代理”**,来代表第三种未知的理论(理论 C)。理论 C 是指一种既公平又中立的学习系统(没有特殊的“语言芯片”),但仍然能够学会语言。
本文探讨的问题是:目前的 AI 聊天机器人能否作为一个好的“测试假人”,来证明一个中立的学习系统(理论 C)确实可行?
两大测试
为了观察 AI 是否能胜任“测试假人”的角色,作者进行了两类实验。你可以把它们想象成两个不同的障碍赛道。
测试 1:“婴儿书籍”挑战(从有限数据中学习)
类比: 想象你要教一个机器人玩国际象棋,但只给它看 10 局比赛。人类儿童通过相对较少的言语输入(大约 10 年的交谈)就能学会复杂的语法。
实验: 作者在不同量的文本上训练了 AI 模型:
- 有的模型看到的文本量相当于一个 10 个月大的婴儿。
- 有的模型相当于一个 8 岁的孩子。
- 有的模型看到的文本量相当于人类在 80 万年内会听到的量(这是一个海量的数据)。
他们在一些人类能轻松解决的棘手语法谜题上测试了这些模型,例如:
- “谁”谜题: 在像 “Which book did you say that Kim hated?”(你刚才说金讨厌哪本书?)这样的句子中,理清是谁做了什么。
- “That”谜题: 知道什么时候可以省略句子中的 “that”(例如,“Who did you say loves Sue?” 是可以接受的,但 “Who did you say that loves Sue?” 对母语使用者来说听起来很奇怪)。
结果:
AI 模型表现得很糟糕。
- 即使是那些微型模型(婴儿级数据量)也搞错了。
- 至关重要的是,即使是那些巨型模型(训练了 80 万年数据的模型)仍然搞错了。 它们经常倾向于选择错误的句子版本。
这意味着: 如果一个拥有无限时间和数据的计算机都无法弄清楚这些规则,那么一个“中立”的人类学习系统(理论 C)也很可能做不到。AI 未能成功充当这种理论的“测试假人”。
测试 2:“怪异语言”挑战(学习非寻常的内容)
类比: 假设你有一个学习语言的机器人。你想知道它是否天然地更偏好“正常”语言(如英语)而非“怪异”语言(比如一种每个句子都是反向排列的语言)。
实验: 作者利用数学技巧,将真实的语言(英语、意大利语、俄语)转化成了“怪异”的版本:
- 部分反转: 将句子的一半进行反转。
- 全盘反转: 将整个句子进行反转。
- 标记跳跃: 让机器人通过计数单词来决定在哪里放置符号。
他们询问 AI:“哪个版本更容易学习?是正常的版本还是怪异的版本?”
结果:
AI 并不在意“怪异程度”。
- 有时,AI 发现怪异的、倒序的语言比正常的语言更容易学习。
- 有时,它发现正常的语言反而更难学。
这意味着: 如果 AI(我们的“测试假人”)可以像学习正常语言一样轻松地学习“怪异”语言,这表明一个中立的学习系统并不能自然地解释为什么人类只说真实的语言,而从不讲倒序的语言。AI 未能证明“真实”语言更容易学习。
结论:这个“测试假人”坏掉了
作者得出结论:“代理观点”(使用 AI 作为中立学习理论的代名词)目前行不通。
- LLM 理论(AI = 人类大脑): 这是错误的,因为 AI 缺乏特定的“人类特征”(例如,能够区分一个句子是“语法正确但极不寻常”还是“纯粹错误”)。
- 代理观点(AI = 中立理论的测试假人): 目前也失败了。AI 模型在学习人类能轻松掌握的特定规则方面表现太差,而在学习人类从不使用的“怪异”规则方面又表现得过于出色,以至于它们无法帮助我们证明一个中立的学习系统是可行的。
最终总结:
作者并不是说 AI 毫无用处。他们是说,目前的 AI 与人类大脑差异太大,无法作为研究新理论的可靠“测试假人”。
他们实际上是在告诉其他科学家:“如果你想用 AI 来证明人类可以在没有特殊‘语言芯片’的情况下学习语言,你需要先构建一个更好的 AI,或者提出一个更清晰的理论。目前的这些聊天机器人还承担不了这个任务。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。