A conclusive remark on linguistic theorizing and language modeling
本文是作者针对《意大利语言学杂志》上对其目标论文所收到的回复所作的最终总结性评论。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇文章是意大利语言学家克里斯蒂亚诺·切西(Cristiano Chesi)对一场关于“语言学理论”与“人工智能大模型(LLM)”之间激烈争论的总结性回应。
为了让你轻松理解,我们可以把这场争论想象成**“造房子”与“装修房子”的辩论,或者“研究大脑如何思考”与“制造一台能说话的机器”**之间的区别。
以下是用通俗语言和比喻对这篇文章核心观点的解读:
1. 背景:一场关于“谁在解释语言”的争吵
最近,语言学界吵翻了天。一方是传统的生成语言学家(像切西这样的学者),他们研究人类大脑里天生就有的“语言规则”;另一方是计算语言学家,他们训练巨大的 AI 模型(如大语言模型),让机器通过阅读海量数据来学会说话。
有人问:“既然 AI 能说得比人还好,是不是意味着我们研究人类大脑语言规则的理论(生成语法)已经过时了?”
切西的回答是:“不,并没有过时。AI 很厉害,但它是在‘模仿’,而我们在‘解释’。我们需要把两者结合起来,而不是互相拆台。”
2. 核心比喻:LAD(语言习得机制)与 AI 的“黑箱”
切西提出了一个非常精彩的比喻来澄清误解:
- 人类学家的视角:当我们研究一个成年人说话时,我们不仅要看他说的话(成品),还要研究他大脑里那个**“语言习得装置”(LAD)**——就像是一个内置的、天生的“语言操作系统”,让孩子能迅速学会说话。
- AI 的视角:目前的 AI 大模型(LLM)就像是一个已经长大的成年人,它说话很流利,但它内部是怎么运作的?我们不知道。它的“大脑”是一个巨大的黑箱,里面充满了复杂的数学计算,但没有像人类那样清晰的“规则说明书”。
切西的观点:
AI 模型本身不是理论,它只是理论的一种“表现”。就像你不能把“成年人的说话能力”等同于“儿童学习语言的机制”一样。
- 错误看法:AI 成功了,所以人类大脑的“语言规则”理论错了。
- 正确看法:AI 的成功证明了某些关于语言结构的直觉(比如语言有深层结构)可能是对的。我们需要去研究 AI 的架构(它的“骨架”),看看它是否无意中模仿了人类大脑的“语言习得机制”。
3. 三大争论点(切西的“三剑客”)
切西总结了反对 AI 的学者们提出的三个主要担忧,并一一进行了回应:
A. “缺乏解释力” (The Lack of Explanation)
- 担忧:AI 能猜出下一个词是什么,但它不知道为什么。它像个只会背书的鹦鹉,没有“理解”。
- 切西的比喻:这就像**“压缩文件”**。
- 如果我们要解释语言,我们需要一个**“最精简的压缩包”**(理论)。
- 好的理论应该像 Zip 压缩一样,用极少的规则(代码)就能解释海量的语言现象。
- AI 虽然能生成句子,但它的“压缩包”太大了(参数太多),而且我们不知道它是怎么压缩的。
- 结论:我们需要把 AI 的“黑箱”打开,看看能不能用人类语言学的规则(比如“合并”操作)来简化它,让它变得“可解释”。
B. “缺乏形式化” (The Lack of Formalization)
- 担忧:语言学家太依赖直觉,不够严谨,不像计算机那样有精确的代码。
- 切西的比喻:这就像**“建筑师的手绘草图”与“施工图纸”**。
- 语言学家先有“草图”(直觉),这很重要,能指引方向。
- 但如果只停留在草图,房子盖不起来。我们需要把草图变成精确的“施工图纸”(形式化模型)。
- 结论:语言学家需要学习编程,或者和程序员合作,把那些模糊的直觉变成可运行的代码。不能因为“还没画完图纸”就否定“草图”的价值。
C. “目标不同” (Divergent Goals)
- 担忧:AI 是为了赚钱(做翻译、聊天机器人),不在乎人类大脑是怎么工作的;语言学家是为了探索人类认知的奥秘。
- 切西的比喻:这就像**“赛车手”与“汽车工程师”**。
- AI 公司(赛车手):只在乎车跑得有多快,能不能赢比赛(任务完成得好)。他们不在乎引擎内部是不是符合物理定律。
- 语言学家(工程师):在乎引擎(大脑)是怎么设计的,为什么它能跑这么快。
- 结论:虽然目标不同,但赛车手跑得快,说明引擎设计(语言结构)可能确实有效。语言学家应该利用 AI 这个“超级赛车”来测试自己的“引擎设计理论”是否站得住脚。
4. 切西的终极建议:我们要“握手言和”
切西认为,现在的局面不是“你死我活”,而是**“互补”**:
- 不要排斥技术:生成语言学家(研究人类大脑的)不能因为怕麻烦就拒绝使用计算机工具。
- 不要盲目崇拜数据:计算机科学家不能只盯着数据量,而忽略了人类语言中那些精妙的、天生的规则。
- 建立“共同语言”:
- 语言学家需要把他们的理论变成**“开源代码”**(像 GitHub 上的项目一样),让程序员能测试。
- 程序员需要把他们的模型变成**“可解释的模型”**,让语言学家能看懂。
总结:这不仅仅是吵架,这是进化
切西最后说,这场争论不是要终结“生成语言学”,而是它的**“青春期”**。
- 以前:语言学家在纸上写写画画,靠直觉猜规则。
- 现在:我们需要把这些规则放进计算机里跑一跑,看看在真实的数据面前,这些规则是不是真的行得通。
一句话总结:
AI 是一面巨大的镜子,它照出了人类语言的神奇,但也暴露了我们理论中的模糊之处。语言学家不应该害怕这面镜子,而应该拿着它,去打磨自己手中的“语言地图”,让它变得更精准、更清晰。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。