← 最新论文
💬 NLP

How Useful are LLMs for Grammar Engineering? Cantonese ParGram Resources and Controlled Experimental Evaluation with English Baselines

本文介绍了新的粤语 ParGram 资源,并进行了一项受控评估,结果表明虽然先进的大语言模型可以生成局部合理的语法组件,但它们在处理复杂的形式约束方面表现不佳,这表明人类的语言学专业知识对于语法工程仍然至关重要。

原作者: Chit-Fung Lam

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Chit-Fung Lam

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

语言是一个鲜活且不断演进的存在,但为了教会计算机理解它,语言学家通常必须先构建一个僵硬的骨架。这一领域被称为语法工程,涉及编写详细的规则手册,描述单词如何组合在一起以形成意义。不要将这些规则手册仅仅视为正确的句子列表,而应将其视为复杂的说明书,指导机器如何将一个句子分解为其功能部分,识别出谁在对谁做什么,以及这些角色在不同语言之间是如何连接的。几十年来,创建这些手册一直是一个缓慢且艰苦的过程,需要深厚的人类专业知识,因为工程师必须手动编码每一个句子结构的微妙逻辑。最近,一种新的工具进入了工作坊:大语言模型,即那些能够撰写文章或回答问题的强大人工智能系统。语言学家面临的一个重大问题是,这些人工智能系统是否真的能帮助构建那些教导计算机理解语言所需的复杂规则手册,还是说它们对于如此精密的工作而言过于容易出错。

一位研究人员着手测试这个问题,使用的是粤语——一种广泛使用的语言,在历史上缺乏像英语那样详尽的数字资源。他们创建了一套全新的高质量参考材料,本质上是正确句子结构及其底层逻辑关系的“金标准”,用作基准。在建立好这一基础后,他们进行了一系列受控实验,以观察两种不同的人工智能模型是否能够从零开始生成必要的语法规则。研究人员并没有要求人工智能仅仅进行文本翻译;相反,他们要求它扮演语法工程师的角色,生成使计算机能够正确解析句子的特定技术组件。他们在不同的条件下测试了这些模型:有时只给它们一个原始句子,有时则在给出原始句子的同时,还给出它们应该达到的正确逻辑结构。他们还改变了难度,要求人工智能处理单一类型的句子,或是处理相互作用的复杂相关句子组。

结果揭示了一个清晰的能力等级制度。更先进的人工智能模型表现得更为出色,持续优于另一种模型,生成的语法规则更有可能正确且有用。然而,提示方法与模型本身同样重要。当研究人员在提供句子的同时,也提供了目标逻辑结构时,生成出的语法规则明显优于人工智能仅凭句子自行推测结构的情况。这表明,虽然人工智能可以识别模式,但在没有明确引导的情况下,它很难推导出语言深层且隐形的逻辑。即使是表现最好的模型,在面对同时处理多种不同类型句子的挑战时,也开始显得力不从心。它经常能生成表面上看起来正确的规则,但当这些规则必须协同工作来分析一个复杂句子时,就会失效。人工智能经常会忽略语法不同部分之间的微妙联系,例如句子中某一特定单词如何逻辑上必须与另一部分的特定角色相匹配。

研究结论认为,这些人工智能系统尚未准备好在构建这些复杂语言系统方面取代人类语言学家。它们无法独立地从一系列句子中创建出一个稳健、可运行的语法。相反,它们最有用的角色似乎是作为辅助助手。研究建议了一种工作流程:人工智能可以生成逻辑结构或规则候选方案的初稿,随后由人类专家进行审查、纠正和完善。在这种协作关系中,人工智能负责处理生成可能性的繁重工作,而人类则提供确保最终系统逻辑严密且准确所需的批判性判断。研究结果证实,尽管人工智能可以加速过程的部分环节,但构建可靠语法引擎所需的深层结构化理解,仍然牢牢属于人类专业知识的范畴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →