← 最新论文
💬 NLP

Grammar Engineering Meets LLMs: Development of Cantonese and Irish ParGram Treebanks

本文详细阐述了在平行语法项目(Parallel Grammar Project)框架下粤语和爱尔兰语树库的开发过程,同时评估了多语言大语言模型在语法工程中的效用,发现虽然这些模型在提供替代分析建议方面具有有限价值,但目前仍缺乏取代专家驱动的语言学验证所需的跨语言抽象能力。

原作者: Chit-Fung Lam, Elaine Uí Dhonnchadha

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Chit-Fung Lam, Elaine Uí Dhonnchadha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图为人类思维构建一个通用翻译器,不仅是翻译词汇,更是翻译那些让句子运作的深层、隐形的规则。这就是**语法工程(grammar engineering)的世界。把它想象成一位建筑师,他不仅是在画一座房子的图纸,还在编写实际的代码,告诉机器人如何一砖一瓦地建造它,以确保屋顶不会塌陷。为了实现这一点,语言学家使用一种被称为树库(treebanks)的特殊地图。如果一个句子是一座建筑,那么树库就是一份蓝图,展示了每个单词是如何与另一个单词连接的,捕捉到了“谁对谁做了什么”。但棘手之处在于:当你试图为两种截然不同的语言——比如一种像河流一样流淌,另一种像青蛙一样跳跃的语言——构建这些蓝图时,你需要一个主计划,既能保持核心结构的一致性,又能让表层细节各异。这就是平行语法(parallel grammar)**的挑战:确保句子的“灵魂”在不同语言之间是相同的,即使它们穿的“衣服”完全不同。

现在,轮到这位新来的“街头新秀”登场了:大语言模型(LLMs)。这些是读遍了几乎整个互联网的超级智能聊天机器人。它们非常擅长预测句子中的下一个词,但它们真的能理解语法的深层架构规则吗?它们能帮助人类建筑师更快地构建这些蓝图,还是仅仅是会偶尔把门装在天花板上的华丽猜想家?这篇论文正是要探讨这个问题,研究者使用了两种非常不同的语言:粤语(一种来自华南的语言,词尾变化极少)和爱尔兰语(一种具有大量词尾变化和不同语序的凯尔特语言)。研究人员想要看看 AI 是否能在两者之间进行翻译,并绘制出正确的语法蓝图,从而充当人类专家的得力助手。

实验:作为语法学徒的 AI

研究人员使用了一个特定的 AI 模型(OpenAI 的 gpt-oss-120b)进行了一次实测,并给了它 50 个句子。这些句子就像是语法的“驾照考试”,涵盖了从简单陈述句到带有复杂关系从句和棘手动词结构的复杂句子。他们要求 AI 完成两项主要任务:

  1. 翻译: 将一个句子从粤语转为爱尔兰语,或反之亦然。
  2. 绘制蓝图: 创建一个正式的语法图谱(称为 f-structure),展示单词之间的深层关系,忽略表层顺序。

他们尝试了不同的方式:用英语提问、用目标语言提问,以及要求它同时进行翻译和绘图。

结果:才华横溢与混乱交织的混合体

研究结果有点像是在观察一个有天赋但又困惑不已的学徒。AI 有时能看到大局,但经常在细节上栽跟头。

翻译难题
在翻译方面,AI 表现得非常吃力。它就像一个掌握了词汇量但总是搞混方言的学生。

  • “普通话”混淆: 当被要求说粤语时,AI 经常滑向普通话。例如,它使用了 hǎo bàng(棒极了)而不是正确的粤语 hóu lèk。这就像是要求某人说苏格兰口音,结果他却不小心用了美国俚语。
  • “编造”的词汇: 在翻译成爱尔兰语时,AI 不仅仅是犯错,它甚至在编造单词。单词“拖拉机”(tarracóir)有时会被变成“防水布”、“强盗”、“兔子”甚至“小偷”。它似乎是根据单词的“听感”或上下文在进行猜测,而不是了解实际含义。
  • 成功率: 数据令人清醒。当被要求从爱尔兰语翻译成粤语时,只有约 22% 到 24% 的翻译在意义准确且表达自然方面达标。从粤语翻译成爱尔兰语时,情况更糟,只有 6% 到 8% 的翻译达到了标准。有趣的是,改变指令(即“提示词”)的语言并没有起到任何帮助;无论用英语还是目标语言提问,AI 的表现都同样糟糕。

绘制蓝图
在绘制语法蓝图(f-structures)方面,AI 的表现稍好一些,但仍有很长的路要走。

  • 英语很简单: 处理英语句子时,AI 获得“优秀”或“良好”评价的频率约为 46%
  • 粤语还可以: 对于粤语,它能完成正确的结构分析大约 34% 的时间。
  • 爱尔兰语很难: 对于爱尔兰语,成功率降至仅 20%。研究人员怀疑这是因为爱尔兰语拥有更复杂的词尾变化和不同的语序(动词-主语-宾语),而 AI 对此并不熟悉。
  • “共享”蓝图的挑战: 最难的任务是要求 AI 寻找粤语和爱尔兰语之间的共享深层结构。在这里,AI 几乎都失败了,粤语转爱尔兰语的尝试中有 44%,爱尔兰语转粤语的尝试中有 38% 被评为“差”。它难以在忽略表层差异的同时,抽象出共同的规则。

AI 错在哪里(以及对在哪里)

AI 并非完全没用。它确实在约 70% 的案例中捕捉到了基本的“谁做了什么”的关系,尽管细节很混乱。它有时会提出一些有趣的替代视角,这可能会激发人类语言学家的灵感。

然而,其错误也极具启发性。

  • 刻板印象: AI 假设“农民”和“司机”总是男性,即便在粤语和爱尔科语中都不需要为这些词分配性别标签。它依赖的是自身的“世界知识”而非语言规则。
  • 概念混淆: 它经常混淆不同类型的句子结构,将关系从句(如“我买的”)当作直接宾语处理,这表明它并未完全理解理论上的区别。
  • 幻觉: AI 会编造单词和含义,比如将“在河中沐浴”翻译成“溺死在河中”,完全改变了故事的原意。

总结

论文得出结论:虽然这些 AI 模型是强大的工具,但它们尚未准备好取代人类专家来构建复杂的语法。它们可以提供一个“草稿”或一个想法的线索,但不能被信任去处理细节。AI 就像一个速度很快、非常有自信的学生,读了很多书,但还没有足够的实践经验来建造一座坚固的房子。

研究人员强调,人类的专业知识仍然至关重要。AI 的输出需要由真正理解这些语言的人进行仔细的检查和验证。研究表明,在 AI 模型针对这些“资源匮乏型”语言接受更多专门的高质量数据训练之前,它们与其说是可靠的合作伙伴,不如说更像是一个奇闻轶事。实现全自动语法构建器的梦想还很遥远,但这次实验通过实践,精准地勾勒出了当前技术在何处绊到了自己的鞋带。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →