← 最新论文
💬 NLP

\textit{Versteasch du mi?} Computational and Socio-Linguistic Perspectives on GenAI, LLMs, and Non-Standard Language

本文结合计算语言学与批判社会语言学视角,以南蒂罗尔方言和库尔德语变体为例,探讨生成式人工智能如何既能从技术层面处理非标准语言,又能通过民主与去殖民化策略促进语言多样性并缩小数字语言鸿沟。

原作者: Verena Platzgummer, John McCrae, Sina Ahmadi

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Verena Platzgummer, John McCrae, Sina Ahmadi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的人工智能(AI)照一面“语言公平”的镜子

简单来说,作者们(来自爱尔兰和瑞士的学者)发现:现在的超级 AI(比如大语言模型 LLMs)虽然很聪明,但它们其实有点“势利眼”。它们只喜欢听“标准普通话”(比如标准英语、标准德语),而看不起那些“方言”或“非标准语言”(比如南蒂罗尔的德语方言,或者库尔德语的各个分支)。

为了让你更容易理解,我们可以把这篇论文的核心观点拆解成几个生动的比喻:

1. AI 是个“势利的翻译官”:只懂标准语,不懂“土话”

想象一下,你走进一家高科技餐厅,点菜时用的是你家乡最地道的方言。

  • 标准语言(如标准英语):就像菜单上印得清清楚楚的“法式大餐”,AI 厨师能立刻听懂,做得又快又好,还便宜。
  • 非标准语言(如方言、库尔德语变体):就像你点的“家乡土菜”。AI 厨师根本听不懂,或者为了听懂,它得把你的一句话拆成无数个碎片(在技术这叫“分词”),然后一个个去猜。
    • 后果:这就像你点菜不仅要花更多钱(“分词税”),而且厨师做出来的菜味道还变了,甚至最后它直接告诉你:“抱歉,我只做标准菜,你的方言我不懂。”
    • 现实影响:如果你用方言问 AI 问题,它要么答非所问,要么直接把你排除在数字世界的大门之外。

2. 为什么 AI 会“势利”?因为它的“食谱”有问题

作者指出,AI 的“食谱”(训练数据)本身就是有偏见的。

  • 历史遗留问题:过去几百年,很多国家为了建立民族国家,强行推行“标准语”,打压方言。这导致世界上大部分书面资料(书、报纸、法律)都是标准语写的。
  • AI 的“挑食”:AI 是通过吃这些书面资料长大的。它没怎么吃过“方言”这口饭,所以它觉得方言是“噪音”,是“错误”,而不是语言的一种自然形态。
  • 恶性循环:因为 AI 不懂方言,大家就不敢用方言跟 AI 说话;因为没人跟 AI 说方言,AI 就更学不会。这就形成了一个死循环。

3. 两个真实的“受害者”案例

论文里举了两个具体的例子,就像两个被遗忘在角落的孩子:

  • 案例一:南蒂罗尔的德语方言(意大利北部)

    • 情况:这里的人日常聊天、发微信都用这种方言,但在学校才说标准德语。
    • 困境:在 AI 的世界里,这种方言甚至没有自己的“身份证号码”(ISO 代码)。AI 把它当成“巴伐利亚方言”的一部分,根本分不清。所以,当你用这种方言跟 AI 说话时,AI 要么听不懂,要么强行把它翻译成标准德语,完全忽略了你的真实表达。
  • 案例二:库尔德语的各种变体

    • 情况:库尔德语有 4000 多万使用者,但它被分裂成好几种写法(有的用拉丁字母,有的用阿拉伯字母),而且历史上长期被禁止在公共场合使用。
    • 困境:只有两种主要的库尔德语(索拉尼和库曼吉)稍微有点“资源”,其他的变体(如南库尔德语、扎扎基语)在 AI 眼里几乎是“隐形人”。它们没有足够的教材(数据),没有专门的 AI 模型,甚至连测试 AI 懂不懂它们的“考试”都没有。这就像是一个大家庭里,只有几个孩子有书读,其他孩子被彻底遗忘了。

4. 怎么解决?不能只靠“修修补补”

作者认为,光靠技术升级(比如让 AI 多学点数据)是不够的,这就像给一辆破车换轮胎,但路本身是坏的。我们需要从社会和政治层面解决:

  • 给大公司施压(Big Tech Accountability)
    就像要求餐厅老板公开“我们服务了多少种方言”一样,要求 AI 公司报告它们的模型在方言上的表现差距。如果做得不好,就要承担社会责任。
  • 把话语权还给社区(Linguistic Agency)
    不要由科学家或大公司决定怎么教 AI,而要让说方言的人自己来当“数据管家”。就像“关于我们的事,必须有我们在场”(Nothing about us without us)。让社区自己收集数据,告诉 AI 什么是对的,什么是错的。
  • 跨学科合作
    让懂技术的工程师和懂社会语言学的专家坐在一起。工程师负责造机器,社会语言学家负责告诉机器“语言是活的,不是死板的规则”,防止 AI 把方言强行“标准化”从而抹杀文化特色。

总结

这篇论文的核心思想是:AI 不应该只是用来消灭差异、统一标准的工具,而应该成为保护语言多样性的盾牌。

如果我们要让 AI 真正服务于全人类,就不能只让它说“标准普通话”,而必须让它学会听懂、尊重并欣赏世界各地的“乡音”。否则,数字时代的鸿沟会越来越深,那些说方言的人将被彻底甩在数字文明的列车之外。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →