← 最新论文
💬 NLP

How Robust Are LLMs to Vietnamese Dialects?

本文介绍了 VialectBench,这是首个系统性评估大语言模型在越南语方言上表现的基准测试,揭示了方言差异会导致多种任务中出现可衡量的性能下降,并证明了对标准越南语的高熟练度并不保证对保持语义不变的地域性差异具有鲁棒性。

原作者: Minh Tran, Trinh Chau, Thanh-Nhan Le, Nam Tran, Luan Thanh Nguyen, Cuong Dang, Duc Hoang

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Minh Tran, Trinh Chau, Thanh-Nhan Le, Nam Tran, Luan Thanh Nguyen, Cuong Dang, Duc Hoang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人理解人类语言。你向它展示了数百万本书籍、新闻文章和网站,它们都是用一种非常规范、像“教科书”一样的版本编写的。这个机器人变得非常擅长处理这些内容,能通过你给它的每一项测试。但问题在于,现实生活并不是教科书。人们说话并不总是使用那种“完美”的版本。他们有口音,会使用俚语,并且会根据自己是来自北方、南方还是中部地区而以不同的方式交谈。这被称为方言(Dialect)。这就像是用不同的乐器演奏同一首曲子;旋律(含义)是相同的,但声音(词汇和语法)发生了变化。

科学家们一直在构建这些巨大的语言机器人,被称为大语言模型(LLMs),以帮助我们写作、回答问题和解决问题。但有一个大问题悬在他们头上:它们真的足够聪明到可以理解所有人吗,还是它们只是非常擅长理解“标准”版本的语言?如果你用一种地方方言向机器人提问,它还能答对吗,还是会感到困惑并开始胡编乱造?这很重要,因为如果机器人只理解“完美”的版本,那么当真实的人在使用它时,它可能会失败,从而导致挫败感甚至危险的误解。


伟大的越南方言测试

一组研究人员决定让这些语言机器人接受终极测试。他们想看看这些模型能否应对越南方言中那种混乱而美丽的现实。在越南,人们说着许多不同地域色彩的语言。在首都可能意味着“什么”的一个词,在中心省份可能是完全不同的词,尽管每个人都能理解所询问的内容。

研究人员构建了一个特别的游乐场,叫做 VialectBench。把它想象成一个专门设计的障碍赛跑场,旨在绊倒那些对表达方式过于挑剔的机器人。他们从 400 个标准问题和任务开始——比如让机器人猜测某人的情绪、解决逻辑谜题或根据一个故事回答问题。然后,他们聘请了来自越南六个不同地区的语言专家,利用他们的当地方言重新编写了这些完全相同的任务。

目标很简单:保持含义完全相同,但改变词汇,听起来像当地人。例如,与其用标准的方式问“医生嘱咐我吃什么?”,中心地区的人可能会问:“Bác sĩ dặn ăn chi?”(使用一个表示“什么”的当地词)。机器人必须回答这两个版本。如果机器人在处理标准版本时表现正确,但在处理方言版本时失败了,这意味着机器人很脆弱——它很容易被口音的变化所迷惑。

结果:机器人在中间迷失了

当研究人员对十个不同的语言模型(从小型开源模型到庞大强大的 GPT-4o)进行测试时,结果是一个警钟。没有机器人是完美的。 面对方言时,每一个模型都跌跌撞撞。

平均而言,当机器人需要处理方言而不是标准越南语时,它们的表现下降了 2.82%。但这种下降在各处并不均衡。它就像机器人有一个特定的盲点。

  • “中部”问题: 最大的麻烦来自于中部方言(特别是标记为 PNT2 和 PNT3 的组别)。当机器人遇到这些方言时,它们的表现大幅下滑。PNT3 方言导致的平均降幅最大,使机器人的表现下降了 6.17%,而 PNT2 则使其下降了 4.73%
  • “北方”的惊喜: 有趣的是,北方方言 (PNB) 实际上是对机器人来说最容易处理的。事实上,对于某些模型来说,听到北方方言甚至让它们的表现略有提升(提升了 0.42%),这可能是因为机器人接受训练的标准越南语已经与北方的表达方式非常接近。
  • 南方混合: 南方方言 (PNN) 导致了约 1.81% 的平均中度下降。

它们在哪里失败了?

研究人员还观察了机器人是在哪类任务上失败的。事实证明,问答(QA) 是最脆弱的部分。当机器人需要阅读一个故事并用方言回答问题时,它们面临的挑战最大,平均性能下降超过了 5%。这表明,当问题本身是用地方方言表述时,机器人很难将问题与文本中的答案联系起来。

另一个可怕的发现是**“有害翻转”(harmful flip)**。这发生在机器人用标准越南语能答对,但在方言中却完全答错的情况下。中部方言引发了最多的这类翻转,在所有模型中的发生率为 6.54%。这就像机器人用一种声音自信地说:“我知道答案!”而在另一种声音下,它又自信地说:“答案是这个!”,而这两个答案其实是截然相反的。

这意味着什么

这项研究表明,仅仅因为一个机器人在标准越南语方面是天才,并不意味着它是全越南语的天才。研究人员发现,在标准语言上的强大表现并不能保证在区域差异下的可靠行为。

他们也排除了这些机器人天生具有“方言免疫力”的想法。即使是最聪明的模型(如表现整体最好的 GPT-4o),在引入方言后仍然显示出微小的准确率下降。研究表明,我们不能仅仅假设这些工具适用于所有人;我们需要针对人们实际说话的多样化方式对它们进行专门的测试和改进。

简而言之,这些机器人就像是那些完美背诵了旅游指南,但一旦当地人用浓重的口音指路就会迷路的游客。在教会它们倾听所有不同的声音之前,它们可能会在现实世界中持续错失目标。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →