← 最新论文
💬 NLP

VIVID: A Culturally Grounded Benchmark Exposing the Figurative Language Gap in Vietnamese NLP

该论文介绍了 VIVID,这是首个针对越南语修辞语言的文化根植性基准测试,它揭示了当前的先进模型(包括越南语专用模型)由于过度字面化解释以及缺乏文化胜任力,在处理细微的成语和谚语时表现得非常吃力。

原作者: Tu Tran Do, Nhat Ngoc Nguyen, Khanh-Tung Tran, Hoang D. Nguyen, Tu Minh Phuong, Long Hoang Dang

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Tu Tran Do, Nhat Ngoc Nguyen, Khanh-Tung Tran, Hoang D. Nguyen, Tu Minh Phuong, Long Hoang Dang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人理解人类的笑话、讽刺和陈旧的谚语。这不仅仅是了解词义的问题,而是要理解这些词汇背后的“文化”。在计算机科学领域,这个领域被称为自然语言处理(NLP)。把 NLP 想象成连接人类语言与计算机代码之间的桥梁。长期以来,科学家们一直在为英语等大型流行语言搭建桥梁,但许多规模较小或具有丰富文化底蕴的语言却被遗留在河流的另一边。该领域的一个关键挑战是“修辞性语言”——即那些意思并非字面意思的短语。例如,如果有人说“下着猫和狗”(意指大雨滂沱),一个只知道字面定义的计算机可能会开始寻找掉落的动物!为了解决这个问题,研究人员需要特殊的测试,或者说“基准测试”,来观察他们的 AI 模型是否真的能理解文字背后的笑话或教训,而不仅仅是根据模式进行猜测。

于是有了 VIVID,这是一个由研究人员创建的新颖且色彩丰富的工具,旨在测试 AI 对越南语成语和谚语的理解能力。把 VIVID 想象成一场专门为越南语表达设计的、具有特定文化色彩的巨型“知识问答之夜”。研究人员收集了 1,636 个这类棘手的短语——其中一些是充满生活哲理的短促、有节奏感的谚语,而另一些则是无法通过逐字翻译来理解的固定成语。他们并没有只是将它们堆在一起,而是像布置博物馆展览一样对它们进行了分类,为每一个短语都贴上了“难度等级”(例如是否使用了古语、是否涉及农耕或是否依赖讽刺)和“主题”(例如爱情、批评或工作)。

随后,团队邀请了世界上最聪明的八个 AI 模型来参加这场测试。其中包括专门为越南语构建的模型,以及能够说多种语言的大型通用模型。他们要求 AI 解释这些表达方式,并猜测它们属于哪种类别。结果却是一个令人警醒的信号。即使是最先进的 AI 模型,包括著名的 GPT-4o,也表现得非常吃力。平均而言,它们的正确率不到一半。研究发现,AI 经常犯一些愚蠢的错误,比如把隐喻理解得太过于字面化(例如将一段关于水牛皮的短语误认为是关于人的性格),或者完全忽略了讽刺的语气。令人惊讶的是,给 AI 提供一些学习示例(一种被称为“少样本提示”的技术)并不总是有效;事实上,对于顶尖模型来说,这有时反而会让情况变得更糟,因为它会用错误的回答风格误导 AI。

论文指出,虽然这些 AI 模型在通用语言方面正在变得更好,但它们仍然缺乏“文化胜任力”。它们就像是能够看懂地图但并不了解当地习俗的游客。研究人员得出结论,目前的模型仍缺乏真正理解越南语修辞语言核心精髓所需的深度、细微的理解力。VIVID 现在作为一个公开工具可用,它就像一面镜子,向开发者展示他们的 AI 在哪些地方失败了,以便他们能够构建出不仅会说这种语言,而且真正理解其背后文化的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →