← 最新论文
💬 NLP

Disentangling Language Roles in Multilingual LLM Task Execution

本文介绍了 MTM-Bench,这是一个采用指令、内容和回复语言完全交叉设计的受控基准,旨在证明多语言大语言模型的性能下降主要由语言所扮演的特定角色(尤其是回复语言)驱动,而非单纯由语言不匹配的数量所致。

原作者: Qishi Zhan, Minxuan Hu, Seoyeon Jang, Lei Zhao, Ziheng Chen, Man Liang, Xinyue Xiang, Jiaxin Liu, Guansu Wang, Liang He

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Qishi Zhan, Minxuan Hu, Seoyeon Jang, Lei Zhao, Ziheng Chen, Man Liang, Xinyue Xiang, Jiaxin Liu, Guansu Wang, Liang He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在聘请一位翻译来处理一项非常具体且棘手的任务。这份工作的关键不在于掌握三种语言,而在于知道在对话的哪个部分使用哪种语言

通常,当我们测试人工智能时,我们会问:“这个 AI 会说西班牙语吗?”或者“它能理解法语吗?”但在现实世界中,情况往往更加混乱。老板可能会用西班牙语发出指令,递给你一份用英语撰写的文件,却要求最终摘要用中文呈现。

这篇题为《解构多语言大语言模型任务执行中的语言角色》的论文,介绍了一种名为MTM-Bench的 AI 测试新方法。你可以将其视为一种“三重测试”,旨在隔离这三种角色,以确切查明 AI 在何处陷入混乱。

以下是他们研究发现的拆解,辅以简单的类比:

1. “三重角色”谜题

研究人员利用英语、西班牙语和中文创建了包含 2,430 种不同场景的基准测试。每个场景都是以下三者的独特组合:

  • 指令:老板说的话(例如:“总结这个”)。
  • 内容:需要阅读的材料(例如:电子邮件线程)。
  • 回复:答案必须使用的语言。

他们对 20 种不同的 AI 模型(包括最新版本的 Claude、GPT 等)进行了测试,涵盖了这三种语言的所有可能组合。

2. 重大发现:“输出槽位”是瓶颈

最惊人的发现是,语言被使用的环节比混合了多少种语言更为重要

  • 类比:想象一位厨师(AI),他非常擅长阅读英语和法语的食谱。如果你让他做一道菜,却要求他用他不熟悉的语言口述指令,他可能会把勺子掉在地上。
  • 结果:当回复语言(即 AI 必须用哪种语言书写或口述答案)与其他语言不同时,AI 的性能会显著下降。
    • 如果 AI 需要用英语回答,它表现优异。
    • 如果它需要用西班牙语中文回答,其性能会遭受重创。
    • 有趣的是,如果指令阅读材料使用了不同的语言,影响就没那么大了。AI 处理“输入”端的混乱能力远强于处理“输出”端。

3. “不匹配数量”的迷思

一个常见的假设是:“你混合的语言越多,任务就越难。”

  • 论文的声明:事实并非如此。
  • 类比:这就像穿着不匹配的袜子。
    • 场景 A:你左脚穿红袜子,右脚穿蓝袜子(一处不匹配)。
    • 场景 B:你穿了一只红袜子、一只蓝袜子,还戴了一顶绿帽子(三处不匹配)。
    • 研究人员发现,AI 在场景 A(仅输出语言错误)中的挣扎程度,与场景 B(所有语言都混乱)中一样严重。
    • 结论:一旦 AI 必须切换语言来给出答案,在指令或内容中增加更多混合语言并不会使任务显著变难。“切换”本身才是难点。

4. 不同任务,不同失败模式

该论文还表明,AI 的失败方式取决于任务类型:

  • 任务类型 A(理解反讽):AI 完美理解了含义,但未能用正确的语言写出答案。
  • 任务类型 B(查找具体事实):AI 找到了正确的事实,但未能遵守严格的格式规则(例如“只给数字,不要句子”)。
  • 任务类型 C(更新信息):AI 语言使用正确,但错过了故事中的实际更新内容。

5. 为何这很重要

以往的测试通常给 AI 一个单一分数,例如"80% 的准确率”。这篇论文认为,单一分数掩盖了真相。一个 AI 可能在理解含义方面是天才,但在说对语言方面却糟糕透顶,反之亦然。

通过分离这些角色,研究人员发现,AI 被要求使用的语言是决定其成败的单一最大因素

总结

这篇论文并没有告诉我们如何修复AI,或者如何在医院或学校中使用它。相反,它就像机械师的诊断工具。它告诉我们:“不要只看整体分数。如果你的 AI 表现不佳,请检查它是否 specifically 在它必须输出的语言上遇到困难,因为引擎正是在那里熄火的。”

该研究得出结论:要真正理解多语言 AI,我们需要停止将语言视为一个整体,转而关注每种语言在对话中扮演的具体角色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →