← 最新论文
💬 NLP

ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation

本文介绍了 ML2B,这是首个用于评估大语言模型跨语言机器学习流水线生成的基准测试,该基准测试利用涵盖 14 种语言的 490 个任务-语言对,揭示了性能退化高度依赖于任务而非遵循传统的资源层级关系。

原作者: Ekaterina Trofimova, Zosia Shamina, Maria Selifanova, Artem Zaitsev, Remi Savchuk, Maxim Minets, Daria Ozerova, Emil Sataev, Denis Zuenko, Andrey E. Ustyuzhanin

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Ekaterina Trofimova, Zosia Shamina, Maria Selifanova, Artem Zaitsev, Remi Savchuk, Maxim Minets, Daria Ozerova, Emil Sataev, Denis Zuenko, Andrey E. Ustyuzhanin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你可以通过输入一个简单的请求,比如“预测哪些客户会购买我们的新鞋”,来要求一个超级聪明的机器人为你构建一个机器学习模型。长期以来,这些被称为大语言模型(LLMs)的机器人在这方面表现得极其出色,但前提是你必须用英语与它们交流。这就像拥有一位顶尖大厨,如果你用英语提供食谱,他能烹饪出五星级的佳肴;但如果你递给他一份法语、西班牙语或日语的食谱,他可能只会盯着食材发呆,然后把厨房烧毁。

这正是研究人员正在解决的问题:随着人工智能在全球范围内的普及,我们需要知道这些“数字大厨”是否真的能够理解并执行任何语言的指令,而不仅仅是那些它们接受过大量训练的语言。但这里有一个陷 hopefully 的陷阱:如果我们只是让它们去解决互联网上已经存在的谜题,这些机器人可能会因为在训练数据中记住了答案而显得比实际更聪明。这就像给一个学生一套他们已经见过答案的数学试卷;他们拿到了 A,但我们并不知道他们是否真的理解了代数。为了获得真实的图景,我们需要一个新鲜、公平且由多种语言组成的测试。

于是有了 ML2B——由一组研究人员创建的一个全新“考试”,旨在测试这些 AI 机器人能否在指令为 14 种不同语言的情况下,构建完整的机器学习流水线。你可以把 ML2B 想象成一场大规模的多语言烹饪大赛。研究人员并没有仅仅要求机器人写一行代码,而是给了它们 35 个现实世界的挑战——比如预测房价、识别犬种或识别毒性评论——并将这些指令翻译成了包括阿拉伯语、中文、哈萨克语和乌克兰语在内的多种语言。

为了确保机器人不会通过背诵答案来作弊,团队包含了 10 个“秘密”竞赛,其解决方案从未公开。他们还构建了一个特殊的、隔离的数字厨房(网络隔离的容器),让机器人在其中编写代码。如果机器人试图从互联网上偷取现成的菜肴,或者使用了在烹饪前就混淆了食材的配方(这种问题被称为“数据泄露”),系统就会抓住它们。机器人必须遵循严格的规则,例如将“训练”阶段与“预测”阶段分开,就像真正的厨师不会在菜肴完全做熟之前就去品尝成品一样。

当研究人员对顶尖 AI 模型进行测试时,他们发现了一些挑战人们既有认知的惊人发现。他们原本预期机器人会在“低资源”语言(即数字数据较少的语言)中表现得最吃力,而在英语或法语等“高资源”语言中表现最好。但结果显示,语言本身并不是主要的“老板”。相反,难度完全取决于机器人被要求做什么。有时,机器人在“低资源”语言中的表现甚至优于英语,而有时它会在“高资源”语言中彻底失败。

这项研究表明,真正的瓶颈不仅仅是掌握词汇,而是关于遵循构建机器学习模型的复杂、分步指令。研究人员发现,机器人经常失败并不是因为它们不理解语言,而是因为它们搞砸了代码的结构——比如忘记闭合括号,或者使用了在当前软件版本中并不存在的工具。其中一个模型 GPT-4.1-mini 非常擅长提出高质量的想法,但经常无法正确完成任务;而另一个模型 GPT-OSS-120b 虽然在遵循规则方面更可靠,但有时产出的结果较为简单。

最终,ML2B 揭示了我们不能仅仅因为一个 AI 会说多种语言,就假设它在所有方面都表现出色。构建复杂工具的能力高度依赖于具体的任务本身,而不仅仅是提问时使用的语言。通过向公众开放这一新的基准测试,作者希望帮助开发者构建出不仅是多语言,而且无论被要求使用哪种语言或解决什么问题,都能真正稳健且可靠的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →