← 最新论文
🤖 AI

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

本文介绍了 Multi-LCB,这是一个通过转换 Python 任务将 LiveCodeBench 数据集扩展至十二种编程语言的污染感知基准测试,从而能够对大语言模型的跨语言代码生成能力进行严格评估,并揭示了显著的性能差异和 Python 过拟合现象。

原作者: Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的机器人助手,它通过阅读数百万份食谱学会了烹饪。但问题在于:其中 99% 的食谱都是关于意大利面(Italian pasta)的。

当你要求它做一份完美的培根蛋酱意面时,它是个天才。它几乎每次都能做得很好。但如果你让它做一个寿司卷、一个塔可(taco)或是一道咖喱,它突然就会变得手忙脚乱。它可能会尝试在鱼肉上放意面酱,或者试图用叉子而不是筷子来吃。

这正是 Multi-LCB 的研究人员发现的——当今最先进的 AI 编程助手也存在同样的问题。

问题所在:“意大利面”偏见

一段时间以来,测试这些 AI 编程助手的金标准是一个名为 LiveCodeBench (LCB) 的基准测试。你可以把 LCB 想象成一个庞大且不断更新的编程谜题库。它很出色,因为它会不断加入新的谜题,而这些是 AI 之前没见过的,所以我们知道 AI 不仅仅是在靠死记硬背答案来“作弊”。

然而,这里有一个巨大的缺陷:LiveCodeBench 只测试 Python。 Python 就像是编程界的“意大利面”——既流行又简单。但在现实世界中,软件工程师不仅仅是在做意面;他们还在做各种各样的菜肴。他们需要用 C++ 来构建高速系统,用 Java 来开发大型商业应用,用 JavaScript 来制作网站。

核心问题在于:这个 AI 到底是真的擅长编程,还是仅仅非常擅长 Python?

解决方案:Multi-LCB(“国际自助餐”)

作者创建了 Multi-LCB,这就像是将那个同样的编程谜题库翻译成了 12 种不同的语言(包括 Python、C++、Java、Rust、Go 等等)。

他们不仅仅是要求 AI “翻译”代码。相反,他们拿走了原始的谜题(例如,“计算这些数字之和”),然后重写了指令,要求 AI 必须使用 C++ 的规则、Java 的规则、Rust 的规则来解决这个问题,以此类推。

它是如何运作的(厨房类比):

  1. 食谱: 他们从编程竞赛(如数学题)中提取一个谜题。
  2. 翻译: 他们将“测试用例”(即检查答案是否正确的方法)转换为一种通用格式。想象一下,将一个说“加入 2 杯面粉”的食谱转换为一种无论你使用量杯、克秤还是勺子都能适用的格式。这确保了 AI 测试的是其“逻辑”,而不仅仅是猜测正确格式的能力。
  3. 测试: AI 尝试用 12 种不同的语言来解决同一个谜题。
  4. 结论: 他们检查代码是否能够实际运行并解决问题,且不会崩溃。

他们的发现(“试吃”结果)

研究人员测试了 24 种不同的 AI 模型。以下是这次“试吃”揭示的结果:

  • “意大利面”过拟合: 许多在 Python 领域表现出色的模型,在其他语言面前突然变得平庸甚至糟糕。这就像是一个能做出完美千层面的厨师,却连烤面包都会烤焦。这证明了精通 Python 并不自动意味着 AI 精通通用的编程。
  • “秘密配料”泄露: 一些模型在特定语言的旧谜题上表现得好得令人怀疑。这表明这些模型可能在无意中“背诵”了其训练数据中的答案(就像一个背下了标准答案的学生),而不是真正学会了如何解决问题。
  • 难度差距: AI 发现某些语言比其他语言难得多。它们在处理一些更严格或较不常见的语言(如 Scala 或 Rust)时表现得最为吃力,就像人类使用很少使用的语言时会感到困难一样。

为什么这很重要

在这篇论文发表之前,我们认为一个通过了 Python 测试的 AI 就是一位“编程天才”。Multi-LCB 告诉我们,许多这样的“天才”实际上只是 Python 专家。

该论文得出结论:为了构建真正实用的 AI 软件工程工具,我们不能只测试它们的“意大利面”(Python),而应该开始测试它们的“全套菜单”。Multi-LCB 提供了厨房、食谱和评委,让我们能够观察哪些 AI 能够真正烹饪出一场精彩的国际盛宴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →