← 最新论文
💻 computer science

UniCode: Augmenting Evaluation for Code Reasoning

该论文介绍了 UniCode,这是一个生成式评估框架,它通过使用多维问题增强和自动化测试,揭示了最先进的大语言模型在代码推理方面的脆弱性,从而暴露了由于依赖记忆捷径而非真正的概念推理而导致的显著性能下降。

原作者: Xinyue Zheng, Haowei Lin, Shaofei Cai, Yaodong Yang, Zilong Zheng, Yitao Liang

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyue Zheng, Haowei Lin, Shaofei Cai, Yaodong Yang, Zilong Zheng, Yitao Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何解开一个谜题。长期以来,我们测试这些机器人的方法是反复给它们完全相同的谜题。如果机器人答对了,我们就欢呼雀跃,说:“哇,它真是个天才!”但这里有一个隐蔽的问题:机器人可能并没有真的在解谜,它可能只是记住了之前见过这个谜题的答案,就像一个没有学习数学逻辑、而是死记硬背了答案解析的学生一样。这被称为“数据污染”,它让我们误以为机器人比实际情况更聪明。为了解决这个问题,科学家们正试图构建新的测试方法,通过对谜题进行微小的改动,让机器人无法通过记忆来作弊,从而迫使它真正去思考。

于是,UniCode 诞生了——这是一个超级智能的测试框架,旨在观察大型语言模型(LLM,即聊天机器人和编程助手背后的 AI 大脑)究竟是在进行真正的推理,还是仅仅在装模作样。UniCode 背后的研究人员想要知道:这些模型真的能解决新问题吗?还是它们只是依赖于记忆中的技巧? 他们构建了一个系统,可以将标准的编程问题进行自动重混(remix),创造出成千上万个从未有人见过的、新鲜且棘手的变体。

以下是他们的发现,而且这其中有一个情节转折。当他们用这些经过重混的新问题测试全球顶尖的 AI 模型时,这些模型不仅是踉跄了一下,简直是彻底崩溃了。平均而言,它们的表现大幅下降了 31.2%。事实证明,虽然这些 AI 非常擅长遵循熟悉的食谱,但一旦厨师更换了食材,它们就会溃不成军。这项研究揭示了一种被作者称为“种子问题回归”(seed-problem regression)的现象。想象一个学会了做巧克力蛋糕的机器人,如果你要求它做一个香草蛋糕,它不会去思考如何把巧克力换成香草,而是会继续尝试制作巧克力蛋糕,因为那是它记忆中的内容。同样,当 AI 面临一个编程问题的变体版本时,即使旧的逻辑对于新情况是错误的,它也往往会退回到旧的、记忆中的逻辑。

研究人员不仅发现了失败之处,还建立了一个庞大的自动化工厂来生成这些测试。他们使用了一个“压力驱动”的流水线来创建测试用例,将其与暴力破解解法(一种缓慢但 100% 正确的方法)进行比对,甚至利用其他 AI 来对正确答案进行投票。这个系统非常出色,在没有任何人工编写解法的情况下,实现了 94.5% 的正确率。他们测试了 19 个不同的顶级模型,并发现尽管有些模型表现得更好,但几乎所有模型在问题结构发生变化时都表现出了“脆弱性”。例如,如果你稍微改变规则或让问题规模变得更大,模型往往无法适应,从而暴露了它们的“推理”其实非常浅薄。

简而言之,UniCode 表明,我们目前的编程基准测试就像是一个 Boss 永远站在同一个位置的电子游戏。AI 已经学会了完美地躲避那个特定的位置。但当 UniCode 移动了 Boss 的位置、改变了它的攻击方式并扩大了竞技场时,AI 就感到困惑了。这项研究的结论是,我们不应再为那些只会记忆过去的模型而喝彩,而应致力于构建能够真正理解未来逻辑的模型。现在,这个更严苛测试的代码已经公开,邀请所有人来看看我们的 AI 朋友们还有多少路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →