于是,UniCode 诞生了——这是一个超级智能的测试框架,旨在观察大型语言模型(LLM,即聊天机器人和编程助手背后的 AI 大脑)究竟是在进行真正的推理,还是仅仅在装模作样。UniCode 背后的研究人员想要知道:这些模型真的能解决新问题吗?还是它们只是依赖于记忆中的技巧? 他们构建了一个系统,可以将标准的编程问题进行自动重混(remix),创造出成千上万个从未有人见过的、新鲜且棘手的变体。
以下是他们的发现,而且这其中有一个情节转折。当他们用这些经过重混的新问题测试全球顶尖的 AI 模型时,这些模型不仅是踉跄了一下,简直是彻底崩溃了。平均而言,它们的表现大幅下降了 31.2%。事实证明,虽然这些 AI 非常擅长遵循熟悉的食谱,但一旦厨师更换了食材,它们就会溃不成军。这项研究揭示了一种被作者称为“种子问题回归”(seed-problem regression)的现象。想象一个学会了做巧克力蛋糕的机器人,如果你要求它做一个香草蛋糕,它不会去思考如何把巧克力换成香草,而是会继续尝试制作巧克力蛋糕,因为那是它记忆中的内容。同样,当 AI 面临一个编程问题的变体版本时,即使旧的逻辑对于新情况是错误的,它也往往会退回到旧的、记忆中的逻辑。
研究人员不仅发现了失败之处,还建立了一个庞大的自动化工厂来生成这些测试。他们使用了一个“压力驱动”的流水线来创建测试用例,将其与暴力破解解法(一种缓慢但 100% 正确的方法)进行比对,甚至利用其他 AI 来对正确答案进行投票。这个系统非常出色,在没有任何人工编写解法的情况下,实现了 94.5% 的正确率。他们测试了 19 个不同的顶级模型,并发现尽管有些模型表现得更好,但几乎所有模型在问题结构发生变化时都表现出了“脆弱性”。例如,如果你稍微改变规则或让问题规模变得更大,模型往往无法适应,从而暴露了它们的“推理”其实非常浅薄。
简而言之,UniCode 表明,我们目前的编程基准测试就像是一个 Boss 永远站在同一个位置的电子游戏。AI 已经学会了完美地躲避那个特定的位置。但当 UniCode 移动了 Boss 的位置、改变了它的攻击方式并扩大了竞技场时,AI 就感到困惑了。这项研究的结论是,我们不应再为那些只会记忆过去的模型而喝彩,而应致力于构建能够真正理解未来逻辑的模型。现在,这个更严苛测试的代码已经公开,邀请所有人来看看我们的 AI 朋友们还有多少路要走。