CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output Prediction
本文介绍了 CoRE,这是一个细粒度的代码推理基准,用于评估大语言模型在实现不变性和过程透明度方面的表现,结果表明当前模型往往缺乏跨等价代码实现的鲁棒性,且依赖表面执行而非真正的中间状态推理。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于CoRE论文的解读,已用通俗易懂的语言并辅以生动的类比进行翻译。
核心理念:AI 程序员真的在“思考”吗?
想象你雇佣了一位天才学生来解决一道数学题。他们写下了最终答案,并且是正确的。你给了他们一颗金星。
但随后,你要求他们解释是如何得出这个答案的。他们开始编造数字,混淆步骤,对中间过程感到困惑。然而,不知何故,他们最终还是得出了那个正确的最终数字。
问题所在: 当前对人工智能(大语言模型或 LLM)的测试就像那颗金星。它们只检查最终答案。如果 AI 输出了正确的结果,我们就假设它“理解”了代码。这篇论文的作者认为这是一个陷阱。AI 可能只是在猜测或使用捷径(启发式方法),而不是真正在其“脑海”中模拟代码的运行过程。
解决方案:CoRE(代码的“诚实测试”)
作者们创建了一个名为CoRE(代码推理)的新基准测试。CoRE 不再仅仅问“答案是什么?”,而是提出了两个更难的问题:
- 提问的方式重要吗?(实现不变性)
- 你知道中间发生了什么吗?(过程透明度)
类比 1:“同样的蛋糕,不同的食谱”(实现不变性)
想象你请一位厨师烘焙巧克力蛋糕。
- 标准测试: 你给他们一份特定的食谱(食谱 A)。他们烘焙了蛋糕。味道不错。通过。
- CoRE 测试: 你给他们四份不同的食谱,用来制作完全相同的巧克力蛋糕。
- 食谱 1:使用可可粉。
- 食谱 2:使用融化的巧克力棒。
- 食谱 3:使用不同的搅拌碗顺序。
- 食谱 4:使用不同的烤箱温度。
如果这位厨师真的是大师,无论使用哪份食谱,他们都应该能烤出完美的蛋糕。
论文的发现: AI 模型未能通过此测试。当使用看起来像它们自己通常编写的食谱(它们自己的“风格”)时,它们非常擅长烘焙蛋糕。但是,当面对由不同 AI 编写的食谱(不同的“风格”)时,它们经常出错,尽管数学逻辑完全相同。它们是“风格痴迷者”而非“逻辑痴迷者”。
类比 2:“电影导演”与“剧透者”(过程透明度)
想象你正在看电影。
- 标准测试: AI 被问到:“谁赢得了电影?”它回答:“英雄赢了。”正确!
- CoRE 测试: AI 被问到:“在第 45 分钟,当英雄躲在衣柜里时,反派手里拿着什么?在第 60 分钟,英雄的得分是多少?”
这是在检查中间状态。
论文的发现: AI 模型通常能答对“谁赢了?”这个问题,但它们幻觉了中间的细节。它们根据模式猜测结局,但实际上并没有“一步步观看”电影。它们只是在表面上执行代码,而没有真正理解这段旅程。
CoRE 是如何构建的
为了使这项测试公平且具有挑战性,研究人员主要做了两件事:
- 生成多个版本: 他们利用不同的 AI 模型为相同的 60 个问题编写代码。这创建了一个包含 255 个不同代码版本的库。有些代码冗长杂乱,有些则简短巧妙。但它们做的都是完全相同的事情。
- 创建“小测验”问题: 对于每一段代码,他们生成了关于中间过程的问题。
- 算术: “此刻这个变量里的确切数字是多少?”
- 逻辑: “这个条件是真还是假?”
- 状态: “到目前为止这个循环运行了多少次?”
- 边界: “循环刚好停止时会发生什么?”
他们的发现(结果)
他们使用这个新基准测试了 8 个最智能的可用 AI 模型(如 GPT-5、Claude、DeepSeek 等)。结果令人惊讶:
- “风格偏见”差距: 模型在理解由自己“家族”编写的代码(例如,OpenAI 模型最擅长理解 OpenAI 编写的代码)方面,远胜于理解由其他方编写的代码。这表明它们是在记忆风格,而不是学习通用的逻辑。
- “表面执行”差距: 许多模型虽然得出了最终答案,但在关于中间步骤的“小测验”中却失败了。它们是在不知道路径的情况下猜测目的地。
- "RCS"分数: 作者们创建了一个名为**推理一致性分数(Reasoning Consistency Score, RCS)**的新指标。这个分数会惩罚那些因错误原因而得出正确答案的模型。如果你答对了答案但未能通过中间步骤的测试,你的分数将降至零。
结论
该论文得出结论:仅仅得到正确的答案是不够的。 仅仅因为 AI 能够预测代码片段的最终输出,并不意味着它理解代码是如何工作的。
当前的 AI 模型就像那些背熟了剧本最后一句台词却忘记了中间对话的演员。CoRE 是一项新的测试,它迫使它们展示解题过程,证明它们实际上是在通过代码进行“思考”,而不仅仅是在猜测结局。
简而言之: CoRE 揭示出,当今最聪明的代码编写 AI 往往通过依赖模式和风格来“伪装”,而不是进行真正的、一步步的推理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。