← 最新论文
💬 NLP

Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs

针对现有数学基准中 LLM 推理能力评估饱和的问题,该论文提出了包含 150 个强调结构性推理问题的 ReasoningMath-Plus 基准、配套的 HCRS 评分机制及过程奖励模型,揭示了仅依赖最终答案的评估指标会高估模型真实的推理鲁棒性。

原作者: Xiang Zheng, Weiqi Zhai, Wei Wang, Boyu Yang, Wenbo Li, Ruixiang Luo, Haoxiang Sun, Yucheng Wang, Zhengze Li, Meng Wang, Yuetian Du, Guojie Lin, Yaxuan Wang, Xiaoxiao Xu, Yanhu Mo, Xuan Ren, Hu Wei, B
发布于 2026-02-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiang Zheng, Weiqi Zhai, Wei Wang, Boyu Yang, Wenbo Li, Ruixiang Luo, Haoxiang Sun, Yucheng Wang, Zhengze Li, Meng Wang, Yuetian Du, Guojie Lin, Yaxuan Wang, Xiaoxiao Xu, Yanhu Mo, Xuan Ren, Hu Wei, Bing Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的超级人工智能(LLM)做一场"深度体检",目的是看看它们到底是真的“懂”数学,还是仅仅在“背答案”或者“蒙对”了。

我们可以把这篇论文的核心内容想象成这样一个故事:

1. 现状:大家都考了满分,但真的学会了吗?

想象一下,现在的 AI 就像一群在数学考试里经常拿满分的学生。以前的考题(比如简单的算术题、套路化的应用题)太容易了,AI 只要背下解题模板,或者靠死记硬背,就能轻松拿高分。

但这带来了一个大问题:我们不知道它们是真的学会了逻辑推理,还是只是运气好蒙对了答案。就像学生做一道复杂的几何题,最后答案写对了,但中间的过程全是胡编乱造,或者第一步就错了,后面全靠猜。如果只看最终答案(Answer-only),老师就会误以为这个学生很聪明。

2. 新工具:REASONINGMATH-PLUS(“逻辑透视镜”)

为了解决这个问题,阿里巴巴和上海交通大学的研究团队发明了一套新的“考试系统”,叫 REASONINGMATH-PLUS

  • 它不是考计算速度:以前的考题像“心算 1+1",现在的考题像“侦探破案”。题目设计得非常巧妙,需要同时处理多个限制条件(比如:既要满足 A 条件,又要满足 B 条件,还要在 C 限制下找最优解)。
  • 它不看结果看过程:这套系统给每道题都配了一个"标准骨架"(Minimal Reasoning Skeleton)。这就好比老师手里有一张“寻宝地图”,上面标出了必须经过的 3-5 个关键路口(关键推理步骤)。
    • 如果 AI 的解题过程跳过了关键路口,或者走错了路,哪怕最后它奇迹般地蒙对了宝藏(答案),系统也会给它打低分。
    • 比喻:就像你走迷宫,如果最后你站在了终点,但你是穿墙过去的,或者你走错了方向最后绕了一圈回来的,这张“标准地图”会立刻指出你的路线是无效的。

3. 新评分法:HCRS(“防作弊计分器”)

传统的评分是“对就是对,错就是错”。但在这个新系统里,他们发明了一种叫 HCRS 的评分规则,它有两个很厉害的特点:

  • 早期错误惩罚(Hazard-aware):
    • 比喻:就像盖房子。如果你在打地基(第一步)时就错了,哪怕你后面把墙砌得再漂亮,这房子也是危房。HCRS 规则规定,越早期的错误,扣分越狠。因为早期的错误会导致后面所有的推理都建立在沙滩上。
    • 以前的评分可能只看最后房子盖没盖好,HCRS 会直接告诉你:“地基塌了,这房子不能住。”
  • 格式与逻辑扣分:如果 AI 啰里啰嗦、逻辑混乱,或者步骤数量不对,也会扣分。

4. 实验结果:真相大白

研究人员用这套新系统去测试了目前世界上最强的 14 款 AI 模型(包括 GPT-5、Gemini、Qwen 等)。结果非常惊人:

  • 只看答案时:很多模型看起来很强,平均分有 5.8 分(满分 10 分)。
  • 用了“逻辑透视镜”后:分数瞬间掉到了 4.36 分。
  • 发现了“幸运儿”:研究发现,有大约 6.6% 的题目,AI 的答案是对的,但推理过程完全是错的(也就是“瞎猫碰上死耗子”)。以前的考试把这些算作“优秀”,现在的新考试把它们识别为“逻辑失败”。

5. 两个“考官”:一个严谨,一个灵活

为了更准确地打分,他们用了两种方法:

  1. 严谨考官(HCRS):拿着“标准地图”(骨架)去一步步核对。这就像严格的数学老师,必须步骤完全对应。
  2. 灵活考官(PRM):这是一个经过训练的 AI 小助手,它不看标准地图,只看题目和最终答案,去判断每一步是否合理。这就像经验丰富的老教授,虽然没带地图,但能凭直觉看出逻辑通不通。

结论是:这两种方法结合,能更真实地反映 AI 的推理能力。而且,把“早期错误重罚”的规则加给那个灵活的 AI 小助手,它的判断也会变得更准。

总结

这篇论文的核心思想就是:别光看 AI 最后的答案对不对,要看它是怎么走到那一步的

就像我们评价一个厨师,不能只看他端上来的菜好不好吃(答案),还要看他切菜、炒菜的过程是否规范、逻辑是否通顺(推理过程)。如果过程全是错的,那这道菜好吃也只是运气,下次就不一定了。

这项研究给未来的 AI 发展指了一条路:真正的智能,不在于“蒙对答案”,而在于“构建严密的逻辑链条”。只有通过了这种“过程透视镜”的考验,AI 才算真正具备了可靠的数学推理能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →