← 最新论文
💬 NLP

RIDE: Difficulty Evolving Perturbation with Item Response Theory for Mathematical Reasoning

该论文提出了 RIDE,一个利用项目反应理论(Item Response Theory)和强化学习来系统性地生成定义良好且难度递增的数学问题的对抗性框架,通过显著的性能下降,有效地揭示了大语言模型在真实推理能力方面的有限鲁棒性。

原作者: Xinyuan Li, Murong Xu, Wenbiao Tao, Hanlun Zhu, Yike Zhao, Jipeng Zhang, Yunshi Lan

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyuan Li, Murong Xu, Wenbiao Tao, Hanlun Zhu, Yike Zhao, Jipeng Zhang, Yunshi Lan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位试图测试学生是否真正理解数学,而不仅仅是背诵答案或识别模式的老师。你有一个非常聪明的学生(一个大型语言模型,简称 LLM),他们似乎能通过你给出的每一场考试。但你怀疑他们在作弊,可能是在背诵往年考试的答案,或者仅仅是根据问题的形状在进行猜测。

为了抓住他们,你需要以一种既不会让问题失效或变得无法解决,又能迫使他们真正思考的方式来改变测试题目。这正是 RIDE 论文所提出的方法。

以下是他们解决方案的拆解,使用了简单的类比:

1. 问题所在:“伪天才”

目前的 AI 数学测试就像一场“抢凳子”游戏,凳子(问题)永远不动。AI 赢了,是因为它以前见过完全相同的凳子。如果你只是更换数字(例如,将“5 个苹果”改为“6 个苹果”),AI 往往会失败,因为它只是在匹配模式,而不是理解逻辑。更糟的是,如果你试图把问题变得太奇怪,它们就会变成没人能解开的破碎谜题,这并不能帮助你测试 AI 的真实能力。

2. 解决方案:RIDE(“难度进化”教练)

作者创建了一个名为 RIDE 的系统。把 RIDE 想象成一位大师级教练,他不仅仅是微调问题,而是让问题“进化”。它获取一个现有的数学问题,并对其进行重写,使其变得更难,但同时仍是一个有效的、可解的谜题。

3. 它是如何运作的:“机器人教室”

为了知道一个新问题是否真的变难了,你需要对其进行测试。但你并没有一百万个真人学生来尝试它。所以,RIDE 使用了一个聪明的技巧:

  • 模拟教室: 他们收集了 35 个不同的 AI 模型(从小型到大型),并将它们视为一个由 35 名学生组成的班级。
  • 成绩单 (IRT): 他们使用了一种称为项目反应理论 (Item Response Theory, IRT) 的统计方法。在教育领域,IRT 被用来根据哪些学生做对了或做错了,来判断一道测试题的难度。
    • 类比: 想象一个只有班里的天才才能做对的问题。那这就是一个“难”问题。一个全班都能做对的问题则是“易”问题。RIDE 利用这 35 个 AI “学生”来生成一份成绩单,从而科学地衡量每道题目的难度。

4. 训练:强化学习

一旦 RIDE 知道了问题的难度,它就会训练一个特殊的 AI(称为 RIDE-8B)来成为一个“问题重写者”。

  • 游戏规则: 重写者获取一个原始问题,并尝试通过重写它来增加难度。
  • 奖励机制: 系统会检查两件事:
    1. 它变难了吗?(“难度排序器”会根据模拟教室的数据给出评分)
    2. 它仍然正确吗?(一个“老师” AI 会检查新问题是否有一个有效的答案)
  • 结果: 重写者学会了创造既棘手又需要深度推理,但同时又是完全可解的问题。它学会了避免创建“破碎”的问题。

5. 证明:“击碎天才”

作者采用了著名的数学竞赛(如 AIME 和 AMC)题目,并使用 RIDE 对这些题目进行了重写。

  • 测试: 他们将这些新的、更难的问题输入到 26 个世界顶尖的 AI 模型中。
  • 结果: 这些通常得分极高的 AI 模型突然开始失败了。平均而言,它们的表现下降了 21.73%
  • 意义: 这证明了许多 AI 确实在通过记忆模式来“作弊”。当问题被进化得更难(且没有出错)时,AI 无法仅仅通过猜测来完成任务。

6. 加分项:更好的训练数据

论文还提到,这些新的、更难的问题可以被用作额外的练习材料。如果你用这些“进化后”的问题来训练 AI,它在数学推理方面实际上会变得更好,就像人类学生通过练习更难的问题变得更聪明一样。

总结

RIDE 是一个利用 AI 学生“教室”来科学衡量数学问题难度的工具。然后,它利用这些数据训练一个机器人来重写问题,使其在保持可解性的同时,变得真正更难。它揭示了哪些 AI 模型是真正聪明的,哪些只是在背诵答案,同时也为未来的 AI 训练创造了更好的练习材料。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →