← 最新论文
🤖 machine learning

Hard or Just Unreached? Diagnosing the Sampling Blind Spot in Math-Reasoning Difficulty Estimation

本文揭示了用于评估数学推理难度的标准 pass@k 指标存在一个显著的盲点,即大量被多次采样尝试判定为不可解的样本,实际上可以通过结合贪婪解码与激活嫁接扰动的确定性机制得以解决,这表明这些“困难”样本在结构上是可达到的,只是目前尚未被标准推理方法所暴露。

原作者: Luca Zhou, Sajel Shah, Emanuele Rodolà, Roberto Dessì

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Luca Zhou, Sajel Shah, Emanuele Rodolà, Roberto Dessì

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:是问题太难,还是我们找错了地方?

想象你正在一个巨大的、大雾弥漫的森林里寻找一件特定的隐藏宝藏。你有一支探险队(AI 模型)和一张地图。测试一件宝藏是否“难以寻找”的标准方法是派出探险队,让每一个人都尝试走一条略微不同的随机路径穿过迷雾。如果他们在尝试了几次之后都没有找到宝藏,我们就假设这个宝藏是无法找到的。

这篇论文认为我们错了。有时候,宝藏并不是无法找到;只是因为探险队过于依赖“随机运气”,导致他们看向了错误的方向。

问题所在:“随机游走”的盲点

在 AI 数学问题的世界里,研究人员使用一个名为 pass@k 的指标。

  • 运作方式: 他们让 AI 尝试解决一个数学问题 6 次(6 次尝试)。
  • 规则: 如果 AI 哪怕只有一次得到了正确答案,这个问题就是“容易的”。如果 AI 连续 6 次失败,该问题就会被标记为**“困难”**(或“不可解”)。
  • 后果: 如果一个问题被标记为“困难”,研究人员通常会将其丢弃,或者用它来训练 AI 变得更强悍。他们假设 AI 仅仅是无法做到这一点。

作者说:“等一下。仅仅因为 AI 在 6 次随机猜测中失败了,并不意味着它无法解决它。它可能只是意味着 AI 在它自己的思维中陷入了一片‘迷雾’。”

实验:确定性的侦探

为了证明这一点,研究人员并没有只是让 AI 再次进行随机尝试。他们使用了一种特殊的技巧,叫做激活嫁接(Activation Grafting)

类比:GPS 故障
想象 AI 是一个在城市中导航的司机。

  1. 随机采样(旧方法): 告诉司机,“开车去目的地,但在每个路口,通过抛硬币来决定往哪边转。”如果他们抛了 6 次硬币且每次都迷路了,我们就说:“这个目的地是无法到达的。”
  2. 新技巧(激活嫁节): 研究人员并没有改变司机的地图或汽车。相反,他们在司机开始驾驶前的某个特定时刻,轻轻地调整了司机的内部指南针。他们没有改变目的地;他们只是微调了司机内在的“方向感”。

他们尝试了 6 种不同的“微调”(比如将指南针设为零,或者指向一个随机的固定方向),然后让司机笔直且稳定地行驶(不再有硬币投掷,只有纯粹的逻辑)。

实验结果:发现隐藏的宝藏

结果令人惊讶:

  • “困难”的问题: 对于那些随机探险队连续失败 6 次的问题,经过“微调”后的直线行驶司机解决了其中的 10% 到 29%
  • 含义: 这些问题实际上并不是“不可能”的。它们只是被随机猜测的方法给遗漏了。AI 的大脑里其实拥有答案,但“尝试不同路径”的随机迷雾阻碍了它找到正确的门。

论文中的一个具体案例:
有一个关于在桌子上排列彩色盘子的数学题。

  • 随机 AI: 尝试了 6 次,被颜色搞混了,每次都给出了错误的答案。
  • 微调后的 AI: 当研究人员稍微调整了内部的“指南针”时,AI 瞬间看出了模式并正确解决了问题。
  • 结论: 问题对 AI 来说并不难;只是随机猜测法错过了解决方案。

为什么这很重要?

这篇论文警告说,由于一个“盲点”,我们目前正在丢弃有价值的数据。

  1. 浪费数据: 我们将一些问题标记为“太难”并从训练集中删除,尽管如果换一种观察方式,AI 本是可以解决它们的。
  2. 错误的训练: 如果我们只针对 AI 通过随机机会做对的问题进行训练,我们可能会教它依赖运气而非逻辑。
  3. 解决方法: 我们不需要建立一个全新的、超级聪明的 AI。我们只需要意识到,当 AI 在数学问题上失败时,它可能并不是“坏了”。它可能只是随机性测试本身出了问题,而不是数学本身的问题。

总结

这篇论文并不是说 AI 是完美的。它说的是我们的难度测试方法是有缺陷的。

把它想象成一个学生在做选择题。如果他随机猜测并全部答错,老师可能会说:“这个学生不懂这些知识。”但如果老师意识到这个学生其实是在瞎猜,而并没有真正尝试去思考逻辑,那么老师可能会意识到:“噢,这个学生其实知道答案,他只是因为在瞎猜而没能表现出来。”

作者发现,大约 五分之一 的所谓“不可解”数学问题实际上是可以解决的;AI 只是需要一种不同的推动力来找到答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →