← 最新论文
🤖 machine learning

Likelihood scoring for continuations of mathematical text: a self-supervised benchmark with tests for shortcut vulnerabilities

本文介绍了一个自监督基准,用于评估模型生成的数学文本续写预测相较于仅含上下文的对照条件是否能提升似然分数,从而有效区分模型能力与推理努力,同时识别评分机制中潜在的捷径漏洞。

原作者: Daniel Ranard

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniel Ranard

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试猜测一位天才数学家撰写的一篇极其复杂、技术性的故事的结局。这个故事充满了奇怪的符号和方程式。你能看到故事的开头,但最后几句话被幕布遮住了。

这篇论文介绍了一种新方法,用于测试计算机究竟是在“思考”这个故事,还是仅仅在随机猜测。这种方法无需人类教师来批改答案。

以下是该测试的工作原理,分解为简单部分:

1. 设置:“幕布”游戏

研究人员选取一篇真实的科学论文,并截断一个数学方程式的结尾。

  • 上下文(X): 计算机看到截断之前的所有内容。
  • 隐藏结局(Y): 这是我们要预测的部分。它是“答案密钥”。
  • 预测(Z): 受测计算机被要求写一个关于接下来内容的“提示”或“预测”。这就像计算机在低语:“我认为接下来的部分看起来会是这样……"

2. 裁判:“概率计”

研究人员不使用人类阅读预测并说出“做得好”或“做得差”,而是使用另一个计算机程序作为裁判

  • 裁判查看隐藏结局(Y),并问道:“这作为真实结局的可能性有多大?”
  • 裁判进行两次评估:
    1. 没有提示: 仅查看迄今为止的故事。
    2. 有提示: 查看故事加上计算机的预测(Z)。

如果计算机的预测很聪明,并且实际上帮助裁判理解了隐藏结局,裁判就会说:“啊,这个结局现在看起来更有意义了!”分数会上升。这种分数的增加被称为**“似然提升”**。

3. 陷阱:“上下文填充者”

研究人员担心一种诡计。如果计算机并没有真正预测未来,而只是将故事的最后几句话复制粘贴到“提示”框中,该怎么办?

  • 想象一个学生参加考试。他们没有解决问题,而是直接把题目抄到了答题纸上。
  • 为了识破这一点,研究人员创建了一个对照组。他们强制计算机将其“提示”空间用于粘贴故事的近期历史,而不是进行预测。
  • 测试: 如果计算机的真实预测得分高于粘贴的历史,那就意味着计算机实际上在进行某种推理,而不仅仅是复制。

4. 结果:谁通过了?

研究人员测试了多种不同的 AI 模型(如 GPT-5.5、Opus 4.7 以及一个较小的“纳米”版本)。

  • 大赢家: 更聪明、更强大的模型(如 GPT-5.5)能够编写预测,其帮助裁判的程度显著高于仅仅粘贴历史。即使研究人员让裁判变得非常严格(通过训练它偏爱粘贴的历史),聪明的模型仍然获胜。
  • 输家: 较小、较弱的模型(如 GPT-5.4 nano)无法战胜“粘贴历史”这一诡计。它们的预测并没有帮助裁判比仅仅重读近期文本更好地理解隐藏结局。
  • “推理”因素: 他们还测试了告诉 AI“更努力地思考”(使用更多计算能力)是否有帮助。他们发现,当 AI 被指示使用更多推理时,它在预测数学方面表现更好,就像一个花更多时间解决问题的学生能获得更好的成绩一样。

5. 为什么这很重要(根据论文所述)

该论文声称这是一种自动测试 AI 在数学和科学领域推理能力的新方法

  • 无需人类教师: 你不需要教授来批改每一道数学题。“概率计”会自动批改。
  • 识破作弊者: 它有助于研究人员看清 AI 是在真正解决问题,还是仅仅在寻找“捷径”(如复制题目)以获得高分。
  • 新基准: 它利用真实、最新的科学论文建立了一个标准测试,以观察哪些 AI 模型在技术任务上真正变得更聪明了。

简而言之: 该论文构建了一个游戏,让 AI 模型尝试猜测数学方程式的下一部分。如果它们的猜测能帮助计算机裁判比仅仅重读近期文本更好地理解答案,该 AI 就通过了。最聪明的模型通过了,较弱的模型失败了,证明该测试能够区分聪明的思考者和模仿者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →