想象一下,你正在尝试猜测一位天才数学家撰写的一篇极其复杂、技术性的故事的结局。这个故事充满了奇怪的符号和方程式。你能看到故事的开头,但最后几句话被幕布遮住了。
这篇论文介绍了一种新方法,用于测试计算机究竟是在“思考”这个故事,还是仅仅在随机猜测。这种方法无需人类教师来批改答案。
以下是该测试的工作原理,分解为简单部分:
1. 设置:“幕布”游戏
研究人员选取一篇真实的科学论文,并截断一个数学方程式的结尾。
- 上下文(X): 计算机看到截断之前的所有内容。
- 隐藏结局(Y): 这是我们要预测的部分。它是“答案密钥”。
- 预测(Z): 受测计算机被要求写一个关于接下来内容的“提示”或“预测”。这就像计算机在低语:“我认为接下来的部分看起来会是这样……"
2. 裁判:“概率计”
研究人员不使用人类阅读预测并说出“做得好”或“做得差”,而是使用另一个计算机程序作为裁判。
- 裁判查看隐藏结局(Y),并问道:“这作为真实结局的可能性有多大?”
- 裁判进行两次评估:
- 没有提示: 仅查看迄今为止的故事。
- 有提示: 查看故事加上计算机的预测(Z)。
如果计算机的预测很聪明,并且实际上帮助裁判理解了隐藏结局,裁判就会说:“啊,这个结局现在看起来更有意义了!”分数会上升。这种分数的增加被称为**“似然提升”**。
3. 陷阱:“上下文填充者”
研究人员担心一种诡计。如果计算机并没有真正预测未来,而只是将故事的最后几句话复制粘贴到“提示”框中,该怎么办?
- 想象一个学生参加考试。他们没有解决问题,而是直接把题目抄到了答题纸上。
- 为了识破这一点,研究人员创建了一个对照组。他们强制计算机将其“提示”空间用于粘贴故事的近期历史,而不是进行预测。
- 测试: 如果计算机的真实预测得分高于粘贴的历史,那就意味着计算机实际上在进行某种推理,而不仅仅是复制。
4. 结果:谁通过了?
研究人员测试了多种不同的 AI 模型(如 GPT-5.5、Opus 4.7 以及一个较小的“纳米”版本)。
- 大赢家: 更聪明、更强大的模型(如 GPT-5.5)能够编写预测,其帮助裁判的程度显著高于仅仅粘贴历史。即使研究人员让裁判变得非常严格(通过训练它偏爱粘贴的历史),聪明的模型仍然获胜。
- 输家: 较小、较弱的模型(如 GPT-5.4 nano)无法战胜“粘贴历史”这一诡计。它们的预测并没有帮助裁判比仅仅重读近期文本更好地理解隐藏结局。
- “推理”因素: 他们还测试了告诉 AI“更努力地思考”(使用更多计算能力)是否有帮助。他们发现,当 AI 被指示使用更多推理时,它在预测数学方面表现更好,就像一个花更多时间解决问题的学生能获得更好的成绩一样。
5. 为什么这很重要(根据论文所述)
该论文声称这是一种自动测试 AI 在数学和科学领域推理能力的新方法。
- 无需人类教师: 你不需要教授来批改每一道数学题。“概率计”会自动批改。
- 识破作弊者: 它有助于研究人员看清 AI 是在真正解决问题,还是仅仅在寻找“捷径”(如复制题目)以获得高分。
- 新基准: 它利用真实、最新的科学论文建立了一个标准测试,以观察哪些 AI 模型在技术任务上真正变得更聪明了。
简而言之: 该论文构建了一个游戏,让 AI 模型尝试猜测数学方程式的下一部分。如果它们的猜测能帮助计算机裁判比仅仅重读近期文本更好地理解答案,该 AI 就通过了。最聪明的模型通过了,较弱的模型失败了,证明该测试能够区分聪明的思考者和模仿者。
技术摘要:数学文本续写的似然评分
问题陈述
评估语言模型在技术推理方面的表现具有挑战性,因为技术续写(例如推导、证明、公式)往往存在多种大致等效的有效形式,导致逐项判断充满噪声。相反,基于原始文本的标准下一词预测会奖励表面建模(语法、符号),而非深层推理。因此,需要一种自动生成的基准测试,介于上述两极之间:既要足够丰富以实现可再生性,又要足够敏感以检测推理能力,同时不依赖人工标注或脆弱的可验证答案(如竞赛数学)。此外,人们担心用于可验证奖励强化学习(RLVR)的奖励信号可能会被模型利用捷径(例如上下文填充)“破解”,而非生成真正的预测。
方法论
本文提出了一种基于公式后缀预测的静态基准测试。
- 任务设置:预测模型接收可见上下文 X(前文文本)和显示公式的前缀。它必须生成一个辅助字符串 Z(预测)来完成该公式。
- 评分机制:一个独立的、固定的自回归语言模型(“评分器”,J)为真实的隐藏续写 Y 分配下一词似然值。核心指标是似然提升(ΔJ),定义为当评分器以 Z 为条件时 Y 的平均对数似然值,相较于仅以 X(或控制字符串)为条件时的增加量。
- 公式:ΔJ(X,Z,Y)=T1logpJ(Y∣X,Z)−T1logpJ(Y∣X)。
- 软化指标:为防止罕见且灾难性的词元不匹配(在 LaTeX/TeX 中常见)主导评分,作者使用了clipLL2。该方法在平均之前将每个词元的对数似然值从下方截断至 $-2$,确保即使预测存在少量局部错误,只要它能帮助评分器在后续恢复,该预测仍被视为有用。
- 控制与压力测试:
- 同预算上下文控制(CB):用紧邻公式之前的原始源文本替换预测 Z,使用相同的字符预算。这用于测试信号是源于预测,还是仅仅源于提供了更多上下文。
- 仅上下文 SFT 控制:评分器在“仅上下文”路径(无预测)上通过 LoRA 进行微调,然后在保留的论文上进行评估。这用于测试预测器是否通过支架提示(scaffold priming)利用评分器的权重,而非传递关于 Y 的信息。
- 真实后缀上界:一个理论上限,其中 Z 字面上包含隐藏后缀 Y。
主要贡献
- 自动化基准:一个包含 1,363 个公式后缀截断的数据集,源自 138 篇最近的 arXiv 论文(quant-ph, hep-th, math-ph),完全自动生成,未人工筛选“有利”公式。
- 跨模型评估:证明该基准测试能够区分模型家族(GPT-5.5, Opus 4.7, GPT-5.4 nano)和推理努力设置(高、中、低、无),使用固定评分器(Qwen3-8B 和 Kimi K2.6)且无需人工标签。
- 捷径漏洞审计:提供了一个严格的框架,用于测试基于似然的奖励是否容易受到非预测策略的影响。论文表明,虽然强模型(GPT-5.5)能通过微调的仅上下文控制,但弱模型(GPT-5.4 nano)不能,这表明前者的信号是真实的,而后者的信号可能是可被利用的或根本不存在的。
- 指标分析:验证了软化评分规则(clipLL2)优于原始对数似然值的使用,表明原始指标被灾难性词元错误所主导,从而掩盖了其他正确推理的效用。
结果
- 模型区分:在公式后缀基准测试上,GPT-5.5(高推理)的预测始终获得最高的似然提升,其次是 Opus 4.7,然后是 GPT-5.4 nano。这一排序在 Qwen 和 Kimi 评分器中均保持一致。
- 推理努力:在同一模型家族内,较高的推理努力设置(例如 GPT-5.5 高 > 中 > 低 > 无)通常产生更高的提升,呈现出单调梯度。然而,相邻对比(例如高 vs. 中)有时充满噪声,且在单项基础上并不总是具有统计显著性,这强化了对大量示例进行统计聚合的必要性。
- 控制表现:
- 所有预测器设置均优于同预算上下文控制。
- GPT-5.5 的预测在仅上下文 SFT 控制(最强的静态控制)之上保持了正提升,表明它们传递了关于隐藏后缀的真实信息。
- GPT-5.4 nano 的预测未能胜过仅上下文 SFT 控制,表明在此压力测试下,其信号可能与上下文填充捷径无法区分。
- 更长续写:在涉及更长混合散文/TeX 续写的更困难模式下,提升仍为正,但噪声更大,且对评分器的设计和目标长度更敏感。在此处,推理努力梯度不如在公式后缀中稳健。
意义与主张
本文将此工作定位为静态基准和诊断工具,而非成功 RL 训练的演示。其主要意义在于:
- 似然奖励的可行性:支持了以下假设:技术续写上的似然提升可以作为一种密集的、基于参考的奖励信号,与模型能力和推理努力相关联。
- 安全与鲁棒性:强调了在将奖励信号部署到 RLVR 循环之前,必须针对强静态控制(如基于 SFT 的上下文捷径)对其进行审计。GPT-5.5 能通过这些控制而 GPT-5.4 nano 不能的事实表明,并非所有的“似然提升”都是等同的;其中一些可能是模型特定怪癖或捷径的产物。
- 方法论的中间立场:它在脆弱的"LLM 作为裁判”规则(易受风格偏见影响)和简单的字符串相似度(对技术文本过于僵化)之间提供了一个中间立场,利用自回归模型的概率特性来评估预测的效用,而非其字面正确性。
作者明确指出,他们在此并未执行强化学习;目标是验证信号的特性并识别潜在的漏洞(捷径利用),这些漏洞需要在将该信号用于后训练优化之前加以解决。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。