想象一下,你正在请一个非常聪明但有点话痨的机器人解决一道复杂的数学题。机器人并没有立刻给出答案,而是开始“大声思考”,在最终说出“答案是 2220"之前,写下了一长串思维链条。
问题在于:随着机器人思考,这个过程可能耗时 10 秒,也可能长达 10 分钟。你完全不知道它还需要多久。这就像在看一部屏幕全黑的电影,你无法判断剧情已经推进了 10% 还是 90%。你只能等待并祈祷。
本文探讨的问题是:我们能否教会机器人在实时过程中告诉我们它进行到了哪一步? 就像视频下载时的进度条,只不过这次是针对机器人的思考过程。
以下是研究人员尝试解决这一问题的方法,他们运用了简单的类比:
1. “读心”测试(隐藏状态)
首先,研究人员想知道,机器人的大脑(其内部的“隐藏状态”)是否已经知道了它进行到了哪一步,即使它没有大声说出来。
- 类比:想象机器人正穿行在一个黑暗的迷宫中。尽管它看不见出口,但它的脚步声(内部数据)或许有一种节奏,能告诉我们它离终点还有多远。
- 实验:他们构建了一个简单的“解码器”(线性探针),用来监听机器人的内部思维。
- 结果:解码器大约有 30% 的时间能猜对进度。虽然不完美,但这证明了机器人确实在其大脑中携带着某种“我已走了多远”的感觉,尽管这种感觉很模糊。
2. “进度条”训练(微调)
既然机器人已经具备了一些潜在的进度感知,研究人员决定训练它真正“大声”说出来。他们教导机器人在每完成一段思考时,插入一个类似 <progressbar> 45% </progressbar> 的小标签。
- 类比:这就像训练一名马拉松跑者,每跑一英里就停下来大喊一声“我完成了 40%!”,以便观众知道何时该欢呼。
- 挑战:如果你只是告诉机器人“说出 45%",它可能会作弊。它可能会意识到,如果在第 100 个词时说了"45%",那么基于字数统计而非真正理解数学,它在第 110 个词时就应该说"50%"。
- 解决方案:他们使用了一种“掩码”技术。在训练过程中,他们有时会隐藏机器人之前的进度报告。这迫使机器人必须查看实际的数学问题来推测进度,而不是仅仅计算它已经输入了多少个词。
3. 结果:机器人表现如何?
研究人员在数学问题上测试了这一方法。
- 最佳机器人:较大的模型(QWEN3-4B)在这方面变得相当出色。它的“进度条”平均误差仅为 16% 左右(例如,如果它说 50%,实际进度可能在 34% 到 66% 之间)。
- 对比:这比仅仅根据问题通常所需时长来猜测要好得多。
- 代价:教导机器人谈论其进度有时会让它在实际解决数学问题方面表现稍差。这是一种权衡:一个擅长告诉你它何时完成的机器人,在执行任务时可能会稍慢一些。
4. “迷雾未来”问题(模糊性)
研究人员还注意到了思考本质上的一个有趣现象。
- 类比:想象你在写一个故事。在 halfway 点时,你可能觉得“我快写完了”。但随后,你决定添加一个新角色,故事突然需要变成原来的两倍长。你的“一半”点之所以错了,是因为未来是不确定的。
- 发现:由于机器人的思考带有一定的随机性(它可能会选择不同的路径到达答案),“真实”的进度有时是模糊的。然而,更大、更聪明的机器人(QWEN3-4B)这种模糊性较小。它们的路径长度更加一致,使得它们的进度条更加可靠。
总结
该论文表明,我们可以教会 AI 模型在思考过程中为我们提供实时的“进度条”。
- 有效吗? 是的,模型学会了以合理的准确度估算进度。
- 完美吗? 不。有时机器人会猜错,因为通往答案的路径可能会改变,或者因为它只是在数词数而不是在思考。
- 为什么重要? 它帮助人类知道何时停止等待、何时期待答案,将思考的“黑盒”变成了我们可以窥探内部的东西。
研究人员总结道,虽然这项技术是可行的,但它仍然是一个不完美的水晶球,而最佳结果来自于那些不太可能改变对任务耗时看法的更大、更聪明的模型。
技术摘要:推理语言模型中的实时进度预测
问题陈述
近期的推理语言模型(Reasoning LMs),特别是那些利用长隐式思维链(CoT)的模型,已在复杂的代理任务中展现出强劲性能。然而,随着这些模型在越来越长的时间跨度上运行,其内部进展对用户而言变得不透明。这种不透明性给用户交互带来了显著挑战,特别是在期望管理和实时监督方面。用户难以确定任务需要多长时间,或模型是否正在朝着解决方案取得实质性进展。虽然先前的工作尝试强制设定固定的推理预算,但当所需预算无法仅从查询中推断时,该策略往往会失效,可能导致过早终止或给出错误答案。
本研究探讨的核心问题是:推理语言模型是否在其隐藏状态中编码了关于距离最终答案剩余计算距离的信息,以及这些信息能否被用于实时进度预测。
方法论
作者采用双管齐下的方法:对现有模型进行诊断性探测,以及通过**监督微调(SFT)**生成明确的进度报告。
1. 诊断性探测(隐藏状态分析)
为了确定进度信息是否固有地编码在模型表示中,作者在中间隐藏状态上训练了线性探针。
- 数据集:来自 OpenR1-Math 的约 25,000 条数学推理轨迹。
- 标注:基于长度为 m 的轨迹内的归一化 token 位置(k/m),将推理进度离散化为 10 个区间(0–10%、11–20%、...、91–100%)。
- 探针架构:训练了两种类型的线性探针:
- ftoken:根据当前 token 的隐藏状态预测进度区间。
- fq+token:根据当前状态与前 n=2 个 token 的隐藏状态的拼接进行预测。
- 评估:在域内数据和分布外(OOD)长轨迹(>16K tokens)上,使用 top-1 准确率和平均绝对误差(MAE)衡量性能。
2. 监督微调(显式进度报告)
作者研究了通过训练模型在 CoT 中直接输出进度百分比,是否可以通过显式监督来改进进度估计。
- 数据构建:对 OpenR1-Math 的轨迹进行增强,在段落片段后插入
<progressbar> X% </progressbar> token。进度值 ai 计算为该片段的累积 token 数相对于总轨迹长度的比例。
- 训练变体:
- 标准 SFT:使用 LoRA 和交叉熵损失对模型进行微调,并提高进度标注内 token 的权重。
- 掩码调度:为防止模型依赖标记的规律间距而非推理内容,应用了掩码调度,在训练过程中随机掩码先前的进度标注(从 0 到 0.5 的余弦调度)。
- 评估模型:DEEPSCALER-1.5B、QWEN3-0.6B 和 QWEN3-4B。
- 基线:与 token 位置基线(全局平均长度、任务平均/中位长度)以及基于先前报告进行外推的“先前标记”基线进行比较。
3. 内在歧义性分析
为了量化进度标签中的固有不确定性,作者测量了从同一部分前缀生成的多个随机延续中进度值的离散程度。
- 指标:在 r=8 次采样的延续中,实现进度值(gi,ℓ)的平均绝对偏差(MAD)和平均绝对百分比偏差(MAPD)。
关键结果
隐藏状态编码
线性探针表明,隐藏状态包含与归一化轨迹位置相关的信息,尽管该信号并非纯粹语义性的。
- 准确率:探针的准确率显著高于随机猜测(10%),最佳域内结果达到约 35.9%(QWEN3-4B,中间层)。
- 泛化能力:在 OOD 长轨迹上性能显著下降,表明在长度泛化方面存在困难。
- 解读:作者指出,这些结果仅作为“表示诊断”,而非语义进度跟踪的确凿证据,因为标签源自 token 位置(k/m)。
进度报告性能
微调后的模型成功学会了生成进度估计,其性能因模型规模和训练策略而异。
- 最佳性能:掩码 QWEN3-4B 检查点取得了最强结果,在数学推理轨迹上的 MAE 为 0.161,在分布外集合 BBEH(Big-Bench Extra Hard)上的 MAE 为 0.157。
- 掩码效应:掩码通常提高了进度预测质量(降低 MAE),但有时会导致与下游任务准确率的权衡。例如,掩码 QWEN3-4B 在数学基准测试上的宏观准确率略低于未掩码版本,但其进度估计显著更优。
- 基线比较:在数学基准测试上,最佳进度-SFT 检查点在总体上优于 token 位置基线。然而,在 BBEH 上,简单的基于长度的基线极具竞争力,这表明分布外的进度估计可能严重依赖结构规律,而非内容敏感的推理。
内在歧义性
本研究量化了随机推理中固有的“噪声”。
- 离散度:QWEN3-4B 表现出最低的展开离散度(MAD = 0.027),其次是 DEEPSCALER-1.5B(0.059)和 QWEN3-0.6B(0.065)。
- 相关性:离散度最低的模型(QWEN3-4B)也实现了最低的预测 MAE。这表明更大的模型可以通过减少剩余解决方案长度的变化,使进度标签更加稳定。
- 差距:观察到的 MAE 仍高于内在离散度(MAD),表明虽然随机性解释了部分误差,但估计算法仍有改进空间。
意义与主张
本文声称四项主要贡献:
- 实时可见性:提出了一种推理语言模型实时进度预测的框架,为解决长推理轨迹的不透明性提供了潜在方案。
- 表示证据:证明了推理模型在其内部表示中编码了与进度相关的信息,线性探针的成功即为此佐证。
- 直接集成:展示了进度报告可以通过 SFT 直接整合到生成过程中,掩码 QWEN3-4B 检查点在数学轨迹上实现了 0.161 的 MAE。
- 歧义性量化:通过测量展开离散度量化了进度标签的内在歧义性,发现更大的模型(QWEN3-4B)由于剩余解决方案长度的变化减少,能产生更稳定的进度估计。
作者保持谦逊的立场,承认进度信号通常与 token 位置和轨迹长度规律相关,而非纯粹基于语义理解。他们指出,虽然进度报告在分布外是可解析且数值对齐的,但其解释必须相对于结构控制而言。本研究仅限于三个紧凑模型,且主要涉及数学推理,预测性能在超过训练分布长度的轨迹上会下降。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。