← 最新论文
🤖 machine learning

Real-Time Progress Prediction in Reasoning Language Models

本文通过证明隐藏状态编码了进度信息且微调模型能够生成准确的进度估计,探讨了推理语言模型中实时进度预测的可行性,其中更大规模的模型因剩余解长度变化减小而表现出更高的标签稳定性。

原作者: Hans Peter Lyngsøe Raaschou-Jensen, Constanza Fierro, Anders Søgaard

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Hans Peter Lyngsøe Raaschou-Jensen, Constanza Fierro, Anders Søgaard

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在请一个非常聪明但有点话痨的机器人解决一道复杂的数学题。机器人并没有立刻给出答案,而是开始“大声思考”,在最终说出“答案是 2220"之前,写下了一长串思维链条。

问题在于:随着机器人思考,这个过程可能耗时 10 秒,也可能长达 10 分钟。你完全不知道它还需要多久。这就像在看一部屏幕全黑的电影,你无法判断剧情已经推进了 10% 还是 90%。你只能等待并祈祷。

本文探讨的问题是:我们能否教会机器人在实时过程中告诉我们它进行到了哪一步? 就像视频下载时的进度条,只不过这次是针对机器人的思考过程。

以下是研究人员尝试解决这一问题的方法,他们运用了简单的类比:

1. “读心”测试(隐藏状态)

首先,研究人员想知道,机器人的大脑(其内部的“隐藏状态”)是否已经知道了它进行到了哪一步,即使它没有大声说出来。

  • 类比:想象机器人正穿行在一个黑暗的迷宫中。尽管它看不见出口,但它的脚步声(内部数据)或许有一种节奏,能告诉我们它离终点还有多远。
  • 实验:他们构建了一个简单的“解码器”(线性探针),用来监听机器人的内部思维。
  • 结果:解码器大约有 30% 的时间能猜对进度。虽然不完美,但这证明了机器人确实在其大脑中携带着某种“我已走了多远”的感觉,尽管这种感觉很模糊。

2. “进度条”训练(微调)

既然机器人已经具备了一些潜在的进度感知,研究人员决定训练它真正“大声”说出来。他们教导机器人在每完成一段思考时,插入一个类似 <progressbar> 45% </progressbar> 的小标签。

  • 类比:这就像训练一名马拉松跑者,每跑一英里就停下来大喊一声“我完成了 40%!”,以便观众知道何时该欢呼。
  • 挑战:如果你只是告诉机器人“说出 45%",它可能会作弊。它可能会意识到,如果在第 100 个词时说了"45%",那么基于字数统计而非真正理解数学,它在第 110 个词时就应该说"50%"。
  • 解决方案:他们使用了一种“掩码”技术。在训练过程中,他们有时会隐藏机器人之前的进度报告。这迫使机器人必须查看实际的数学问题来推测进度,而不是仅仅计算它已经输入了多少个词。

3. 结果:机器人表现如何?

研究人员在数学问题上测试了这一方法。

  • 最佳机器人:较大的模型(QWEN3-4B)在这方面变得相当出色。它的“进度条”平均误差仅为 16% 左右(例如,如果它说 50%,实际进度可能在 34% 到 66% 之间)。
  • 对比:这比仅仅根据问题通常所需时长来猜测要好得多。
  • 代价:教导机器人谈论其进度有时会让它在实际解决数学问题方面表现稍差。这是一种权衡:一个擅长告诉你它何时完成的机器人,在执行任务时可能会稍慢一些。

4. “迷雾未来”问题(模糊性)

研究人员还注意到了思考本质上的一个有趣现象。

  • 类比:想象你在写一个故事。在 halfway 点时,你可能觉得“我快写完了”。但随后,你决定添加一个新角色,故事突然需要变成原来的两倍长。你的“一半”点之所以错了,是因为未来是不确定的。
  • 发现:由于机器人的思考带有一定的随机性(它可能会选择不同的路径到达答案),“真实”的进度有时是模糊的。然而,更大、更聪明的机器人(QWEN3-4B)这种模糊性较小。它们的路径长度更加一致,使得它们的进度条更加可靠。

总结

该论文表明,我们可以教会 AI 模型在思考过程中为我们提供实时的“进度条”。

  • 有效吗? 是的,模型学会了以合理的准确度估算进度。
  • 完美吗? 不。有时机器人会猜错,因为通往答案的路径可能会改变,或者因为它只是在数词数而不是在思考。
  • 为什么重要? 它帮助人类知道何时停止等待、何时期待答案,将思考的“黑盒”变成了我们可以窥探内部的东西。

研究人员总结道,虽然这项技术是可行的,但它仍然是一个不完美的水晶球,而最佳结果来自于那些不太可能改变对任务耗时看法的更大、更聪明的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →