← 最新论文
💬 NLP

Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models

该论文提出了一种基于探测大语言模型内部状态的轻量级方法,用于在测试时扩展多步推理能力,其训练的参数少于 1000 万,在数学、规划和通用问答等多个领域表现优于规模大 810 倍的现有过程奖励模型,且无需大规模人工标注。

原作者: Jingwei Ni, Ekaterina Fadeeva, Tianyi Wu, Mubashara Akhtar, Jiaheng Zhang, Elliott Ash, Markus Leippold, Timothy Baldwin, See-Kiong Ng, Artem Shelmanov, Mrinmaya Sachan

发布于 2026-04-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingwei Ni, Ekaterina Fadeeva, Tianyi Wu, Mubashara Akhtar, Jiaheng Zhang, Elliott Ash, Markus Leippold, Timothy Baldwin, See-Kiong Ng, Artem Shelmanov, Mrinmaya Sachan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 ReProbe 的新方法,旨在让大型人工智能(LLM)在解决复杂问题时变得更聪明、更可靠,同时还能大幅节省计算成本。

为了让你更容易理解,我们可以把整个过程想象成**“让一个天才学生(AI)在考试时自我检查”**。

1. 背景:天才也会犯迷糊

现在的 AI(比如 DeepSeek、Qwen 等)非常聪明,它们解决难题时,不会直接猜答案,而是会像人类一样,一步步写出“思考过程”(Chain-of-Thought)。

  • 比喻:这就好比一个学生在解数学题,它会在草稿纸上写下:“第一步,算出 A;第二步,把 A 和 B 相加……"
  • 问题:但是,这个“天才学生”有时候会在第一步就写错,或者在中间步骤逻辑混乱。一旦某一步错了,后面的所有推导都会变成错的,最后得出一个荒谬的答案。

2. 旧方法:请一位昂贵的“外聘教授”来检查

以前,为了让 AI 少犯错,研究人员会训练一个专门的“检查员”(叫做 PRM,过程奖励模型)。

  • 比喻:这就像给每个学生配了一位外聘教授。每当学生写下一行解题步骤,教授就要停下来,仔细读一遍,判断对错,然后打分。
  • 缺点
    1. 太贵了:这位“教授”本身也是一个巨大的 AI 模型,需要消耗大量的电力和昂贵的显卡(GPU)。
    2. 太慢了:学生写一步,教授读一步,整个解题过程变得非常慢。
    3. 太笨了:这位教授通常只擅长教数学,如果学生突然要写个“旅行计划”或回答“历史问题”,教授可能就懵了,因为它是专门训练来教数学的。

3. 新方法:ReProbe —— 唤醒学生的“第六感”

这篇论文提出的 ReProbe,换了一种思路。它不再请外聘教授,而是直接读取学生大脑内部的“神经信号”

  • 核心创意
    当 AI 生成每一个思考步骤时,它的大脑内部(隐藏状态、注意力机制)其实已经产生了一些微妙的信号。这些信号就像学生自己心里的“直觉”或“底气”。

    • 如果学生心里有底,信号就强(自信)。
    • 如果学生心里发虚,或者逻辑混乱,信号就会变弱或混乱。
  • ReProbe 是什么?
    它是一个极小的、轻量级的“听诊器”(只有不到 1000 万个参数,而旧方法里的“教授”有几十亿参数)。

    • 比喻:ReProbe 就像是一个随身听诊器。它不需要像教授那样去读题目、分析逻辑,它只需要把听诊器贴在学生(AI)的胸口,听听心跳(内部状态),就能判断:“嘿,这一步你好像有点心虚,可能写错了!”

4. 为什么 ReProbe 这么厉害?

  1. 极速且省钱

    • 旧方法(PRM)像是一个1.5 吨重的卡车在跑;ReProbe 像是一辆轻便的自行车
    • 论文说,ReProbe 比那些巨大的“教授”模型快得多,而且参数少了800 多倍!这意味着它可以在普通的电脑上运行,不需要昂贵的超级计算机。
  2. 不仅懂数学,还懂生活

    • 旧的“教授”通常只擅长数学题。
    • ReProbe 因为直接读取 AI 的“直觉”,所以它通吃。无论是数学题、规划旅行路线,还是回答常识问题,它都能准确判断哪一步是错的。
  3. 自我学习

    • 训练这个“听诊器”不需要人类老师一个个去批改作业。它可以让学生自己做题,然后让 AI 自己当裁判(自我监督),或者用大模型自动批改。这让训练成本极低(论文里说只花了 200 美元)。

5. 实际效果如何?

研究人员在数学、旅行规划、常识问答等多个领域进行了测试。

  • 结果:ReProbe 的表现完全能媲美甚至超过那些巨大的“教授”模型。
  • 场景
    • 考试时(测试时扩展):当 AI 遇到难题,它可以尝试写 10 种不同的解题思路。ReProbe 会迅速帮它筛选出哪条思路最靠谱,然后只保留最好的那条继续往下写。这就像在考试时,老师帮你圈出了最可能得分的那条解题路径。

总结

ReProbe 就像是给 AI 装上了一个**“自我反省的雷达”**。
它不需要请昂贵的“外聘教授”来指手画脚,而是通过监听 AI 自己大脑里的“心跳”和“信号”,就能以极低的成本、极快的速度,精准地找出思考过程中的错误。

这不仅让 AI 变得更聪明、更可靠,还让这种技术变得便宜、快速且通用,让未来的 AI 应用(比如自动驾驶、个人助理)能更高效地处理复杂任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →