← 最新论文
💬 NLP

GTS: Inference-Time Scaling of Latent Reasoning with a Learnable Gaussian Thought Sampler

本文提出了高斯思维采样器(GTS),通过将潜在推理中的启发式扰动重构为可学习的条件分布采样策略,并采用 GRPO 策略优化,在保持骨干网络冻结的同时实现了比传统启发式方法更可靠、可控的推理时扩展。

原作者: Minghan Wang, Ye Bai, Thuy-Trang Vu, Ehsan Shareghi, Gholamreza Haffari

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Minghan Wang, Ye Bai, Thuy-Trang Vu, Ehsan Shareghi, Gholamreza Haffari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种让大语言模型(LLM)在“思考”时变得更聪明、更可靠的新方法。为了让你轻松理解,我们可以把大模型解决复杂问题(比如做数学题)的过程想象成一位侦探在寻找真相

1. 背景:侦探的“思考”困境

传统的做法(离散思维):
以前的模型像是一个在纸上写写画画的侦探。他每想一步,都要把想法写下来(生成文字)。因为每一步都有很多种写法,他可以通过“多试几种写法”来增加找到正确答案的概率。这就像侦探在纸上列出 10 种破案思路,然后选最好的那个。

新的做法(潜在思维/连续思维):
现在的模型进化了,它们学会了在脑子里直接思考,不写出来(这就是论文说的“潜在推理”)。这就像侦探在脑海里快速构建一个虚拟的犯罪现场,直接调整脑海中的线索。

  • 优点:速度极快,不需要把每个字都写出来。
  • 缺点:因为是在脑子里想,没有“纸面文字”作为参考,我们很难控制它“胡思乱想”的程度。

2. 旧方法的痛点:盲目地“加噪”

为了解决“脑子里想”太单一的问题,以前的研究者想了一个笨办法:给侦探的大脑加点“干扰”

  • 比喻:就像侦探在思考时,故意让他喝点酒(Dropout)或者让他听点嘈杂的白噪音(固定高斯噪声)。
  • 初衷:希望这种“微醺”或“嘈杂”能让侦探跳出思维定势,想到更多不同的破案角度。
  • 现实问题
    • 加少了:侦探还是老样子,想不出新点子(探索不足)。
    • 加多了:侦探彻底醉了,开始胡言乱语,离真相越来越远(过度探索)。
    • 核心缺陷:这种“加噪”是盲目的。就像不管侦探在思考什么,都给他喝同样剂量的酒。有时候需要微醺,有时候需要清醒,但旧方法只会“一刀切”。

3. 本文的解决方案:GTS(智能思考采样器)

这篇论文提出了一个叫 GTS (Gaussian Thought Sampler) 的新模块。我们可以把它想象成侦探身边的一位“超级副手”

这个副手是做什么的?

  1. 观察情境:当侦探(主模型)思考到某一步时,副手会立刻观察当前的案情(上下文)。
  2. 精准调控:副手不是盲目地给侦探加噪音,而是根据当前情况,决定该加多少“干扰”
    • 如果案情复杂,副手会轻轻推一把,让侦探换个角度想(适度探索)。
    • 如果案情已经很清晰,副手就保持安静,让侦探专注(避免过度发散)。
  3. 学习进化:这个副手是通过强化学习(类似训练游戏 AI)学会的。
    • 训练过程:让副手尝试不同的“推法”。如果侦探因为副手的推搡而找到了真凶,副手就受表扬(奖励);如果推偏了导致侦探迷路,副手就受批评。
    • 结果:副手学会了在什么时候、往哪个方向、用多大的力气去推,才能让侦探最有可能找到正确答案。

4. 核心发现:不是越乱越好,而是越“准”越好

论文通过实验发现了一个反直觉的结论:

  • 旧观念:只要让模型多试几次、多加点随机性,答案就会越好。
  • 新发现盲目地增加随机性(加噪)往往没用,甚至有害。 就像让侦探喝得烂醉,他不仅找不到真凶,还会把现场搞得一团糟。
  • GTS 的胜利:GTS 证明了,受控的、有目的的“探索” 才是关键。它不需要让侦探“发疯”,只需要在关键时刻轻轻点拨一下,就能让推理路径从“死胡同”转向“正确道路”。

5. 总结:从“撒胡椒面”到“精准导航”

  • 以前的方法:像是在迷雾中撒胡椒面, hoping(希望)能撒中目标。撒得越多,雾越浓,越容易迷路。
  • GTS 的方法:像是给侦探装了一个智能导航仪。它知道哪里是死胡同,哪里是捷径。它会在侦探快要走偏时,温柔地修正方向;在侦探需要灵感时,轻轻推一把。

一句话总结:
这篇论文告诉我们,让 AI 变聪明,不是靠让它“发疯”(增加随机性),而是靠给它一个聪明的向导(GTS),教它如何在思考的过程中恰到好处地探索,从而在有限的时间内找到最佳答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →