← 最新论文
💻 computer science

When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning

本文介绍了并排(SxS)交错推理框架,该框架使大型语言模型能够在生成过程中动态控制内容披露的时机,以平衡 deliberation 时间与过早承诺之间的权衡,从而在各种基准测试中提升准确性与延迟性能。

原作者: Jiaqi Wei, Xuehang Guo, Pengfei Yu, Xiang Zhang, Wanli Ouyang, Siqi Sun, Qingyun Wang, Chenyu You

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaqi Wei, Xuehang Guo, Pengfei Yu, Xiang Zhang, Wanli Ouyang, Siqi Sun, Qingyun Wang, Chenyu You

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在向一位才华横溢但极其谨慎的朋友求助,解决一个复杂的谜题。

旧方法:“沉默税”
在当前大型语言模型(LLM)的工作方式中,你的朋友必须大声思考。但这里有个陷阱:一旦他们说出一个词,那个词就公开了。他们无法收回。

  • 如果他们保持沉默以深入思考,你就只能尴尬地坐在那里等待(即“沉默税”)。
  • 如果他们为了礼貌而立即开始说话,他们可能会说错话或说出未成熟的想法。因为话已出口,他们现在就被“锁定”在这个想法上,这可能会使他们在后续更难纠正方向。他们被迫在一个不稳固的基础上继续构建,仅仅因为他们说得太早。

新想法:并排(SxS)推理
这篇论文提出了一种 AI 说话的新方式,称为并排(SxS)交错推理

这就像一场带有秘密配方的现场烹饪秀

  • “思考”模式(私密): 厨师(AI)在厨房里切菜、品尝和混合食材。你看不到这部分。这是他们的私人工作空间。
  • “说话”模式(公开): 厨师走到柜台前告诉你:“我现在要加盐了。”
  • 魔法规则: 只有当厨师已经尝过这道菜并 100% 确定加盐是正确的做法时,才被允许走出来说话。他们不会只是为了填补沉默而胡乱喊出猜测。

工作原理(“蕴含”技巧)
这篇论文教会了 AI 一条特定规则:“在思考无法支撑你即将要说的话之前,不要开口。”

  1. 训练厨师: 研究人员使用了数千个 AI 解决问题的示例。他们利用一位“监督者”(另一个 AI)来检查:“这个特定的思考步骤是否确实证明了那个特定的答案步骤?”
  2. 交错舞蹈: 他们创建了一种新的训练格式,让 AI 练习在“思考”(私密)和“说话”(公开)之间来回切换。
    • 思考: “我需要计算面积。”(私密)
    • 思考: “公式是长乘以宽。”(私密)
    • 说话: “面积是 50。”(公开,因为思考刚刚证明了这一点)。
    • 思考: “等等,让我再检查一下单位。”(私密)
    • 说话: “所以,是 50 平方米。”(公开)。

结果:两全其美
这篇论文在数学问题(AIME25)和科学问题(GPQA-Diamond)上测试了这种方法,使用了两种不同大小的 AI 模型。

  • 更快的更新: 不再需要等待 20,000 个 token(非常长的时间)才能得到最终答案,AI 现在能更早地提供经过验证的小块答案片段。这就像得到了一个真正会移动的进度条,而不是一个旋转的加载圈。
  • 无“填充”: 因为 AI 被训练为只有在拥有证据时才开口,所以它不会为了填补沉默而胡言乱语。
  • 准确率保持高位: 有时,强迫 AI 过早说话会使其变笨。但由于这种方法采用了两步训练过程(首先学习如何切换模式,然后使用强化学习确保答案仍然正确),AI 依然保持聪明。
  • “帕累托”胜利: 论文声称这创造了一种更好的平衡(一种“帕累托权衡”)。你可以在不牺牲最终答案质量的前提下,获得更快、更频繁的更新。

总结
这篇论文通过教会 AI 成为一个自信且经过验证的说话者,解决了“沉默税”问题。它允许模型在工作时保持戴上“思考帽”,只有在确认某部分解决方案是稳固时,才将其摘下以分享该部分。这使得互动感觉更快、更具响应性,而无需强迫 AI 为了填补沉默而去猜测或撒谎。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →