💻 computer science
When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning
本文介绍了并排(SxS)交错推理框架,该框架使大型语言模型能够在生成过程中动态控制内容披露的时机,以平衡 deliberation 时间与过早承诺之间的权衡,从而在各种基准测试中提升准确性与延迟性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在向一位才华横溢但极其谨慎的朋友求助,解决一个复杂的谜题。
旧方法:“沉默税”
在当前大型语言模型(LLM)的工作方式中,你的朋友必须大声思考。但这里有个陷阱:一旦他们说出一个词,那个词就公开了。他们无法收回。
- 如果他们保持沉默以深入思考,你就只能尴尬地坐在那里等待(即“沉默税”)。
- 如果他们为了礼貌而立即开始说话,他们可能会说错话或说出未成熟的想法。因为话已出口,他们现在就被“锁定”在这个想法上,这可能会使他们在后续更难纠正方向。他们被迫在一个不稳固的基础上继续构建,仅仅因为他们说得太早。
新想法:并排(SxS)推理
这篇论文提出了一种 AI 说话的新方式,称为并排(SxS)交错推理。
这就像一场带有秘密配方的现场烹饪秀。
- “思考”模式(私密): 厨师(AI)在厨房里切菜、品尝和混合食材。你看不到这部分。这是他们的私人工作空间。
- “说话”模式(公开): 厨师走到柜台前告诉你:“我现在要加盐了。”
- 魔法规则: 只有当厨师已经尝过这道菜并 100% 确定加盐是正确的做法时,才被允许走出来说话。他们不会只是为了填补沉默而胡乱喊出猜测。
工作原理(“蕴含”技巧)
这篇论文教会了 AI 一条特定规则:“在思考无法支撑你即将要说的话之前,不要开口。”
- 训练厨师: 研究人员使用了数千个 AI 解决问题的示例。他们利用一位“监督者”(另一个 AI)来检查:“这个特定的思考步骤是否确实证明了那个特定的答案步骤?”
- 交错舞蹈: 他们创建了一种新的训练格式,让 AI 练习在“思考”(私密)和“说话”(公开)之间来回切换。
- 思考: “我需要计算面积。”(私密)
- 思考: “公式是长乘以宽。”(私密)
- 说话: “面积是 50。”(公开,因为思考刚刚证明了这一点)。
- 思考: “等等,让我再检查一下单位。”(私密)
- 说话: “所以,是 50 平方米。”(公开)。
结果:两全其美
这篇论文在数学问题(AIME25)和科学问题(GPQA-Diamond)上测试了这种方法,使用了两种不同大小的 AI 模型。
- 更快的更新: 不再需要等待 20,000 个 token(非常长的时间)才能得到最终答案,AI 现在能更早地提供经过验证的小块答案片段。这就像得到了一个真正会移动的进度条,而不是一个旋转的加载圈。
- 无“填充”: 因为 AI 被训练为只有在拥有证据时才开口,所以它不会为了填补沉默而胡言乱语。
- 准确率保持高位: 有时,强迫 AI 过早说话会使其变笨。但由于这种方法采用了两步训练过程(首先学习如何切换模式,然后使用强化学习确保答案仍然正确),AI 依然保持聪明。
- “帕累托”胜利: 论文声称这创造了一种更好的平衡(一种“帕累托权衡”)。你可以在不牺牲最终答案质量的前提下,获得更快、更频繁的更新。
总结
这篇论文通过教会 AI 成为一个自信且经过验证的说话者,解决了“沉默税”问题。它允许模型在工作时保持戴上“思考帽”,只有在确认某部分解决方案是稳固时,才将其摘下以分享该部分。这使得互动感觉更快、更具响应性,而无需强迫 AI 为了填补沉默而去猜测或撒谎。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。