← 最新论文
💬 NLP

STATe-of-Thoughts: Structured Action Templates for Tree-of-Thoughts

本文介绍了 STATe-of-Thoughts (STATe),这是一种可解释的推理时计算方法,它通过在离散的高层文本动作模式上进行搜索,而非依赖于词元级(token-level)的温度采样,从而提升了输出的多样性与推理控制能力。

原作者: Zachary Bamberger, Till R. Saenger, Gilad Morad, Ofra Amir, Brandon M. Stewart, Amir Feder

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zachary Bamberger, Till R. Saenger, Gilad Morad, Ofra Amir, Brandon M. Stewart, Amir Feder

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何写故事或进行说服性论证。你给它一个提示词,它就开始打字。但有时,机器人会陷入循环,重复同样枯燥的想法,或者陷入胡言乱语。为了解决这个问题,科学家们开发了“推理时计算”(Inference-Time Compute,简称 ITC)。把 ITC 想象成给机器人戴上了一顶“思考帽”,并在它开口说话之前给它额外的头脑风暴时间。与其只是猜测下一个词,不如让机器人提前规划好整个句子,甚至整个段落。

最著名的方法叫做“思维树”(Tree of Thoughts)。想象一下,机器人就像一名站在森林岔路口的徒步旅行者。它并没有直接选择一条路径并听天由命,而是想象自己走下三条不同的路径。它检查每条路径,看看哪条看起来更有希望,然后决定遵循哪条路径。这有助于机器人找到更好的答案。然而,这里有一个陷阱:通常,机器人通过掷数字骰子(一种被称为“高温度采样”的方法)来选择这些路径。这就像是要求徒步旅行者在闭着眼睛旋转后选择路径。有时他们会选到一条很棒的路径,但通常他们选出的路径看起来都非常相似,或者他们在森林中迷失了方向。机器人的最终结果会产生许多本质上都相同的答案,只是用词略有不同。

这就是一种名为 STATe-of-Thoughts(或简称 STATe)的新方法发挥作用的地方。研究人员希望给机器人一张更好的地图。STATe 不再让机器人通过“旋转圈圈”来选择路径,而是给机器人一组清晰的、带有标签的指示牌。在机器人开始行走之前,一个“控制器”会选择一个特定的策略,比如“以一个悲伤的故事开始”、“使用一个科学事实”或“比较两个不同的国家”。机器人随后遵循那个特定的指令。这就像告诉徒步旅行者:“沿着那个写着‘风景优美处’的红标牌走。”通过这种方式,机器人可以探索完全不同类型的论证或故事,而不是仅仅探索一些略有差异的相同版本。

这篇发表于 COLM 2026 会议的论文表明,这种“指示牌”方法比旧的“转轮”方法效果更好。当研究人员在创意写作任务上测试 STATe 时,机器人生成的文章不仅更加多样化(彼此之间更不同),而且质量更高。在一次论证生成测试中,他们发现只需观察机器人选择的指示牌序列,就可以预测一个论证的好坏。例如,他们发现以特定类型的例子开头,然后辅以某种类型的证据,是一种获胜的组合。

最重要的是,STATe 让我们可以理解人类为什么能做出好的论证。因为每一步都是由清晰的、人类可读的指令(如“举例说明”或“让步”)引导的,研究人员可以通过观察机器人的路径并说:“啊,它成功是因为它很早就选择使用了现实世界的例子。”这意义重大,因为它将机器人的思考过程从一个“黑匣子”变成了一个我们可以阅读、学习甚至改进的过程。该论文指出,通过使用这些结构化的动作模板,我们可以构建出不仅更聪明、更有创意,而且更容易理解和控制的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →