← 最新论文
💬 NLP

Entropy-Tree: Tree-Based Decoding with Entropy-Guided Exploration

该论文提出了 Entropy-Tree,一种新颖的基于树结构的解码方法,它利用熵仅在模型存在真实不确定性的点上引导分支决策,从而在推理任务中相比于随机采样和独立多重采样等现有策略,实现了更优越的准确性和校准度。

原作者: Longxuan Wei, Yubo Zhang, Zijiao Zhang, Zhihu Wang, Shiwan Zhao, Tianyu Huang, Huiting Zhao, Chenfei Liu, Shenao Zhang, Junchi Yan

发布于 2026-01-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Longxuan Wei, Yubo Zhang, Zijiao Zhang, Zhihu Wang, Shiwan Zhao, Tianyu Huang, Huiting Zhao, Chenfei Liu, Shenao Zhang, Junchi Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在要求一个非常聪明但有时过于自大的机器人去解决一个困难的数学问题或写一个复杂的故事。这个机器人并不只是进行单一的线性思考;它拥有一个巨大的、由可能出现的词汇组成的地图。

问题:机器人的两个坏习惯
目前,当机器人(大语言模型)尝试解决难题时,它们通常会采取两种方式,而这两种方式都有缺陷:

  1. “保守型”机器人(贪婪搜索/束搜索): 这个机器人总是选择最显而易见、最稳妥的下一个词。这就像一个游客,只走在拥挤的主干道上,因为觉得安全。他们很少迷路,但也永远无法发现那些隐藏的、惊人的捷径或独特的解决方案。他们会陷入枯燥、重复的回答循环中。
  2. “随机型”机器人(随机采样): 这个机器人通过完全随机地挑选词汇来尝试变得有创意。这就像一个游客,闭着眼睛原地旋转,然后朝着落下的方向走。有时他们能发现宝藏,但大多数时候,他们会在死胡同里徘徊,或者重复同样的错误。他们浪费了大量精力去探索那些无关紧要的地方。

解决方案:熵树 (Entropy-Tree)
这篇论文的作者提出了一个更聪明的引导方式。他们意识到,机器人对于它所说的每一个词,其不确定程度是不一样的。

  • “置信度计”(熵): 想象一下,机器人对它考虑的每一个词都有一个置信度计。
    • 低熵(高置信度): 机器人百分之百确定。它知道下一个词应该是“the”或“and”。这只是在填充语法。
    • 高熵(低置信度): 机器人正在犹豫。它在两个截然不同的想法之间徘徊,比如“因此 (therefore)”还是“然而 (however)”,或者是两种不同的数学方程解法。这是一个分叉路口

熵树是如何工作的:“决策分叉”策略
熵树不像是在随机到处游荡,它更像是一个聪明的向导,观察着机器人的置信度计。

  1. 确定时直行: 当机器人很有信心(低熵)时,向导就让它直接走下去。没必要浪费时间去探索。
  2. 犹豫时停下并分支: 一旦机器人遇到“分叉路口”(高熵),向导就会停下机器人。向导说:“好吧,你现在不确定。让我们同时尝试这两条路径。”
  3. 构建一棵树: 机器人现在会分裂成多个版本,从那个特定的决策点开始,每个版本尝试不同的路径。它们在到达该点之前共享相同的历史记录(节省能量),然后开始探索不同的可能性。
  4. 挑选赢家: 在结束时,向导查看所有机器人所走的路径,并选出那条通往正确答案的路径。

为什么这更好
论文声称,这种方法就像拥有一支探险队,他们只有在真正到达混乱的十字路口时才会分头行动,而不是在森林中间随机地分散开来。

  • 更高的准确性: 因为机器人将精力集中在问题的难点上(决策分叉处),它比“随机型”机器人能更频繁地找到正确答案。
  • 更好的自我意识: 论文还发现,这种方法有助于机器人知道自己何时错了。如果机器人分裂成许多不同的路径,且这些路径都导致了不同、冲突的答案,系统就会知道:“嘿,我们在这里真的很困惑。”这使得机器人的“不确定性评分”更加可靠。

简而言之
熵树是一种告诉 AI 的策略:“当你确定时,不要浪费时间猜测。但当你真正感到困惑和犹豫时,停下来,分裂你的注意力,并从那个特定的时刻尝试每一个可能的方向。”这带来了更聪明、更准确且更可靠的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →