← 最新论文
💬 NLP

The Path of Least Resistance: Guiding LLM Reasoning Trajectories with Prefix Consensus

该论文介绍了 PoLR,这是一种计算高效的推理时方法,通过对推理前缀进行聚类来识别并仅扩展最有希望的路径,从而在无需模型微调的情况下,在显著降低 Token 使用量和延迟的同时,达到与 Self-Consistency 相当的准确度。

原作者: Ishan Jindal, Sai Prashanth Akuthota, Jayant Taneja, Sachin Dev Sharma

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Ishan Jindal, Sai Prashanth Akuthota, Jayant Taneja, Sachin Dev Sharma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《最小阻力路径》(The Path of Least Resistance,简称 PoLR)的解释,已将其转化为通俗易懂的语言并辅以创意类比。

问题所在:让一群人去解谜题

想象你有一个非常聪明但有时会犯糊涂的朋友(AI),你让他解决一道很难的数学题。为了得到正确答案,你决定让他把这道题解 50 遍(这被称为“自我一致性”,Self-Consistency)。然后你观察这 50 个答案,并选择大多数人达成共识的那一个。

这通常效果很好,但它非常浪费

  • 浪费之处: 即使你的朋友在写第一句话时就已经完全走错了方向,你仍然强迫他一直写下去,直到完成整篇 50 页的长文。
  • 代价: 这需要耗费大量的时间和计算资源(Token/字符),因为你生成了许多完整的长篇大论,尽管其中很多从一开始注定就会失败。

解决方案:“最小阻力路径”(PoLR)

作者提出了一种名为 PoLR 的新方法。他们建议不要让你的朋友写 50 篇完整的文章,而是采用一种更聪明、更快速的方法:

  1. “第一句话”测试: 让你的朋友写下解题过程的前几句话(即“前缀”),重复 50 次。
  2. 分组: 观察这 50 个简短的开头。你会注意到,大多数人的开头都是一样的(例如:“首先,我需要找到 X……”)。但也有一部分人可能起步很奇怪(例如:“首先,我要吃个三明治……”)。
  3. 过滤: 将这 50 个开头分成若干个“簇”(Clusters)。你会发现一个大的群体,大家对第一步达成了共识;而会有一些极小的群体,显示出他们很困惑。
  4. 决策: 你完全忽略那些极小的、困惑的群体。你只要求你的朋友为那个最大的、占主导地位的群体完成后续的完整写作。
  5. 结果: 你仍然能通过多数投票获得最终答案,但你节省了大量的精力和时间,因为你没有在错误的思路上浪费精力。

核心类比:徒步路径

想象你正在带领 50 名徒步旅行者爬山,去寻找一个隐藏的宝藏(正确答案)。

  • 旧方法(自我一致性): 你派 50 名徒步者上山。有些人走对了路,但其中 20 人不小心走进了沼泽。你却强迫这 2 0人一直走到沼泽底部,让他们陷进去,然后再让他们转头回来,仅仅是为了统计他们的最终位置。这既累又慢。
  • PoLR 方法: 你派 50 名徒步者上山,但只让他们走 100 米
    • 你从直升机上向下俯瞰。你看到 40 人在主干道上,而 10 人正朝着树林深处乱走。
    • 你对那 10 个乱走的人说:“停下!回家吧。”
    • 你只让那 40 名在主干道上的徒步者继续向顶峰前进。
    • 结果: 你依然能找到宝藏(正确答案),可靠性与之前一样,但你节省了 10 名徒步者的体力,而且到达的速度更快。

为什么这行得通?

论文认为,思维过程的开端揭示了结局。

  • 如果 AI 要得出正确答案,它通常会从正确的逻辑开始。
  • 如果它要出错,它通常会从错误的假设开始。
  • 通过检查前几步的“共识”,AI 可以预测哪些路径值得完成,哪些是死胡同。

论文的关键发现

  • 速度与节省: PoLR 将计算工作量(Token)减少了高达 60%,并将等待时间(延迟)缩短了高达 50%
  • 准确度: 它不会让 AI 变笨。事实上,在许多测试中,它的准确度与旧方法不相上下,有时甚至更高,因为它及早过滤掉了“嘈杂”或混乱的路径。
  • 无需训练: 你不需要重新教 AI 任何东西。它是一个“即插即用”的升级版,适用于现有的模型。
  • 兼容性: 它可以与其他聪明的方法(比如如果答案已经显而易见就提前停止)结合使用,从而变得更快。

“秘密武器”:聚类

论文提到,他们使用了一种叫做聚类(Clustering)的简单数学技巧来对简短的开头进行分组。他们发现,即使是使用一种非常简单、轻量级的单词分组方式(比如统计单词出现的频率),其效果也和使用复杂的、沉重的 AI 模型一样好。这就像是通过观察邮件的颜色来分类,而不是通过阅读每一封信的内容来决定它属于哪个堆。

总结

PoLR 是一种让 AI 模型不再浪费时间完成错误想法的方法。通过检查 AI 的“第一步”是否彼此一致,它可以及早过滤掉错误的路径,在保持答案同样聪明的同时,节省时间和金钱。这就像是与其要求 50 个人写完一整部小说来寻找最好的情节,不如只让他们写第一个段落,然后只完成那些听起来很有前景的故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →