← 最新论文
💬 NLP

Hierarchical Chain-of-Thought Prompting: Enhancing LLM Reasoning Performance and Efficiency

该论文提出了一种名为分层思维链(Hi-CoT)的推理范式,通过将推理过程分解为交替进行的指令规划与逐步执行层级,有效解决了传统思维链冗余和逻辑连贯性差的问题,在显著提升大语言模型数学推理准确率的同时缩短了推理长度。

原作者: Xingshuai Huang, Derek Li, Bahareh Nikpour, Parsa Omidi

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Xingshuai Huang, Derek Li, Bahareh Nikpour, Parsa Omidi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种让大语言模型(LLM)变得更聪明、更高效的新技术,叫做**“分层思维链”(Hi-CoT)**。

为了让你轻松理解,我们可以把大语言模型想象成一个才华横溢但有点“话痨”且容易跑题的实习生

1. 现状:为什么现在的模型会“翻车”?

以前的方法叫**“思维链”(CoT)**,就像你让实习生:“请一步步思考,最后给我答案。”

  • 问题所在:这个实习生虽然会思考,但他没有结构。他可能会:
    • 车轱辘话来回说(冗余):为了凑字数,把同一个意思解释三遍。
    • 跑题(逻辑漂移):思考到一半突然想“哎,刚才那个词好像有点意思”,然后开始写无关的旁支,最后忘了原本要解决什么问题。
    • 结果:不仅答案容易错,而且写了满满一大篇,浪费了大量时间和算力(就像为了买瓶水,跑遍了整个城市)。

另一种方法是**“计划与解决”(Plan-and-Solve),就像你给实习生一张固定的行程表**:“第一步做什么,第二步做什么,第三步做什么。”

  • 问题所在:这张表是一次性写好的。如果执行到第二步发现情况变了,实习生不敢改表,只能硬着头皮按错的表继续走,导致“计划”和“执行”脱节(Plan-Execution Drift)。

2. 新方案:Hi-CoT 是什么?

这篇论文提出的Hi-CoT,就像是给实习生配备了一位**“随时在线的严厉导师”**。

核心机制:交替进行“指挥”与“执行”
Hi-CoT 强迫模型在每一步都遵循一个严格的循环:

  1. 指挥阶段(Instruction):先停下来,深呼吸,问自己:“我现在在哪?我要去哪里?下一步具体该干嘛?”(把复杂的任务压缩成一个清晰的小目标)。
  2. 执行阶段(Execution):根据刚才的指令,只干这一件事,做完就停。
  3. 循环:做完一步,立刻回到“指挥阶段”,根据刚才的结果重新规划下一步。

生活中的比喻

  • 普通 CoT:就像一个人蒙着眼睛在迷宫里乱撞,一边撞墙一边自言自语,最后可能撞对了出口,也可能累死在里面。
  • Plan-and-Solve:就像拿着导游图走迷宫,但导游图是出发前画好的。如果路上遇到修路(新情况),他依然按原图走,结果撞墙。
  • Hi-CoT:就像**“走一步,看一步,再定下一步”。每走一步,都要停下来确认方向,确保没走偏,再迈下一步。这就像登山**:每到一个营地(执行完一步),都要重新检查地图和天气(指令规划),确认下一段路怎么走,而不是盲目地一口气冲顶。

3. 为什么这个方法这么厉害?

论文通过大量的数学题测试(就像给实习生做奥数题),发现 Hi-CoT 有两个惊人的效果:

  1. 更准(准确率提升)

    • 因为每一步都有“指挥”在把关,模型不容易跑偏,逻辑更严密。
    • 比喻:就像射箭,以前是闭眼连发,现在是**“瞄准 - 射击 - 调整 - 再瞄准”**。
    • 数据:平均准确率提升了 6.2%,在某些难倒人的题目上,准确率甚至提升了 61.4%!甚至在 AMC 和 MATH500 这些高难度数学竞赛题上,只要模型严格遵守格式,准确率能直接达到 100%
  2. 更快、更省(效率提升)

    • 因为去掉了废话和跑题的内容,模型生成的文字变少了。
    • 比喻:以前实习生写了一万字报告,现在只写了一千字的精华版,但核心意思全在。
    • 数据:生成的文字长度(Token)平均减少了 13.9%。这意味着回答速度更快,电脑消耗的电量也更少。

4. 总结

这篇论文告诉我们:大模型其实很聪明,但之前的“思考方式”太乱了。

Hi-CoT 就像给大模型装了一个**“结构化导航仪”。它不要求模型变聪明(不需要重新训练模型),只是改变了它思考的节奏和格式**:

  • 不要一口气想到底。
  • 像剥洋葱一样,一层一层,每剥一层(执行一步),都要确认一下(规划下一步)。

一句话总结
Hi-CoT 让大模型从“漫无目的的乱想”变成了“步步为营的深思”,既算得对,又算得快,还省脑子。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →