← 最新论文
💬 NLP

From Growing to Looping: A Unified View of Iterative Computation in LLMs

该论文通过揭示循环架构与深度扩展模型在推理机制上的共性,统一了这两种提升大语言模型推理能力的方法,并证明它们具有互补性、可组合性及对更多训练数据的适应性。

原作者: Ferdinand Kapl, Emmanouil Angelis, Kaitlin Maile, Johannes von Oswald, Stefan Bauer

发布于 2026-02-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ferdinand Kapl, Emmanouil Angelis, Kaitlin Maile, Johannes von Oswald, Stefan Bauer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常有趣的问题:如何让大语言模型(LLM)变得更聪明,特别是让它们更擅长“思考”和“推理”,而不是仅仅死记硬背?

为了让你轻松理解,我们可以把训练一个 AI 模型想象成建造一座工厂,让它在流水线上处理任务。

1. 两种“变聪明”的魔法

目前,让 AI 变强主要有两种看似不同、但效果惊人的方法,论文把它们比作两种不同的“工厂扩建策略”:

  • 策略一:循环复用(Looping)—— “一位全能工匠的无限次打磨”

    • 传统做法:工厂有 20 层流水线,每层由不同的工匠负责,做完一层就传下一层。
    • 循环做法:工厂只建了 4 层流水线,但这 4 层工匠非常厉害。当产品经过这 4 层后,不是直接出厂,而是被送回去,再经过这 4 层,再送回去…… 就像把一块璞玉在同一个工匠手里反复打磨,直到完美。
    • 优点:省材料(参数少),但花的时间长(计算次数多)。
    • 核心:通过重复使用同一组模块来增加深度。
  • 策略二:深度生长(Depth Growing)—— “从幼苗长成大树”

    • 传统做法:直接建好 20 层的工厂,从头开始训练,耗时耗力。
    • 生长做法:先建一个只有 4 层的小工厂,训练好。然后,把中间那几层“复制”一份,插进去,变成 8 层;再训练,再复制,变成 12 层……直到长成 20 层的大工厂。
    • 优点:训练速度快,省电费(训练算力少)。
    • 核心:通过复制中间层来增加深度。

2. 核心发现:殊途同归

以前大家觉得这两种方法只是“长得像”,但作者发现它们骨子里是一回事

  • 共同的秘密:无论是“反复打磨”(循环)还是“复制生长”(生长),它们都让模型学会了**“多思考几步”**。
  • 现象:在标准的工厂里,前面的工匠(浅层)往往只是做简单的分类,真正的“深度思考”都发生在最后几层。但在“循环”和“生长”的工厂里,中间的工匠也开始变得非常重要,它们会反复处理信息,就像人在解数学题时,会在草稿纸上反复演算一样。
  • 比喻:这就好比,普通学生做数学题可能看一眼就写答案(浅层处理);而这两种方法训练出的学生,会习惯性地在脑子里多转几圈,反复验证逻辑,所以推理能力更强。

3. 惊人的实验:1 + 1 > 2

作者做了一个大胆的实验,把两种方法结合了起来:

  • “先种树,后循环”
    他们先训练了一个通过“复制生长”长大的模型(LIDAS)。这个模型从来没有被训练过“循环”(即从未被要求把中间层重复运行)。
    然后,在推理阶段(也就是模型真正干活的时候),他们强行让模型把中间的某一段“再跑一遍”。
  • 结果:奇迹发生了!这个从未学过“循环”的模型,仅仅因为被要求“多跑一步”,在推理任务上的准确率直接翻倍(提升了 2 倍)
  • 启示:这说明“生长”出来的模型,内部结构已经天然具备了“循环思考”的潜力,只需要在需要的时候“激活”它。

4. 为什么这很重要?(给普通人的启示)

这篇论文告诉我们,让 AI 变聪明不一定非要堆砌更多的参数(更大的模型)或更多的数据。

  • 更聪明的训练法:与其盲目地让模型“死记硬背”所有知识,不如教它**“反复思考”**。
  • 更高效的推理:当我们遇到难题时,可以让模型在内部多“转几圈”(增加推理步数),哪怕它没专门学过这么做,它也能利用这种结构优势解决问题。
  • 最佳实践:论文建议采用**“先生长,后循环”**的策略。先快速训练一个结构合理的模型,然后在实际应用中,根据需要让它“多思考几次”。

总结

想象一下,如果你想让一个学生数学变好:

  • 旧方法:给他一本厚厚的书,让他背下所有公式(堆参数)。
  • 新方法(本文):教他一种**“反复演算”**的习惯。无论是让他用同一套解题步骤多试几次(循环),还是让他把解题过程拆解成更多步骤去练习(生长),都能让他真正掌握逻辑。

这篇论文就是发现了这两种“反复演算”的训练法其实是同一种思维模式,并且把它们结合起来,能让 AI 在推理任务上变得更强、更灵活、更省钱

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →