DND: Boosting Large Language Models with Dynamic Nested Depth
本文介绍了动态嵌套深度(Dynamic Nested Depth, DND),这是一种新颖的后训练方法,通过一种嵌套深度机制动态地识别并重新处理关键标记,从而在以极低的计算开销下,增强现成的开源大语言模型,并在多种基准测试中取得了显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名正在参加一场非常困难考试的学生。你的时间有限,精力也有限。
旧方法(标准 AI):
如今大多数大语言模型(LLM)的工作方式就像一个对待考试中每个问题都一视同仁的学生。无论是“2+2 等于几?”还是“解释黑洞的量子力学”,学生都会投入完全相同的时间和脑力。他们读完简单的问题,思考一下,写下答案,然后继续。对于难题,他们也是如此,但由于他们使用的是这种“一刀切”的努力方式,他们可能会在难点部分草草了事导致出错,或者在简单部分过度思考而浪费时间。
新思路(DND):
这篇论文介绍了一种名为**动态嵌套深度(Dynamic Nested Depth, DND)**的方法。你可以把它想象成一位观察着学生考试并只在必要时进行干预的聪明导师。
它是如何运作的,通过以下简单的步骤分解:
1. “交通警察”(路由)
当模型处理一个句子时,它会在每一层(思考过程中的一个步骤)的末尾遇到一个“交通警察”。这个警察会逐个查看每个词(token)。
- 简单的词: 如果这个词很简单(比如“the”或“and”),警察会说:“没问题,通过吧。” 模型正常处理它并进入下一步。
- 难的词: 如果这个词很棘手(比如复杂的数学符号或谜题中的逻辑连接词),警察会说:“等等!这个需要更多关注。”
2. “绕行”(嵌套深度)
当警察标记出一个难词时,它并不会直接让其通过。相反,它会将这个特定的词送入一条绕行路线。
- 想象这个词被送回教室进行第二轮学习。它被重新阅读、重新分析,并由模型的内部逻辑进行“复习”。
- 这就是**“嵌套深度”**。模型只针对这些困难的词进行更深层的挖掘,而不会在简单的词上浪费时间。这就像一个学生在快速浏览书中简单部分的同时,重新阅读一段令人困惑的段落。
3. “合并”(融合)
在这些难词经过额外的“复习”之后,它们会被带回主线。模型随后将原始理解与这种新的、更深层的理解结合起来,以生成最终答案。
为什么这很特别?
论文声称这种方法是一种“即插即用”的升级。你不需要从头开始重建整个学校(模型)。你只需要在现有的模型(如 Qwen、Llama 或 Gemma)中加入这个聪明的交通警察系统,并对其进行短时间的训练即可。
结果(成绩单):
作者在几种不同的模型上进行了测试:
- 小模型: 他们将小型模型(如 10 亿参数规模)变得显著更聪明。例如,一个模型的推理和编程分数提高了约 2.5% 到 2.6%。
- 大模型: 他们甚至在一个庞大且复杂的模型(300 亿参数)上进行了测试。它将该模型的性能提升了近 1%。
- 效率: 最棒的部分是,这并没有让模型变得慢很多或大很多。它只增加了极少量的额外“脑力”(参数)和计算量。这就像是在不需要多花两倍时间学习的情况下获得更好的成绩。
秘诀(训练策略)
论文还解释了教导“交通警察”变得准确是非常困难的。如果警察太挑剔,就会停止一切;如果它太懒散,就不会停止任何事。
- 解决方案: 他们创建了一种特殊的训练规则。他们教导警察能够非常出色地分辨“简单词”和“难词”(这样它就不会产生混淆),并赋予它一种动态调整自身严格程度(阈值)的方式,使其始终能挑选出正确数量的词进行复习。
总结:
DND 是一种通过让 AI 仅在句子的难点部分投入额外时间,而在简单部分快速通过,从而使 AI 变得更聪明的方法。这是一种更聪明、更高效的思考方式,而不是对所有事物都只是单纯地加大思考强度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。