Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models
本文介绍了隐藏解码(Hidden Decoding),这是一种通过流分解在序列长度维度上扩展标记计算的新型缩放方法,旨在增强大语言模型,从而在不修改固定的 Transformer 主干网络或产生高昂训练成本的情况下,实现前沿规模下的显著性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人大脑(大型语言模型),它已经非常出色了。通常,为了让它变得更聪明,科学家们尝试把大脑做得更大——增加更多的层数、更多的神经元、更多的一切。但这就像是在摩天大楼之上再盖一座摩天大楼:这不仅耗资巨大,而且需要很长时间,有时连施工队(训练计算机)都无法承受这种规模。
微信 AI 团队提出了一个不同的问题:如果我们保持大脑的大小完全不变,但给它更多的时间来思考每一个词呢?
“循环”的问题
一些研究人员曾尝试通过让机器人“循环”思考来解决这个问题。想象一个学生在阅读一个句子,然后读一遍,再读一遍,利用相同的脑细胞反复进行,以获得更好的答案。这被称为“循环”或“递归”模型。
但问题在于:当你试图训练那些最大的机器人(拥有数千亿参数的模型)时,这种循环的想法会破坏流水线。训练这些模型的计算机工作在一种管道模式中,其中大脑的每个部分各司其职一次并传递接力棒。如果你让机器人停下来重新阅读同一个句子,整个流水线就会停滞,昂贵的计算机就会处于闲置状态。这就像工厂的传送带因为工人要重新拧一颗螺丝而不断停止,导致整个工厂陷入瘫痪。
解决方案:“隐藏解码”(秘密的流水线)
微信团队想出了一个聪明的技巧,叫做隐藏解码(Hidden Decoding)。与其让机器人通过循环来反复阅读同一个词,不如让机器人同时多次阅读这个词,但通过秘密的并行车道进行。
你可以把它想象成一支赛车队。与其让一辆赛车绕赛道跑三圈以获得最佳圈速,不如同时派出四辆完全相同的赛车(流)下赛道。
- 设置: 当机器人看到一个词(比如“apple”)时,它不仅仅将其转化为一个代码,而是将其转化为四个不同的代码,每个代码进入自己的秘密车道。
- 秘密工作: 这四条车道运行通过大脑的各个层。前三条车道是“隐藏”的。它们负责所有的重活、思考和推理,但它们还不能说出答案。它们就像是后台的头脑风暴团队。
- 最终决定: 只有第四条车道(最后的流)被允许喊出下一个词。大脑只根据这个最终答案进行评分。
- 记忆: 至关重要的是,大脑会记住前三条车道所思考的内容。它保留了它们的笔记(称为“键值缓存/Key-Value caches”),以便下一个词可以阅读前一个词的头脑风暴笔记。
这样,机器人对于每个词都获得了四倍的思考能力,但它不需要构建更大的大脑,也不需要停止流水线。它只是在一次处理中处理了更长的数据序列。
让它负担得起:“流因子化”技巧
你可能会想:“等等,如果我有四条互相交谈的车道,那数学计算会不会变得极其复杂?”如果每条车道在每一步都试图与所有其他车道交谈,成本将会爆炸式增长(会上升到 16 倍!)。
为了解决这个问题,团队使用了一种名为**流因子化注意力(Stream-Factorized Attention)**的方法。
- 大部分时间: 车道保持在各自的泡泡里。车道 1 与车道 1 交谈,车道 2 与车道 2 交谈。它们互不干扰。
- 有时: 只有少数特定的层会让车道交换笔记并混合它们的想法。
这保持了低成本。成本并没有上升 16 倍,而仅仅上升了大约 4.4 到 5.1 倍(这接近于 4 倍的车道增加量)。这使得训练这些超大规模模型成为可能,而不至于破产。
效果如何?
团队在两个巨大的模型上进行了测试:一个拥有 800 亿参数的模型,以及一个巨大的 6170 亿参数的模型。他们没有改变大脑的大小,只是开启了“4 车道”模式。
- 结果: 模型变得更聪明了。在困难的数学和科学测试中,6170 亿参数模型在 “GPQA Diamond” 测试中的得分从 89.1 提升到了 91.2。在 “PHYBench” 物理测试中,从 75.3 提升到了 76.3。
- 趋势: 他们还测试了 2 条车道、4 条车道和 8 条车道的情况。随着车道的增加,分数也持续上升。这表明增加“思考车道”是让模型变得更聪明的一种真实有效的方法,而无需重建模型。
他们排除了哪些可能性
团队非常谨慎地检查了这是否仅仅是一个巧合。他们尝试了使用额外车道的其他方式:
- 强迫每条车道都进行预测: 如果他们让前三条车道也尝试预测答案(而不是仅仅让最后一条预测),模型的效果反而变差了。
- 混合答案: 如果他们只是将所有四条车道的想法取平均值,效果也没有让最后一条车道决定得那么好。
- 共享笔记: 如果他们让车道共享相同的记忆笔记而不是保留各自的笔记,模型的准确性也会略微下降。
这证明了其中的秘诀在于让前几条车道进行沉默、私密的思考,并保持它们的笔记独立,从而让最后一条车道能够利用这种深度的、积累的智慧做出最好的判断。
核心结论
隐藏解码表明,你并不总是需要一个更大的大脑才能变得更聪明。有时,你只需要给大脑更多并行思考的时间。通过将单个词转化为一条秘密的思考流水线,微信团队发现了一种方法,可以在不构建全新的、更大的模型的情况下,提升前沿规模模型的智能水平。这是一种实用且符合工程逻辑的方法,能从现有的模型中榨取更多的智慧。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。