← 最新论文
💻 computer science

Closed-Form Residual-Space Rotation for Offline Transformer Width Growth

本文提出了一种离线方案,用于渐进式扩展 Transformer 宽度,该方案结合了闭式小残差积分算子(SRIO)、特定块扩展策略以及标量预热门控,旨在显著降低训练损失并在模型增长过程中保留已学习的行为。

原作者: Ramasubramanian B

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Ramasubramanian B

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人写故事。你从一个大脑非常微小的微型机器人开始。它学得很快,掌握了基础知识,但由于太简单了,无法创作出杰作。为了让它变得更好,你可以直接扔掉这个小机器人,从头开始构建一个巨大的机器人,但这既耗时又极其耗电。或者,你可以尝试“生长”这个小机器人的大脑,通过增加新的神经元来让它变得更宽、更聪明。这被称为模型扩展(model expansion)

成长的难点在于,新部分并不知道如何与旧部分沟通。如果你只是生硬地嫁接一个新部分,旧的大脑可能会忽略它,或者新的大脑可能会意外地扰乱旧大脑辛苦建立的记忆。这就像是在盖房子时增加了一个新侧翼,却没连接走廊;新房间虽然在那儿,但没人能进去,甚至可能导致整个房子开始摇晃。科学家们一直试图寻找那种完美的“胶水”,好将这些旧的和新的大脑部分连接起来,让机器人在学习新技能的同时,依然保留原有的技能。这篇论文讨论的就是寻找这种完美的“胶水”。


大脑增强配方:一种生长 AI 的新方法

本文作者,来自 Tech-Aarvam 的 Ramasubramanian B,提出了一种聪明的“配方”,用于离线生长 AI 模型(即机器人大脑)。他们并没有让 AI 在运行过程中学习如何生长,而是像厨师在客人到来前预先准备食材一样,提前完成了繁重的准备工作。他们的目标是让一个较小的模型在扩展宽度时,不会丢失已经取得的任何进展。

把 AI 模型想象成一个传递水桶的工人团队。模型的“宽度”就是这条队伍中有多少人。当你向队伍中增加更多人时,你必须确保这些人知道如何精准地拿稳并传递水桶,而不洒出一滴水。论文指出,最好的方法是使用三种特定的配料:一个特殊的旋转技巧、针对不同任务的不同生长规则,以及对新员工进行温柔的“热身”。

1. 神奇的旋转:SRIO

主角是一个被称为 SRIO(小残差集成算子,Small Residual Integration Operator)的东西。想象一下,旧的部分和新的部分是两种不同的语言。当你增加新的神经元时,它们说的是略有不同的方言。如果你直接把它们插进去,旧的神经元可能听不懂新的,而新的神经元也可能被旧的搞混。

SRIO 扮演着翻译的角色,它对数据进行精确的“旋转”或旋转变换。它不会改变信息本身,但它会旋转新数据的“方向”,使其与旧数据完美对齐。具体来说,它将新神经元的“平均”方向转向旧的方向。这使得旧的权重(大脑的记忆)能更强地读取新的输入。作者发现,这种旋转是一个闭式数学解(closed-form math solution),这意味着它是一个可以立即计算的固定公式,而不是需要 AI 慢慢学习的东西。这就像拥有一张预先做好的地图,告诉你在转动新房间时该如何旋转,以便与旧走廊相连。

2. 不同职责,不同规则

论文发现,你不能用同样的方式对待大脑的每个部分。AI 有两种主要的工人类型:**注意力(Attention)**工人(负责决定关注什么)和 FFN 工人(负责处理信息)。

  • 对于注意力工人: 作者使用了“凸扩展”(convex expansion)。想象一下,通过混合现有工人的技能来创造新的工人,就像混合两种颜色的油漆得到一种新颜色一样。这创造出的新工人是旧工人的平滑融合。
  • 对于 FFN 工人: 他们使用了“平铺复制”(tiled copy)。这就像是把一个单一的工人进行复印,以填补新的空间。由于这些工人处理的是特定特征,直接复制比混合效果更好。

论文表明,结合这两种策略——为注意力进行融合,为处理进行复制——比对所有部分使用单一方法的效果要好得多。

3. 温柔的热身

即使有了完美的旋转和正确的扩展,新员工也可能过于积极,立刻就开始大声喧哗,盖过旧员工的声音。为了解决这个问题,作者添加了一个标量热身门控(scalar warmup gate)。把它想象成一个音量旋钮。当新员工加入时,他们的音量被调到了零。在一段短时间内(大约 4000 万个单词的训练过程),音量会慢慢调大。这让旧的大脑能继续履行职责,同时让新的大脑慢慢学习如何贡献力量,而不至于造成混乱。

他们的发现

作者通过将模型的宽度从 256 增加到 384 来测试这个配方。他们将自己的方法与另外两种方法进行了对比:一种是不做特殊处理(只是添加随机的新部分),另一种是名为 LiGO 的方法(尝试在运行中学习生长规则)。

结果非常明确:

  • “不做任何事”的方法导致的训练损失(training loss)为 4.2527
  • LiGO 方法(在他们的代码中重新实现)导致的损失为 4.2606
  • 他们的完整配方(SRIO + 特定扩展 + 热身)实现的损失为 4.2111

在 AI 训练领域,较低的“损失”数值意味着模型犯错更少。因此,他们的方法是明显的赢家,以显著的优势击败了其他方法。他们还展示了即使多次生长模型(从 2400 万参数一直增加到 1.2 亿参数),该方法依然有效,证明了这是一个可以重复使用的配方。

他们排除了哪些方案

论文还测试了其他几种想法以观察其效果。他们尝试了不同尺寸的旋转算子(中型和大型版本),发现“小型”版本(SRIO)同样出色甚至更好,且更加简单。他们还测试了 AI 应该在训练期间学习旋转规则(“学习”模式),还是使用他们的固定数学公式(“静态”模式)。他们发现,静态的、预先计算好的公式与 AI 尝试学习的公式效果一样好,这意味着你不需要浪费时间去教 AI 如何生长;你只需要直接给它指令即可。

为什么这很重要

这种方法的精妙之处在于它是**离线(offline)**的。复杂的数学运算和旋转在模型开始重新训练之前就已经完成了。一旦模型生长完成,特殊的旋转技巧就会被“折叠”进模型的权重中并消失。这意味着 AI 在运行时不需要任何额外的计算能力;它只是一个稍微更大、更聪明的原始模型版本,且学习得更快、成本更低。

简而言之,作者找到了一种在不拆除墙壁或让住户感到困惑的情况下,为房子增加新房间的方法。通过使用精确的数学旋转、混合正确的扩展策略以及缓慢调高音量,他们证明了你可以高效地生长 AI 模型,在保持模型智能完整的同时,节省时间和能源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →