← 最新论文
🤖 machine learning

Nexusformer: Nonlinear Attention Expansion for Stable and Inheritable Transformer Scaling

该论文提出了名为 Nexusformer 的新架构,通过用基于双重激活的非线性 Nexus-Rank 层替代传统的线性投影,实现了 Transformer 模型的无损结构化扩展,从而在显著降低训练计算成本的同时保持了性能稳定并支持知识继承。

原作者: Weijie Zhao, Mingquan Liu, Bolun Wang, Simo Wu, Nuobei Xie, Rui-Jie Zhu, Peng Zhou

发布于 2026-04-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Weijie Zhao, Mingquan Liu, Bolun Wang, Simo Wu, Nuobei Xie, Rui-Jie Zhu, Peng Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 Nexusformer 的新型人工智能模型架构。为了让你轻松理解,我们可以把训练大型 AI 模型想象成**“扩建一座超级图书馆”**。

1. 现有的困境:死板的“线性”扩建

目前的 AI 模型(Transformer)在变大的时候,通常面临两个大问题:

  • 推倒重来太浪费:如果你想让图书馆容纳更多书(提升模型能力),传统做法往往是把旧图书馆拆了,用更大的地基重新盖一座。这意味着之前学到的知识(书架上的书)全得扔掉,重新花巨资去整理。
  • 房间结构太死板:现有的图书馆设计(线性投影层)就像是一个个固定宽度的走廊。无论你想放多少书,走廊的宽度是锁死的。如果你想把书塞进更复杂的分类系统,这些走廊就太窄了,导致书(数据特征)挤在一起,分不清楚。

比喻:这就好比你想把一辆自行车升级成卡车,但它的车架(线性层)是焊死的。你只能强行把大轮子塞进小架子,结果要么车散架(模型性能下降),要么你得把车架拆了重焊(重新训练)。

2. Nexusformer 的解决方案:灵活的“非线性”扩容

Nexusformer 的核心创新在于它换了一种扩建方式,叫做 Nexus-Rank(枢纽秩) 层。

  • 把“走廊”变成“立体迷宫”:
    它不再使用死板的直线走廊,而是设计了一个**“三步走”的立体迷宫**:

    1. 第一步(抬升):先把信息从狭窄的走廊(维度 D)拉到一个更宽敞的中间大厅(维度 M)。
    2. 第二步(爆发):再把这个大厅扩展到一个巨大的、超容量的仓库(维度 A)。在这里,信息可以进行复杂的“化学反应”,把简单的概念组合成复杂的逻辑。
    3. 第三步(回归):最后把处理好的复杂信息,压缩回原来的出口(维度 D),以便和其他部分连接。

    比喻:这就像在图书馆里建了一个**“智能分拣中心”**。书进来时先被送到一个巨大的、可以随意变形的分拣大厅,在这里书可以被重新分类、组合、甚至产生新的关联,然后再整齐地放回书架。这样,图书馆的“理解能力”就大大增强了。

3. 如何“无损”继承知识?(零初始化魔法)

这是这篇论文最精彩的地方。通常扩建模型会导致旧知识“失忆”,但 Nexusformer 做到了**“无缝衔接”**。

  • 零初始化(Zero Initialization):
    当它要扩建时,新加进去的“房间”和“书架”在刚建好时是空的(数值为 0)。

    • 效果:在扩建的那一瞬间,新房间对图书馆的运作没有任何干扰,模型输出的结果和扩建前一模一样。
    • 过程:随着继续训练,这些空房间开始慢慢“长”出新的知识,而旧房间里的知识完好无损。

    比喻:想象你在给图书馆扩建。你直接盖好了新楼,但新楼里暂时不摆任何书,也不开灯。老楼里的读者完全感觉不到变化。然后,你开始慢慢往新楼里放新书。因为新楼一开始是“透明”的,所以老楼的知识不会受到任何冲击。等新书放好了,整个图书馆的容量和智能就升级了,而且不需要把旧书重新整理一遍。

4. 实验结果:更聪明、更省钱

  • 省算力:在同样的任务下,Nexusformer 只需要比传统方法少 41.5% 的计算资源(时间、电费、显卡)就能达到同样的效果。
  • 更稳定:研究发现,这种“先分开再合并”的扩建方式,让模型在成长过程中走了一条**“离心 - 向心”**的优美轨迹。就像扔出一个球,它先飞出去探索(发散),然后自动被引力拉回最佳位置(收敛),非常稳定。
  • 预测未来:作者甚至发现了一个数学公式,可以通过观察模型在扩建时的“几何状态”,精准预测它未来的表现。

总结

Nexusformer 就像是一个**“可生长的智能体”。
它打破了传统 AI 模型“要么拆了重练,要么能力受限”的僵局。通过引入
立体的非线性结构**(让信息在更广阔的空间里自由组合)和零初始化技术(让新能力平滑融入,不破坏旧知识),它让 AI 模型能够像生物一样**“边长边学”,既保留了过去的智慧,又拥有了未来的潜力,而且性价比极高**。

简单来说:以前升级 AI 是“换血重生”,现在 Nexusformer 是“进化生长”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →