← 最新论文
💬 NLP

Scaling Embeddings Outperforms Scaling Experts in Language Models

本文提出通过扩展嵌入层(Embedding Scaling)而非传统的混合专家模型(MoE)来提升语言模型的稀疏扩展效率,并据此推出了在智能体和代码领域表现卓越的 68.5B 参数稀疏模型 LongCat-Flash-Lite。

原作者: Hong Liu, Jiaqi Zhang, Chao Wang, Xing Hu, Linkun Lyu, Jiaqi Sun, Xurui Yang, Bo Wang, Fengcun Li, Yulei Qian, Lingtong Si, Yerui Sun, Rumei Li, Peng Pei, Yuchen Xie, Xunliang Cai

发布于 2026-02-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Hong Liu, Jiaqi Zhang, Chao Wang, Xing Hu, Linkun Lyu, Jiaqi Sun, Xurui Yang, Bo Wang, Fengcun Li, Yulei Qian, Lingtong Si, Yerui Sun, Rumei Li, Peng Pei, Yuchen Xie, Xunliang Cai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一项非常有趣的AI技术突破。如果我们要用大白话来解释,可以把它想象成**“如何让一个大脑既聪明,又跑得飞快”**的问题。

我们可以通过一个生动的比喻来理解:

1. 背景:现在的AI是怎么“变聪明”的?(MoE 专家模式)

现在的顶级大模型(比如 GPT-4)通常采用一种叫 MoE(混合专家模型) 的技术。

比喻: 想象你开了一家超级大型的咨询公司。为了解决各种问题,你雇佣了 100 个不同领域的专家(数学专家、法律专家、代码专家等)。

  • 优点: 公司规模(参数量)可以做得非常大,知识面极广。
  • 缺点: 当一个客户(输入一个问题)进来时,你得先派个“调度员”去判断该找哪个专家。随着专家越来越多,调度员会越来越忙,专家之间的沟通成本也会激增,最后公司虽然大,但反应速度变慢了,甚至会出现“人浮于事”的情况。

2. 论文的核心发现:换个思路,扩充“词汇量”!(Embedding 扩展模式)

这篇论文的作者们提出了一个“反直觉”的想法:与其拼命雇佣更多的专家,不如给这些专家配上一套极其强大的“超级词典”。

这就是他们说的 “Scaling Embeddings”(扩展嵌入层)。

比喻: 还是那家咨询公司。与其雇 100 个专家,不如只雇 10 个顶尖专家,但给这 10 个专家每人发一本**“万能超级百科全书”**。
这本百科全书不仅记录了单个词的意思,还记录了词与词组合在一起时的“潜台词”(这就是论文里的 N-gram 技术)。

  • 例子: 传统的词典只告诉你“苹果”是什么;而这本“超级词典”会告诉你,当“苹果”和“手机”连在一起时,它指的不是水果,而是科技产品。

结论是: 在某些情况下,“少而精的专家 + 超级词典” 的效果,竟然比 “多而杂的专家 + 普通词典” 更好,而且运行起来更省力!

3. 他们是怎么做的?(技术亮点)

为了让这个“超级词典”真正好用,他们解决了三个大问题:

  • 防止“词义打架”(解决 Hash 碰撞): 如果词典太小,两个意思完全不同的词可能会被挤在同一个格子里,导致专家看走眼。他们通过巧妙的设计,让词典的容量避开了一些“尴尬的数字”,确保每个词都有自己的专属位置。
  • 防止“新知识被淹没”(Embedding Amplification): 专家们太强了,说话声音太大,导致词典提供的微小信息被忽略了。作者给词典的信息加了个“扩音器”,让专家能听清词典里的细节。
  • 让“查字典”变快(系统优化): 查一本巨大的词典是很慢的。他们开发了专门的“快速索引技术”(N-gram Cache),让查字典的过程几乎不占用时间。

4. 最终成果:LongCat-Flash-Lite

他们用这套理论造出了一个叫 LongCat-Flash-Lite 的模型。

  • 规模: 它总共有 685 亿个参数,但非常聪明——它把其中超过 300 亿个参数都花在了“超级词典”上,而不是专家身上。
  • 战绩: 尽管它每次干活时“动用”的参数很少(非常轻量),但它的表现却非常惊人。特别是在写代码和**当智能助手(Agent)**方面,它甚至打败了一些规模比它大得多的模型。

总结一下

如果把大模型比作一个学生:

  • 以前的做法: 拼命给学生请更多的老师(增加专家),结果学生光是跟老师沟通就累死了。
  • 这篇论文的做法: 给学生配一套极其详尽、能读懂上下文语境的超级教材(扩展 Embedding)。

结果: 这个学生不仅学得更深、更透,而且考试(推理)的速度还比以前快得多!

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →