Scaling Embeddings Outperforms Scaling Experts in Language Models
本文提出通过扩展嵌入层(Embedding Scaling)而非传统的混合专家模型(MoE)来提升语言模型的稀疏扩展效率,并据此推出了在智能体和代码领域表现卓越的 68.5B 参数稀疏模型 LongCat-Flash-Lite。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇文章介绍了一项非常有趣的AI技术突破。如果我们要用大白话来解释,可以把它想象成**“如何让一个大脑既聪明,又跑得飞快”**的问题。
我们可以通过一个生动的比喻来理解:
1. 背景:现在的AI是怎么“变聪明”的?(MoE 专家模式)
现在的顶级大模型(比如 GPT-4)通常采用一种叫 MoE(混合专家模型) 的技术。
比喻: 想象你开了一家超级大型的咨询公司。为了解决各种问题,你雇佣了 100 个不同领域的专家(数学专家、法律专家、代码专家等)。
- 优点: 公司规模(参数量)可以做得非常大,知识面极广。
- 缺点: 当一个客户(输入一个问题)进来时,你得先派个“调度员”去判断该找哪个专家。随着专家越来越多,调度员会越来越忙,专家之间的沟通成本也会激增,最后公司虽然大,但反应速度变慢了,甚至会出现“人浮于事”的情况。
2. 论文的核心发现:换个思路,扩充“词汇量”!(Embedding 扩展模式)
这篇论文的作者们提出了一个“反直觉”的想法:与其拼命雇佣更多的专家,不如给这些专家配上一套极其强大的“超级词典”。
这就是他们说的 “Scaling Embeddings”(扩展嵌入层)。
比喻: 还是那家咨询公司。与其雇 100 个专家,不如只雇 10 个顶尖专家,但给这 10 个专家每人发一本**“万能超级百科全书”**。
这本百科全书不仅记录了单个词的意思,还记录了词与词组合在一起时的“潜台词”(这就是论文里的 N-gram 技术)。
- 例子: 传统的词典只告诉你“苹果”是什么;而这本“超级词典”会告诉你,当“苹果”和“手机”连在一起时,它指的不是水果,而是科技产品。
结论是: 在某些情况下,“少而精的专家 + 超级词典” 的效果,竟然比 “多而杂的专家 + 普通词典” 更好,而且运行起来更省力!
3. 他们是怎么做的?(技术亮点)
为了让这个“超级词典”真正好用,他们解决了三个大问题:
- 防止“词义打架”(解决 Hash 碰撞): 如果词典太小,两个意思完全不同的词可能会被挤在同一个格子里,导致专家看走眼。他们通过巧妙的设计,让词典的容量避开了一些“尴尬的数字”,确保每个词都有自己的专属位置。
- 防止“新知识被淹没”(Embedding Amplification): 专家们太强了,说话声音太大,导致词典提供的微小信息被忽略了。作者给词典的信息加了个“扩音器”,让专家能听清词典里的细节。
- 让“查字典”变快(系统优化): 查一本巨大的词典是很慢的。他们开发了专门的“快速索引技术”(N-gram Cache),让查字典的过程几乎不占用时间。
4. 最终成果:LongCat-Flash-Lite
他们用这套理论造出了一个叫 LongCat-Flash-Lite 的模型。
- 规模: 它总共有 685 亿个参数,但非常聪明——它把其中超过 300 亿个参数都花在了“超级词典”上,而不是专家身上。
- 战绩: 尽管它每次干活时“动用”的参数很少(非常轻量),但它的表现却非常惊人。特别是在写代码和**当智能助手(Agent)**方面,它甚至打败了一些规模比它大得多的模型。
总结一下
如果把大模型比作一个学生:
- 以前的做法: 拼命给学生请更多的老师(增加专家),结果学生光是跟老师沟通就累死了。
- 这篇论文的做法: 给学生配一套极其详尽、能读懂上下文语境的超级教材(扩展 Embedding)。
结果: 这个学生不仅学得更深、更透,而且考试(推理)的速度还比以前快得多!
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。