A Sovereign, Open-Source Foundation Model for German and English
本文介绍了 Soofi S 30B-A3B,这是一种主权级、开源的混合专家混合 Mamba Transformer 模型,在 27 万亿个 token 上进行了训练,并侧重于德语和英语,在实现开源模型中顶尖性能的同时,为长上下文应用提供了卓越的推理效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图打造一个终极的双语机器人厨师,它能够用英语和德语流畅地烹饪出一场盛宴。大多数人认为,打造优秀厨师的秘诀在于雇佣更大的厨房或更多的厨师(更多的参数)。但 Soofi S 背后的团队发现了一个不同的窍门:他们没有雇佣 300 亿个庞大的厨师,而是雇佣了一支仅有 30 亿名成员、极其高效且擅长切换任务的小型精锐团队,同时保留另外 270 亿作为一座巨大的、静默的食谱图书馆,供他们随时调用。
这不仅仅是一个理论;他们还打造并测试了一个名为 Soofi S 30B-A3B 的全开源机器人厨师。以下是他们是如何完成这项工作的、它能做什么,以及它目前仍存在的几个小瑕疵的故事。
秘制酱汁:混合厨房
大多数 AI 模型就像一群拥挤的人群,每个人都必须大声喊叫才能被听到,当房间变得巨大(对话变长)时,情况会变得混乱且缓慢。Soofi S 则不同。它使用了一种混合设计,结合了两种类型的“厨师”:
- Mamba-2 层: 把它们想象成那些能在脑海中记住整个故事而无需动笔记录的厨师。它们不需要一个越来越重的巨大笔记本(称为“KV 缓存”)。
- MoE(专家混合模型): 这就是“30 亿活跃”的部分。在总计 316 亿个参数中,模型在生成每个单词时仅“唤醒”其中的 32 亿个。
结果如何?当你要求这个模型阅读一本长达 100 万字的书时,它不会变慢。其他模型因为要背负沉重的笔记本而变得迟缓,而 Soofi S 能保持稳定的生成速度。作者测量发现,在上下文长度为 40,000 个 token(约 3 万字)时,Soori S 生成文本的速度比同等规模的其他稠密模型快了 8 到 9 倍。
配方:聚焦德语与英语
团队并没有把随机的互联网文本丢进锅里。他们遵循了一个严格的三阶段配方,旨在让模型成为德语和英语领域的冠军,而不是一个平庸的百种语言厨师。
- 第一阶段(大混合): 他们从 20 万亿 token 的多样化数据开始。他们特意确保德语不仅仅是一道配菜;他们将德语的比例提升到了 7.2%(相比之下,其他模型的比例通常为 5%)。
- 第二阶段(高质量退火): 随着模型变得越来越聪明,他们转向了“高质量”饮食。他们剔除了垃圾食品,专注于最好的代码、数学和推理数据。在这里,他们将德语部分的比例进一步提升到了 15.3%。
- 第三阶段(长篇故事扩展): 最后,他们教会了模型如何处理超长故事,使用从 4,000 到 100 万 token 不等的长数据进行训练。
作者非常透明地公开了这些信息:他们发布了确切的成分清单,包括某些高质量食谱重复了多少次(epoch),以及他们决定不使用哪些食谱。他们甚至承认,大约 1.3% 的德语数据来自一个无法分享原始文本的商业授权来源(Genios),但他们提供了精确的统计数据,以便任何人进行审计。
试味测试:它表现如何?
团队让 Soofi S 与包括 Olmo 3 32B、Apertus 70B 和 Qwen3.5 35B 在内的 16 个其他开源模型进行了严苛的试味测试。
- 重大胜利: Soofi S 成为了全开源模型中德语和英语表现最出色的模型。它击败了它所测试的所有欧洲主权基准模型,且往往以巨大优势胜出。例如,在德语代码基准测试中,它在 MBPP-DE 上得分 84.2,大幅领先于次优模型。
- “活跃”优势: 尽管它每次只激活 30 亿个参数,但它却能媲美甚至超越拥有 14 到 27 亿个活跃参数的稠密模型。这就像是一个轻量级选手在短跑中击败了重量级拳击手。
- “开源”优势: 与许多只分享最终权重(做好的菜肴)却隐藏配方的“开源”模型不同,Soofi S 分享了权重、代码、超参数以及精确的数据账目。
路上的颠簸(局限性)
作者诚实地指出了这位机器人厨师仍然会跌倒的地方:
- 德语数学: 虽然它擅长德语小学水平的数学(在 GSM8K-Platinum-DE 上得分 87.1),但在更难的竞赛级德语数学方面表现落后(在 Minerva MATH-DE 上得分为 56.0),落后于像 Qwen3.5 这样的模型。
- 记忆检索: 由于它只有 30 亿个活跃参数,它有时难以回忆起现实世界中冷门的知识(在 NaturalQuestions 上得分为 79.0),而规模更大、更稠密的模型能记住更多。作者建议,在实际应用中,你可以通过搭配搜索引擎来解决这个问题。
- 代码污染: 在一个名为 LBPP 的特定代码基准测试中(该测试用于检测模型是否只是在死记硬背训练数据),它的得分是 31.0,低于一些规模更大的模型。
结论
Soofi S 证明了你不需要一个庞大、缓慢且稠密的“大脑”也能成为顶尖的 AI。通过使用混合 Mamba-Transformer设计并专注于德语和英语,该团队打造了一个具有主权(在德国土地上构建,由德国资金支持)、开放(完全透明)且高效(运行快速且成本低廉)的模型。
它不是解决一切问题的万灵药——尤其是在高难度德语数学或纯粹的事实检索方面——但对于长对话、编程和双语任务,它为“主权”欧洲模型能达到的高度树立了新标准。作者表示,随着更多高质量德语数据的加入,这个模型可能会变得更好,但就目前而言,它是他们测试过的最强大的全开源德-英基础模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。