← 最新论文
💬 NLP

A Sovereign, Open-Source Foundation Model for German and English

本文介绍了 Soofi S 30B-A3B,这是一种主权级、开源的混合专家混合 Mamba Transformer 模型,在 27 万亿个 token 上进行了训练,并侧重于德语和英语,在实现开源模型中顶尖性能的同时,为长上下文应用提供了卓越的推理效率。

原作者: The Soofi-Team, :, Benedikt Droste, David Fitzek, Ruben Härle, Lukas Helff, Maximilian Idahl, Alex Jude, Abbas Goher Khan, Maurice Kraus, Timm Ruland, Richard Rutmann, Sebastian Sztwiertnia, Markus F
发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: The Soofi-Team, :, Benedikt Droste, David Fitzek, Ruben Härle, Lukas Helff, Maximilian Idahl, Alex Jude, Abbas Goher Khan, Maurice Kraus, Timm Ruland, Richard Rutmann, Sebastian Sztwiertnia, Markus Frey, Daniil Gurgurov, Jan Pfister, Tom Röhr, Sebastian von Rohrscheidt, Jörg Bienert, Nicolas Flores-Herr, Simon Gottschalk, Andreas Hotho, Kristian Kersting, Joachim Köhler, Alexander Löser, Wolfgang Nejdl, Simon Ostermann, Jan Plogsties, Patrick Putzky, Mehdi Ali, Michael Fromm, Max Lübbering

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图打造一个终极的双语机器人厨师,它能够用英语和德语流畅地烹饪出一场盛宴。大多数人认为,打造优秀厨师的秘诀在于雇佣更大的厨房或更多的厨师(更多的参数)。但 Soofi S 背后的团队发现了一个不同的窍门:他们没有雇佣 300 亿个庞大的厨师,而是雇佣了一支仅有 30 亿名成员、极其高效且擅长切换任务的小型精锐团队,同时保留另外 270 亿作为一座巨大的、静默的食谱图书馆,供他们随时调用。

这不仅仅是一个理论;他们还打造并测试了一个名为 Soofi S 30B-A3B 的全开源机器人厨师。以下是他们是如何完成这项工作的、它能做什么,以及它目前仍存在的几个小瑕疵的故事。

秘制酱汁:混合厨房

大多数 AI 模型就像一群拥挤的人群,每个人都必须大声喊叫才能被听到,当房间变得巨大(对话变长)时,情况会变得混乱且缓慢。Soofi S 则不同。它使用了一种混合设计,结合了两种类型的“厨师”:

  1. Mamba-2 层: 把它们想象成那些能在脑海中记住整个故事而无需动笔记录的厨师。它们不需要一个越来越重的巨大笔记本(称为“KV 缓存”)。
  2. MoE(专家混合模型): 这就是“30 亿活跃”的部分。在总计 316 亿个参数中,模型在生成每个单词时仅“唤醒”其中的 32 亿个。

结果如何?当你要求这个模型阅读一本长达 100 万字的书时,它不会变慢。其他模型因为要背负沉重的笔记本而变得迟缓,而 Soofi S 能保持稳定的生成速度。作者测量发现,在上下文长度为 40,000 个 token(约 3 万字)时,Soori S 生成文本的速度比同等规模的其他稠密模型快了 8 到 9 倍

配方:聚焦德语与英语

团队并没有把随机的互联网文本丢进锅里。他们遵循了一个严格的三阶段配方,旨在让模型成为德语和英语领域的冠军,而不是一个平庸的百种语言厨师。

  • 第一阶段(大混合): 他们从 20 万亿 token 的多样化数据开始。他们特意确保德语不仅仅是一道配菜;他们将德语的比例提升到了 7.2%(相比之下,其他模型的比例通常为 5%)。
  • 第二阶段(高质量退火): 随着模型变得越来越聪明,他们转向了“高质量”饮食。他们剔除了垃圾食品,专注于最好的代码、数学和推理数据。在这里,他们将德语部分的比例进一步提升到了 15.3%
  • 第三阶段(长篇故事扩展): 最后,他们教会了模型如何处理超长故事,使用从 4,000 到 100 万 token 不等的长数据进行训练。

作者非常透明地公开了这些信息:他们发布了确切的成分清单,包括某些高质量食谱重复了多少次(epoch),以及他们决定不使用哪些食谱。他们甚至承认,大约 1.3% 的德语数据来自一个无法分享原始文本的商业授权来源(Genios),但他们提供了精确的统计数据,以便任何人进行审计。

试味测试:它表现如何?

团队让 Soofi S 与包括 Olmo 3 32BApertus 70BQwen3.5 35B 在内的 16 个其他开源模型进行了严苛的试味测试。

  • 重大胜利: Soofi S 成为了全开源模型中德语和英语表现最出色的模型。它击败了它所测试的所有欧洲主权基准模型,且往往以巨大优势胜出。例如,在德语代码基准测试中,它在 MBPP-DE 上得分 84.2,大幅领先于次优模型。
  • “活跃”优势: 尽管它每次只激活 30 亿个参数,但它却能媲美甚至超越拥有 14 到 27 亿个活跃参数的稠密模型。这就像是一个轻量级选手在短跑中击败了重量级拳击手。
  • “开源”优势: 与许多只分享最终权重(做好的菜肴)却隐藏配方的“开源”模型不同,Soofi S 分享了权重、代码、超参数以及精确的数据账目。

路上的颠簸(局限性)

作者诚实地指出了这位机器人厨师仍然会跌倒的地方:

  1. 德语数学: 虽然它擅长德语小学水平的数学(在 GSM8K-Platinum-DE 上得分 87.1),但在更难的竞赛级德语数学方面表现落后(在 Minerva MATH-DE 上得分为 56.0),落后于像 Qwen3.5 这样的模型。
  2. 记忆检索: 由于它只有 30 亿个活跃参数,它有时难以回忆起现实世界中冷门的知识(在 NaturalQuestions 上得分为 79.0),而规模更大、更稠密的模型能记住更多。作者建议,在实际应用中,你可以通过搭配搜索引擎来解决这个问题。
  3. 代码污染: 在一个名为 LBPP 的特定代码基准测试中(该测试用于检测模型是否只是在死记硬背训练数据),它的得分是 31.0,低于一些规模更大的模型。

结论

Soofi S 证明了你不需要一个庞大、缓慢且稠密的“大脑”也能成为顶尖的 AI。通过使用混合 Mamba-Transformer设计并专注于德语和英语,该团队打造了一个具有主权(在德国土地上构建,由德国资金支持)、开放(完全透明)且高效(运行快速且成本低廉)的模型。

它不是解决一切问题的万灵药——尤其是在高难度德语数学或纯粹的事实检索方面——但对于长对话、编程和双语任务,它为“主权”欧洲模型能达到的高度树立了新标准。作者表示,随着更多高质量德语数据的加入,这个模型可能会变得更好,但就目前而言,它是他们测试过的最强大的全开源德-英基础模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →