A Sovereign, Open-Source Foundation Model for German and English
O artigo apresenta o Soofi S 30B-A3B, um modelo híbrido Mamba Transformer de Mistura de Especialistas (Mixture-of-Experts) soberano e de código aberto, treinado com 27 trilhões de tokens com foco em alemão e inglês, que alcança o desempenho de estado da arte entre os modelos abertos ao mesmo tempo em que oferece eficiência de inferência superior para aplicações de contexto longo.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando construir o robô chef bilíngue definitivo, capaz de cozinhar um banquete tanto em inglês quanto em alemão. A maioria das pessoas pensa que o segredo para um grande chef é apenas contratar uma cozinha maior com mais cozinheiros (mais parâmetros). Mas a equipe por trás do Soofi S descobriu um truque diferente: em vez de contratar 30 bilhões de cozinheiros, eles contrataram uma equipe minúscula e hiper-eficiente de apenas 3 bilhões de cozinheiros ativos que são incrivelmente rápidos em alternar tarefas, enquanto mantêm os outros 27 bilhões como uma enorme biblioteca silenciosa de receitas que podem consultar instantaneamente.
Isso não é apenas uma teoria; é um robô chef totalmente construído e de código aberto chamado Soofi S 30B-A3B que os autores realmente treinaram e testaram. Aqui está a história de como eles o fizeram, o que ele pode fazer e onde ainda existem alguns obstáculos no caminho.
O Molho Secreto: Uma Cozinha Híbrida
A maioria dos modelos de IA é como uma multidão densa de pessoas onde todos têm que gritar para serem ouvidos, o que se torna bagunçado e lento quando a sala fica enorme (conversas longas). O Soofi S é diferente. Ele usa um design híbrido que mistura dois tipos de "cozinheiros":
- Camadas Mamba-2: Pense nestas como os chefs que lembram de toda a história em suas cabeças sem precisar anotá-la. Eles não precisam manter um caderno gigante (chamado de "cache KV") que fica cada vez mais pesado conforme a história se alonga.
- MoE (Mixture of Experts): Esta é a parte dos "3 bilhões ativos". De um total de 31,6 bilhões de parâmetros, o modelo apenas "desperta" 3,2 bilhões deles para cada palavra que gera.
O resultado? Quando você pede para este modelo ler um livro de 1 milhão de palavras, ele não desacelera. Enquanto outros modelos ficam lentos porque têm que carregar um caderno pesado, o Soofi S mantém sua velocidade constante. Os autores mediram isso e descobriram que, em um comprimento de contexto de 40.000 tokens (cerca de 30.000 palavras), o Soofi S foi de 8 a 9 vezes mais rápido na geração de texto do que outros modelos densos de tamanho similar.
A Receita: Foco Alemão-Inglês
A equipe não apenas jogou textos aleatórios da internet na panela. Eles seguiram uma receita rigorosa de três fases projetada para tornar o modelo um campeão em alemão e inglês especificamente, em vez de um chef medíocre para 100 idiomas.
- Fase 1 (A Grande Mistura): Eles começaram com uma massa enorme de 20 trilhões de tokens de dados diversos. Eles deliberadamente garantiram que o alemão não fosse apenas um acompanhamento; eles elevaram o alemão para 7,2% da mistura (comparado aos 5% usuais em outros modelos).
- Fase 2 (O Temperamento de Alta Qualidade): À medida que o modelo ficava mais inteligente, eles mudaram para uma "dieta de alta qualidade". Eles removeram a comida porcaria e focaram nos melhores dados de código, matemática e raciocínio. Aqui, eles aumentaram a parte alemã ainda mais, para 15,3% da mistura.
- Fase 3 (A Extensão de Histórias Longas): Finalmente, eles ensinaram o modelo a lidar com histórias realmente longas, treinando-o em dados que variam de 4.000 a 1 milhão de tokens de comprimento.
Os autores são muito transparentes sobre isso: eles lançaram a lista exata de ingredientes, incluindo quantas vezes repetiram certas receitas de alta qualidade (épocas) e quais decidiram não usar. Eles até admitem que cerca de 1,3% de seus dados em alemão vieram de uma fonte com licença comercial (Genios) que eles não podem compartilhar o texto bruto, mas forneceram as estatísticas exatas para que qualquer pessoa possa auditar a mistura.
O Teste de Sabor: Quão Bom Ele É?
A equipe submetou o Soofi S a um rigoroso teste de sabor contra 16 outros modelos abertos, incluindo gigantes como Olmo 3 32B, Apertus 70B e Qwen3.5 35B.
- A Grande Vitória: O Soofi S tornou-se o melhor performer entre os modelos totalmente abertos tanto para inglês quanto para alemão. Ele venceu todos os baselines soberanos europeus que testaram, muitas vezes por margens enormes. Por exemplo, em benchmarks de código em alemão, ele marcou 84,2 no MBPP-DE, superando o segundo colocado por uma larga margem.
- A Vantagem "Ativa": Embora ative apenas 3 bilhões de parâmetros por vez, ele igualou ou superou modelos densos que possuem 14 a 27 bilhões de parâmetros ativos. É como um corredor leve vencendo um boxeador peso-pesado em um sprint.
- A Vantagem "Aberta": Ao contrário de muitos modelos "abertos" que compartilham apenas os pesos finais (o prato cozido), mas escondem a receita, o Soofi S compartilha os pesos, o código, os hiperparâmetros e a contabilidade exata dos dados.
Os Obstáculos no Caminho (Limitações)
Os autores são honestos sobre onde o robô chef ainda tropeça:
- Matemática em Alemão: Embora seja ótimo em matemática de nível escolar em alemão (marcando 87,1 no GSM8K-Platinum-DE), ele fica atrás em matemática de competição mais difícil (marcando 56,0 no Minerva MATH-DE), ficando atrás de modelos como o Qwen3.5.
- Recuperação de Memória: Como possui apenas 3 bilhões de parâmetros ativos, às vezes tem dificuldade em recordar fatos obscuros do mundo aberto (marcando 79,0 no NaturalQuestions), enquanto modelos maiores e mais densos lembram de mais coisas. Os autores sugerem que, na vida real, você o combinaria com um mecanismo de busca para corrigir isso.
- Contaminação de Código: Em um benchmark de código específico chamado LBPP (que testa se o modelo está apenas memorizando dados de treinamento), ele marcou 31,0, que é inferior a alguns modelos maiores.
O Veredito
O Soofi S prova que você não precisa de um cérebro denso, massivo e lento para ser uma IA de alto nível. Ao usar um design híbrido Mamba-Transformer e focar intensamente em alemão e inglês, a equipe construiu um modelo que é soberano (construído em solo alemão com financiamento alemão), aberto (totalmente transparente) e eficiente (rápido e barato de executar).
Não é uma solução mágica que resolve tudo — especialmente em matemática alemã difícil ou pura recuperação de fatos — mas para conversas longas, codificação e tarefas bilíngues, ele estabelece um novo padrão para o que um modelo europeu "soberano" pode alcançar. Os autores sugerem que, com mais dados de alta qualidade em alemão, este modelo poderia ficar ainda melhor, mas por enquanto, é o modelo base alemão-inglês totalmente aberto mais forte que testaram.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.