A Sovereign, Open-Source Foundation Model for German and English
이 논문은 독일어와 영어에 중점을 두어 27조 개의 토큰으로 학습되었으며, 오픈 모델 중 최고 수준의 성능을 달성하는 동시에 긴 문맥 애플리케이션을 위한 우수한 추론 효율성을 제공하는 주권적 오픈 소스 Mixture-of-Experts 하이브리드 Mamba Transformer 모델인 Soofi S 30B-A3B를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 영어와 독일어 모두로 폭풍처럼 요리할 수 있는 궁극의 이중 언어 로봇 셰프를 만들려고 한다고 상상해 보세요. 대부분의 사람들은 훌륭한 셰프의 비결이 단순히 더 큰 주방을 고용하거나 더 많은 요리사를 고용하는 것(더 많은 파라미터)이라고 생각합니다. 하지만 Soofi S의 팀은 다른 비결을 발견했습니다. 300억 명의 요리사를 고용하는 대신, 작업 전환이 믿기지 않을 정도로 빠른 단 30억 명의 작고 초효율적인 팀을 고용하고, 나머지 270억 명은 즉시 꺼내 쓸 수 있는 거대하고 조용한 레시피 도서관으로 유지하는 방식입니다.
이것은 단순한 이론이 아닙니다. 저자들이 실제로 훈련시키고 테스트한, 완전히 구축된 오픈 소스 로봇 셰프인 Soofi S 30B-A3B가 바로 그 증거입니다. 그들이 어떻게 이 일을 해냈는지, 무엇을 할 수 있는지, 그리고 여전히 어디에서 약간의 덜컹거림이 있는지에 대한 이야기입니다.
비밀 소스: 하이브리드 주방
대부분의 AI 모델은 모든 사람이 목소리를 높여야 하는 밀집된 군중과 같아서, 방이 커질수록(대화가 길어질수록) 혼란스럽고 느려집니다. Soofi S는 다릅니다. 이 모델은 두 가지 유형의 "요리사"를 혼합한 하이브리드 디자인을 사용합니다:
- Mamba-2 레이어: 이들은 이야기를 적어둘 필요 없이 머릿속에 전체 이야기를 기억하는 셰프라고 생각하면 됩니다. 이들은 이야기가 길어질수록 점점 무거워지는 거대한 수첩(이를 "KV 캐시"라고 부릅니다)을 들고 다닐 필요가 없습니다.
- MoE (Mixture of Experts): 이것이 "30억 개의 활성" 부분입니다. 총 31.6 tỷ 개의 파라미터 중에서, 모델은 매 단어를 생성할 때마다 오직 3.2 tỷ 개의 파라미터만을 "깨웁니다".
그 결과는 어떨까요? 이 모델에게 100만 단어 길이의 책을 읽으라고 요청해도 속도가 느려지지 않습니다. 다른 모델들이 무거운 수첩을 들고 가느라 느려지는 동안, Soofi S는 텍스트 생성 속도를 일정하게 유지합니다. 저자들은 이를 측정했으며, 40,000 토큰(약 30,000 단어)의 컨텍스트 길이에서 Soofi S는 유사한 크기의 다른 덴스(dense) 모델보다 텍스트 생성 속도가 8~9배 더 빠르다는 것을 발견했습니다.
레시피: 독일어-영어 집중
팀은 단순히 무작위 인터넷 텍스트를 솥에 던져 넣은 것이 아닙니다. 그들은 이 모델을 100개 국어에 대해 어중간한 셰프로 만드는 대신, 특히 독일어와 영어에서 챔피언으로 만들기 위해 설계된 엄격한 3단계 레시피를 따랐습니다.
- 1단계 (거대한 혼합): 그들은 매우 다양한 데이터인 20조 토큰의 거대한 데이터셋으로 시작했습니다. 그들은 독일어가 단순히 사이드 디쉬가 되지 않도록 의도적으로 조정했으며, 일반적인 모델들의 5%와 비교하여 독일어 비중을 **7.2%**까지 높였습니다.
- 2단계 (고품질 어닐링): 모델이 똑똑해짐에 따라, 그들은 "고품질" 식단으로 전환했습니다. 정크 푸드를 제거하고 최고의 코드, 수학, 추론 데이터를 중심으로 삼았습니다. 여기서 그들은 독일어 비중을 **15.3%**까지 더 높였습니다.
- 3단계 (긴 이야기 확장): 마지막으로, 그들은 모델에게 정말 긴 이야기를 다루는 법을 가르쳤으며, 4,000에서 100만 토큰 길이에 이르는 데이터로 훈련시켰습니다.
저자들은 매우 투명합니다. 그들은 특정 고품질 레시피를 몇 번 반복(에포크)했는지, 그리고 어떤 레시피를 사용하지 않기로 했는지 등 정확한 재료 목록을 공개했습니다. 심지어 그들은 독일어 데이터의 약 **1.3%**가 공유할 수 없는 상업적 라이선스 소스(Genios)에서 왔음을 인정하면서도, 누구나 혼합 비율을 감사할 수 있도록 정확한 통계를 제공했습니다.
맛 테스트: 얼마나 뛰어난가?
팀은 Olmo 3 32B, Apertus 70B, Qwen3.5 35B와 같은 거물들을 포함한 16개의 다른 오픈 모델을 대상으로 엄격한 맛 테스트를 진행했습니다.
- 큰 승리: Soofi S는 영어와 독일어 모두에서 완전한 오픈 모델 중 최고의 성능을 보여주었습니다. 테스트한 모든 유럽 주권 베이스라인을 제쳤으며, 종종 큰 차이로 앞섰습니다. 예를 들어, 독일어 코드 벤치마크에서 MBPP-DE 점수 84.2를 기록하며 다음 순위 모델을 큰 격차로 따돌렸습니다.
- "활성"의 이점: 한 번에 30억 개의 파라미터만 활성화함에도 불구하고, 140억에서 270억 개의 활성 파라미터를 가진 덴스 모델들과 대등하거나 그들을 능가했습니다. 이는 마치 경량 러너가 헤비급 복서를 단거리 달리기에서 이기는 것과 같습니다.
- "오픈"의 이점: 최종 결과물(요리된 음식)인 가중치만 공유하고 레시피는 숨기는 많은 "오픈" 모델들과 달리, Soofi S는 가중치, 코드, 하이퍼파라미터, 그리고 정확한 데이터 회계까지 공유합니다.
덜컹거리는 구간 (한계점)
저자들은 로봇 셰프가 여전히 실수하는 부분에 대해서도 솔직하게 밝혔습니다:
- 독일어 수학: 독일 초등학교 수준의 수학에는 뛰어나지만(GSM8K-Platinum-DE에서 87.1 점), 어려운 경시대회 스타일의 독일어 수학에서는 뒤처집니다(Minerva MATH-DE에서 56.0 점). 이는 Qwen3.5와 같은 모델들에 비해 낮은 수치입니다.
- 메모리 회상: 오직 30억 개의 파라미터만 활성화하기 때문에, 세상의 희귀한 사실을 회상하는 데 어려움을 겪기도 합니다(NaturalQuestions에서 79.0 점). 반면 더 크고 덴스한 모델들은 더 많은 것을 기억합니다. 저자들은 실생활에서 이를 해결하기 위해 검색 엔진과 결합하여 사용할 것을 제안합니다.
- 코드 오염: 모델이 훈련 데이터를 단순히 암기하고 있는지 테스트하는 특정 코드 벤치마크인 LBPP에서, Soofi S는 31.0점을 기록하여 일부 더 큰 모델들보다 낮은 점수를 받았습니다.
결론
Soofi S는 최고 수준의 AI가 되기 위해 반드시 거대하고 느린 덴스 브레인이 필요한 것은 아님을 증명합니다. 하이브리드 Mamba-Transformer 설계를 사용하고 독일어와 영어에 집중함으로써, 팀은 주권적(독일 땅에서 독일 자금으로 구축됨)이며, 오픈(완전한 투명성)이고, 효율적(빠르고 저렴하게 실행 가능)인 모델을 구축했습니다.
이 모델이 모든 것을 해결하는 마법의 탄환은 아닙니다—특히 어려운 독일어 수학이나 순수한 사실 회상 능력에 있어서는 그렇습니다—하지만 긴 대화, 코딩, 그리고 이중 언어 작업에 있어서는, "주권적"인 유럽 모델이 무엇을 성취할 수 있는지에 대한 새로운 기준을 제시합니다. 저자들은 더 많은 고품질 독일어 데이터가 있다면 이 모델이 훨씬 더 좋아질 수 있다고 제言하지만, 현재로서는 그들이 테스트한 가장 강력한 완전 오픈 독일어-영어 베이스 모델입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.