SozKZ: Training Efficient Small Language Models for Kazakh from Scratch
이 논문은 90 억 토큰의 카자흐어 데이터와 언어에 적합한 토크나이저를 활용해 0 에서부터 학습된 50M~600M 파라미터 규모의 전용 소규모 언어 모델 'SozKZ'를 제안하며, 이는 더 큰 규모의 다국어 모델과 경쟁력 있는 성능을 보이면서도 계산 비용을 크게 절감할 수 있음을 입증합니다.
지금까지 나온 세계적인 AI 모델들 (Llama, Qwen 등) 은 전 세계 100 개 이상의 언어를 한꺼번에 공부한 '거대한 종합 도서관' 같은 존재입니다.
문제점: 이 도서관은 영어 등 주요 언어에 책이 넘쳐나지만, 카자흐어 같은 소수 언어는 책장 구석에 barely (겨우) 몇 권만 꽂혀 있습니다.
비유: 카자흐어는 문법 구조가 매우 복잡하고 (접미사가 많은 언어), 이 거대한 도서관의 사서 (토크나이저) 는 카자흐어를 제대로 이해하지 못해 한 문장을 읽을 때 불필요하게 2~3 배 더 많은 조각 (토큰) 으로 잘라냅니다. 마치 "사과"라는 단어를 읽을 때 "사 - 과 - 껍질 - 빨간 - 맛"처럼 너무 잘게 쪼개서 읽는 것과 같습니다. 그래서 AI 가 카자흐어를 이해하는 데는 비효율적이고, 성능도 떨어집니다.
🛠️ 2. 해결책: "카자흐어 전용 작은 서점"
연구진은 "전 세계 모든 언어를 다 알 필요는 없다"고 생각했습니다. 대신 **카자흐어만 전문으로 다루는 작지만 완벽한 '전용 서점'**을 짓기로 했습니다.
SozKZ (소즈KZ): 카자흐어 텍스트 90 억 개를 모아서 처음부터 (Scratch) 훈련시킨 AI 모델 가족입니다. 크기는 5000 만 개에서 6 억 개 파라미터까지 다양합니다.
전용 사서 (토크나이저): 이 서점에는 카자흐어 단어의 뉘앙스를 정확히 아는 전용 사서 (5 만 개 단어장) 가 있습니다. 그래서 "사과"를 불필요하게 쪼개지 않고, 한 덩어리로 자연스럽게 인식합니다.
🏆 3. 결과: "작은 서점이 거대 도서관을 이긴다?"
연구진은 이 작은 AI 들을 거대한 다국어 AI 들과 비교해 보았습니다. 결과는 놀라웠습니다.
문화 퀴즈 (MC QA): 카자흐 문화와 역사에 대한 퀴즈에서, 6 억 파라미터짜리 SozKZ는 **10 억 파라미터짜리 거대 AI(Llama-3.2-1B)**와 거의 비슷한 점수를 받았습니다. (30.3% vs 32.0%)
비유: 작은 동네 서점 사서가 거대 도서관 사서보다 지역 역사 퀴즈를 더 잘 맞춘 것입니다.
주제 분류 (SIB-200): 텍스트가 어떤 주제인지 분류하는 작업에서는 **SozKZ-50M(가장 작은 모델)**조차 **20 억 파라미터짜리 거대 AI(Gemma-2B)**보다 훨씬 잘했습니다.
비유: 작은 서점 사서가 책 제목만 보고도 "이건 요리책이야, 이건 역사책이야"를 20 배 큰 도서관 사서보다 훨씬 빠르게 알아맞혔습니다. 이는 **전용 사서 (토크나이저)**가 카자흐어 단어의 뉘앙스를 정확히 파악했기 때문입니다.
💡 4. 핵심 교훈: "크기보다 적합함"
이 연구는 **"무조건 큰 AI 가 좋은 것은 아니다"**라는 것을 증명했습니다.
효율성: 소수 언어를 위해 특화된 작은 AI 는, 거대 AI 가 하는 일의 80~90% 를 컴퓨터 비용의 1/10 이하로 해낼 수 있습니다.
확장성: 모델 크기를 키울수록 (50M → 600M) 성능이 꾸준히 좋아졌는데, 아직 한계에 도달하지 않아 더 크게 만들면 더 좋아질 것으로 보입니다.
🚀 결론
이 논문은 **"카자흐어처럼 소외된 언어를 위해, 거대한 AI 를 베끼는 것이 아니라, 그 언어에 딱 맞는 작은 전용 AI 를 처음부터 만드는 것"**이 훨씬 효율적이고 성공적인 방법임을 보여줍니다.
마치 **"전 세계를 여행하는 거대한 크루즈 선"**도 좋지만, **"카자흐 강을 빠르고 정확하게 오가는 전용 보트"**가 그 강에서는 훨씬 더 빠르고 유용하다는 것을 증명한 연구입니다. 연구진은 이 모델과 기술을 모두 공개하여, 다른 소수 언어 개발자들에게도 길을 열어주었습니다.
논문 개요: SozKZ (Kazakh 전용 소형 언어 모델)
이 논문은 카자흐어와 같은 저자원 (Low-resource) 언어를 위한 효율적인 언어 모델 개발을 목표로 합니다. 저자들은 기존 다국어 모델들이 카자흐어의 풍부한 형태론적 특성 (교착어) 을 처리하는 데 비효율적이라는 문제를 지적하고, 카자흐어 전용으로 처음부터 (from scratch) 학습된 소형 언어 모델 'SozKZ' 패밀리를 제안합니다.
1. 문제 제기 (Problem)
저자원 언어의 소외: 카자흐어는 약 2,200 만 명이 사용하는 튀르크어족 언어이지만, 기존 대규모 다국어 모델 (Llama, Gemma, Qwen 등) 에서는 할당된 용량이 매우 적습니다.
토크나이저의 비효율성: 카자흐어는 풍부한 접미사 (agglutinative morphology) 를 가진 언어입니다. 영어 중심 데이터로 학습된 범용 토크나이저는 카자흐어 단어를 과도하게 잘게 쪼개어 (high fertility, 단위 단어당 토큰 수 증가) 컨텍스트 윈도우를 낭비하고 추론 비용을 증가시킵니다.
자원 비효율: 다국어 모델은 카자흐어 외의 다른 언어 지식을 인코딩하는 파라미터가 대부분을 차지하여, 카자흐어 태스크 수행에 대한 파라미터 대비 효율이 낮습니다.
2. 방법론 (Methodology)
가. 데이터 수집 및 전처리
코퍼스 구성: CulturaX, HPLT 2.0, Kazakh Wikipedia 등 18 개 소스에서 약 2,840 만 개의 문서를 수집했습니다.
정제 파이프라인: 9 단계의 정제 과정 (Unicode 정규화, 제어 문자 제거, URL/HTML 필터링, 언어 식별, 중복 제거 등) 을 거쳐 최종적으로 약 90 억 토큰 (9B tokens) 의 카자흐어 전용 코퍼스를 구축했습니다. (원본 대비 48.2% 통과율)
나. 전용 토크나이저 설계
ByteLevel BPE: 카자흐어 텍스트만으로 학습된 50K 어휘 크기의 전용 BPE 토크나이저를 개발했습니다.
효율성: 범용 토크나이저 대비 2~3 배 낮은 Fertility(단위 단어당 토큰 수) 를 달성하여, 동일한 컨텍스트 윈도우 내에서 더 많은 의미 정보를 처리할 수 있게 했습니다.
다. 모델 아키텍처 및 학습
아키텍처: Llama 아키텍처 (SwiGLU, RoPE, RMSNorm, tied embeddings) 를 기반으로 합니다.
규모: 4 가지 파라미터 규모 (50M, 150M, 300M, 600M) 의 모델을 처음부터 학습시켰습니다.
학습 전략: Chinchilla 최적 비율 (파라미터당 20 토큰) 에 비해 약간 낮은 15:1 비율로 학습했습니다 (카자흐어 고품질 데이터의 제한적 가용성 반영).
하드웨어: 50M/150M 모델은 RTX 4090, 600M 모델은 H100 GPU 를 사용하여 학습했습니다.
3. 주요 기여 (Key Contributions)
엔드 - 투 - 엔드 파이프라인: 데이터 수집, 정제, 토크나이저 학습, 4 가지 규모의 모델 학습까지의 전체 파이프라인을 구축하고 오픈소스로 공개했습니다.
전용 토크나이저: 카자흐어 형태론에 최적화된 50K 어휘 토크나이저를 설계하여 다국어 모델 대비 효율성을 입증했습니다.
경쟁력 있는 성능: 600M 파라미터 모델이 25 배 큰 다국어 모델 (1B3B) 과 경쟁력 있는 성능을 보이며, 특히 주제 분류 (Topic Classification) 에서 압도적인 우위를 보였습니다.
스케일링 법칙 분석: 50M 에서 600M 까지의 성능 향상 곡선을 분석하여, 카자흐어 전용 모델의 추가적인 스케일링이 여전히 유익함을 입증했습니다.
오픈 라이선스 공개: 모든 모델, 토크나이저, 학습 코드를 오픈 라이선스로 공개하여 카자흐어 NLP 연구 생태계를 지원했습니다.
4. 실험 결과 (Results)
세 가지 카자흐어 벤치마크 (MC QA, Belebele, SIB-200) 에서 500M~3B 파라미터 규모의 5 개 다국어 모델 (Qwen, Llama 3, Gemma) 과 비교 평가했습니다.
카자흐 문화 QA (MC QA):
SozKZ-600M: 정확도 30.3% 달성.
비교: 2 배 큰 Llama-3.2-1B(32.0%) 에 근접하며, Qwen-0.5B(31.5%) 와도 유사한 성능을 보였습니다.
독해 이해 (Belebele):
모든 모델이 27~32% 범위에 분포하여, 이 규모에서는 지시 학습 (Instruction Tuning) 없이는 한계가 있음을 시사했습니다. SozKZ-600M 은 27.0% 를 기록했습니다.
주제 분류 (SIB-200):
SozKZ-600M: 정확도 25.5% 달성.
비교: 2B 파라미터 모델 (Gemma-2B, Qwen-1.5B) 을 모두 능가했습니다. 특히 SozKZ-50M(25.5%) 이 30 배 큰 Qwen-1.5B(11.8%) 보다 훨씬 높은 성능을 보였습니다. 이는 전용 토크나이저가 단어 경계와 접미사 구조를 잘 보존하여 주제 인식에 결정적 역할을 했음을 의미합니다.
스케일링 분석:
MC QA 성능은 파라미터 증가에 따라 50M(22.8%) 에서 600M(30.3%) 까지 꾸준히 향상되었으며, 포화 현상이 관찰되지 않아 추가 스케일링의 가능성을 보여주었습니다.
5. 의의 및 결론 (Significance)
효율성의 증명: 소규모의 전용 모델이 대규모 다국어 모델과 경쟁할 수 있음을 입증했습니다. 이는 저자원 언어 기술 개발에 있어 계산 비용의 절감과 성능의 최적화를 동시에 달성할 수 있는 viable path(실행 가능한 경로) 를 제시합니다.
토크나이저의 중요성: 교착어와 같은 형태론이 풍부한 언어에서는 모델 크기보다 언어에 적합한 토크나이저가 성능에 더 큰 영향을 미칠 수 있음을 실증했습니다.
미래 방향: 600M 이상의 규모로 확장하거나, 지시 학습 (Instruction Tuning) 을 적용하면 성능을 더욱 향상시킬 수 있을 것으로 기대됩니다. 또한, 터키어, 우즈베크어 등 다른 튀르크어족 언어로 이 접근법을 확장할 수 있습니다.
이 연구는 SozKZ 모델 패밀리와 토크나이저를 공개함으로써, 저자원 언어를 위한 효율적인 언어 모델 개발의 새로운 기준을 제시했습니다.