← 최신 논문
💬 NLP

MzansiText and MzansiLM: An Open Corpus and Decoder-Only Language Model for South African Languages

이 논문은 남아프리카 공화국의 11 개 공식 언어를 대상으로 구축된 오픈 코퍼스 'MzansiText'와 1 억 2,500 만 파라미터의 디코더 전용 언어 모델 'MzansiLM'을 소개하고, 다양한 적응 전략을 통해 소규모 모델로도 저자원 언어의 자연어 이해 및 생성 작업에서 경쟁력 있는 성능을 달성할 수 있음을 입증합니다.

원저자: Anri Lombard, Simbarashe Mawere, Temi Aina, Ethan Wolff, Sbonelo Gumede, Elan Novick, Francois Meyer, Jan Buys

게시일 2026-03-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Anri Lombard, Simbarashe Mawere, Temi Aina, Ethan Wolff, Sbonelo Gumede, Elan Novick, Francois Meyer, Jan Buys

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 문제: 거인 vs. 작은 마을 (왜 작은 AI 가 필요한가?)

지금까지 AI 는 거대한 도서관 (수조 개의 데이터) 을 가진 거인들이었습니다. 하지만 남아공에는 11 개의 공식 언어가 있는데, 그중 9 개는 자료가 매우 부족한 '작은 마을' 같은 언어들입니다.

  • 기존 방식: 거대한 도서관 (거대 AI) 을 빌려와서 작은 마을의 언어를 가르치려 했지만, 거인은 너무 커서 작은 마을의 세세한 사투리나 뉘앙스를 잘 이해하지 못했습니다.
  • 연구자의 아이디어: "거인이 아니라, 그 마을에 태어나서 자란 작은 아이를 키워보자!"
  • 결과: 연구자들은 125M(1 억 2 천 5 백만) 파라미터라는 작은 AI를 처음부터 직접 키웠습니다. 이 크기는 거대 AI 에 비하면 작지만, 남아공의 11 개 언어를 모두 골고루 배울 수 있는 최적의 크기입니다.

2. 준비물: MzansiText (맛있는 재료 모음)

요리를 잘 하려면 좋은 재료가 필요합니다. 연구자들은 MzansiText라는 이름의 특별한 재료 장바구니를 만들었습니다.

  • 재료: 인터넷 뉴스, 위키백과, 정부 문서 등 남아공의 11 개 언어로 된 텍스트를 모았습니다.
  • 선별 과정 (필터링): 인터넷에는 쓰레기 같은 글도 많습니다. 연구자들은 **정교한 체 (필터)**를 이용해 언어가 섞인 글, 오타가 많은 글, 불필요한 광고 등을 걷어내고 가장 깨끗하고 맛있는 글만 남겼습니다.
  • 특이점: 영어와 아프리칸스어 (남아공의 주요 언어) 가 너무 많아서 다른 언어가 묻힐 뻔했지만, 연구자들은 "비록 양은 적어도 모든 언어를 골고루 배워야 한다"며 재료를 정성스럽게 배분했습니다.

3. 훈련 방법: 세 가지 교육 방식 (어떻게 가르쳤나?)

이 작은 AI 를 다양한 일을 시키기 위해 세 가지 다른 교육 방식을 시험해 보았습니다.

  1. 단어장 외우기 (단일 언어 특화):
    • "줄루어만 하는 일"을 시킬 때, 줄루어 자료만 보고 집중적으로 공부하게 했습니다.
    • 결과: 가장 잘했습니다! 특히 "데이터를 글로 바꾸기"나 "이름 찾기" 같은 구체적인 작업에서 거대 AI 들보다 더 잘할 때도 있었습니다.
  2. 친구들과 함께 공부하기 (다국어 특화):
    • 줄루어, 코사어, 세소토어 등 비슷한 언어끼리 한 반에 모아 함께 공부하게 했습니다. (비슷한 언어는 문법이 비슷하니까 서로 도움을 줄 수 있습니다.)
    • 결과: 뉴스 주제 분류 같은 작업에서 서로 도움을 주며 좋은 성적을 냈습니다.
  3. 모든 과목 한 번에 배우기 (지시 명령 학습):
    • "이건 요약해 줘, 저건 번역해 줘, 이건 분류해 줘"라고 모든 지시를 섞어서 가르쳤습니다.
    • 결과: 다양한 일을 할 수는 있지만, 특정 일에 대해서는 앞의 두 방법보다 조금 약했습니다.

4. 결론: 작은 AI 의 승리와 한계

이 실험을 통해 연구자들은 중요한 사실을 발견했습니다.

  • 승리: 작은 AI 는 구체적인 일 (글쓰기, 이름 찾기, 요약) 을 시키면 아주 훌륭합니다. 심지어 10 배 이상 큰 AI 들보다 더 잘할 때도 있습니다. 이는 "작은 모델도 잘 훈련되면 큰 일을 할 수 있다"는 것을 보여줍니다.
  • 한계: 하지만 추리력이 필요한 일 (예: "이 글의 숨은 뜻을 찾아라"나 "수학 문제를 풀어라") 은 여전히 어렵습니다. 작은 AI 는 이런 복잡한 논리 문제에서는 거의 무작위 추측 수준에 머뭅니다. 이런 일은 아직 거대 AI 가 필요합니다.

요약하자면?

이 논문은 **"남아공의 모든 언어를 위한 작지만 똑똑한 AI 를 처음부터 만들어 보았다"**는 이야기입니다.

  • MzansiText: 깨끗하게 정제된 남아공 언어 데이터.
  • MzansiLM: 그 데이터로 키운 125M 크기의 작은 AI.
  • 교훈: 거대 AI 가 모든 것을 다 할 수는 없습니다. 작은 AI 가 특정 언어와 특정 일에 특화되면, 거인보다 더 빠르고 정확하게 일할 수 있습니다.

연구자들은 이 모델과 데이터를 모두 공개하여, 앞으로 남아공의 언어 기술을 발전시키는 데 누구나 사용할 수 있는 **기준선 (Baseline)**을 제공했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →