NE-BERT: A Multilingual Language Model for Nine Northeast Indian Languages
이 논문은 9개의 북동 인도 언어와 2개의 앵커 언어에 걸쳐 830만 개의 문장으로 학습된 다국어 언어 모델인 NE-BERT를 소개하며, 이는 저자원 언어에서의 심각한 어휘 파편화 문제를 해결하는 동시에 기존의 IndicBERT-V2 및 MuRIL보다 퍼플렉시티(perplexity)와 토큰화 효율성 측면에서 크게 앞선 성능을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기술 요약: NE-BERT
문제 정의
현대 자연어 처리(NLP) 시스템은 고자원 언어와 저자원 언어 사이에서 상당한 성능 격차를 보이며, 이는 디지털 불평등을 심화시킨다. mBERT와 같은 범용 다국어 모델이나 IndicBERT-V2와 같은 지역 특화 모델은 광범위한 커버리지를 제공하지만, 인도 북동부의 토착 언어들을 충분히 지원하는 데에는 한계가 있다. 200개 이상의 다양한 언어가 존재하는 이 지역은 극심한 자원 부족(일부 언어는 디지털화된 문장이 1,000개 미만), 교착적 형태론적 구조, 그리고 다양한 문자 체계(라틴 및 벵골-아삼 문자)라는 독특한 과제에 직면해 있다. 기존 모델들은 이러한 맥락에서 희귀 단어가 부적절한 서브워드(subword) 단위로 분절되어 추론 효율성과 의미적 일관성을 심각하게 저해하는 '어휘 파편화(vocabulary fragmentation)' 현상을 겪는 경우가 많다.
방법론
저자는 9개의 인도 북동부 언어와 2개의 앵커 언어(힌디어 및 영어)를 위해 특별히 설계된 ModernBERT 아키텍처 기반의 도메인 특화 다국어 인코더 모델인 NE-BERT를 소개한다.
1. 데이터셋 구축
학습 코퍼스는 다음을 포함하여 약 830만 개의 문장으로 구성된다:
- 9개의 인도 북동부 언어: 아삼어, 가로어, 카시어, 메이테이어, 미조어, 나가어, 니시어, 프나어, 코크보록어.
- 2개의 앵커 언어: 힌디어 및 영어.
- 출처: 정부 문서, 뉴스 아카이브, 교육 자료 및 문화 텍스트에서 데이터를 큐레이션하였다. 니시어와 코크보록어를 위한 특정 병렬 코퍼스는 WMT 2025 Shared Task에서 확보하였다.
2. 가중 샘플링 전략
극단적인 데이터 불균형(Pnar의 1,002문장에서 힌디어의 340만 문장에 이르는 범위)을 해결하기 위해, 저자는 토크나이저 학습 시 공격적인 가중 샘플링(weighted sampling) 기법을 적용하였다:
- 초저자원 언어(예: Pnar, Kokborok)는 어휘 표현을 보장하고 문자 수준의 파편화를 방지하기 위해 100배 업샘플링 가중치를 부여받았다.
- 앵커 언어(힌디어 0.05배, 영어 0.2배)는 북동부 언어의 어휘를 우선시하면서도 교차 언어 전이 능력을 유지하기 위해 다운웨이팅(downweighted)되었다.
- 참고: 이러한 가상 계수는 토크나이저 학습에만 적용되었으며, 실제 마스크드 언어 모델링(MLM) 학습에는 과적합을 방지하기 위해 원본 문장 수를 사용하였다.
3. 토크나이제이션(Tokenization)
본 논문은 더 일반적인 바이트 쌍 인코딩(BPE) 대신 커스텀 SentencePiece Unigram 토크나이저(50,368개 토큰)를 사용한다.
- 근거: Unigram의 확률적 접근 방식은 탐욕적 병합 전략을 사용하는 BPE보다 교착어의 언어적 구조를 더 잘 보존한다.
- 설정: 토크나이저는 북동부 언어의 일반적인 단어들이 단일 토큰을 형성하여 시퀀스 길이를 줄이고 의미적 일관성을 높일 수 있도록, 가중치가 적용된 가상 계수를 바탕으로 학습되었다.
4. 모델 아키텍처 및 학습
- 기반 모델: 1억 4,900만 개의 파라미터(22개 레이어, 768 차원 은닉층, 12개 어텐션 헤드)를 가진 ModernBERT-base (Warner et al., 2025).
- 특징: 회전 위치 임베딩(RoPE), Flash Attention 2, 그리고 처리량 향상을 위한 언패딩(unpadding).
- 학습: 15%의 마스킹 확률과 동적 마스킹을 적용한 MLM 방식으로 10 에포크 동안 학습되었다.
- 효율성: 단일 NVIDIA A40 GPU (48GB VRAM)에서 약 17시간 동안 학습되었으며, 비용은 $7.31가 소요되었다.
주요 결과
퍼플렉시티(Perplexity) 성능
NE-BERT는 홀드아웃 테스트 세트(언어당 500개 문장)를 통해 IndicBERT-V2, MuRIL, mBERT와 비교 평가되었다.
- 전반적 성능: NE-BERT는 9개 북동부 언어 전체에서 평균 2.21의 퍼플렉시티를 달성하여, IndicBERT-V2(35.29)와 MuRIL(16.88)을 크게 앞섰으며 mBERT(2.76)보다 우수한 성능을 보였다.
- 평균 개선도: NE-BERT는 9개 북동부 인도 언어에 대해 IndicBERT-V2 대비 15.97배, MuRIL 대비 7.64배 낮은 평균 퍼플렉시티를 기록했다.
- 초저자원 언어에서의 이득: 가장 극적인 개선은 데이터가 최소한인 언어에서 관찰되었다. Pnar(1,002문장)와 Nyishi(55,870문장)의 경우, NE-BERT는 퍼플렉시티를 각각 2.92와 4.33으로 낮춘 반면, IndicBERT-V2는 Pnar 66.92, Nyishi 187.20이라는 치명적인 실패를 보였다.
- 고자원 성능: 위키피디아 커버리지가 넓은 언어(아삼어, 메이테이어)의 경우 mBERT가 경쟁력을 유지했으나, NE-BERT 역시 우수하거나 대등한 결과를 달성했다.
토크나이제이션 효율성
- 생산성(Fertility): NE-BERT는 북동부 언어에 대해 평균 1.68 tokens/word의 생산성을 달성하였는데, 이는 IndicBERT-V2(2.08), MuRIL(2.14), mBERT(2.51)보다 우수한 수치이다. 이는 mBERT 대비 1.50배의 개선을 의미한다.
- 문자당 비트(BPC): NE-BERT는 평균 BPC 0.347을 달성하여, IndicBERT-V2(1.497) 및 MuRIL(1.271)보다 뛰어난 압축 효율성을 입증했다.
다운스트림 평가
카시어, 미조어, 나가어의 품사(POS) 태깅 작업에서:
- NE-BERT는 평균 **82.4%**의 정확도를 달 기록하며, mBERT(73.3%)보다 9.1%포인트, IndicBERT-V2(59.2%)보다 23.2%포인트 높은 성능을 보였다.
의의 및 주장
본 논문은 적절한 토크나이제이션을 갖춘 도메인 특화 모델이 1,000개의 학습 문장만으로도 초저자원 언어를 효과적으로 지원할 수 있음을 입증한다.
- 규모보다 어휘 최적화: 본 결과는 모델 규모를 키우는 것만으로는 저자원 성능을 보장할 수 없다는 통념에 도전한다. 저자는 이러한 특정 언어적 맥락에서는 모델의 파라미터 수보다 정교한 어휘 최적화(가중 Unigram 토크나이제이션을 통해)와 타겟팅된 학습 데이터가 더 중요하다고 주장한다.
- 비용 효율성: 단일 GPU에서 10달러 미만으로 경쟁력 있는 모델을 학습시킨 것은 전 세계 저자원 언어를 위한 언어 모델 개발의 실질적인 청사진을 제공한다.
- 디지털 포용: '다국어의 저주'와 어휘 파편화 문제를 해결함으로써, NE-BERT는 주류 NLP 연구에서 소외되었던 인도 북동부 공동체를 위한 NLP 연구 및 디지털 포용을 지원하는 것을 목표로 한다.
저자는 재현성과 커뮤니티 기반 응용을 촉진하기 위해 모델, 토크나이저, 학습 코퍼스 및 테스트 세트를 CC-BY-4.0 라이선스로 공개한다. 또한, 인코더 전용 아키텍처의 한계(생성 작업에는 부적합함)와 9개 언어 전체에 걸친 다양한 작업에 대한 추가적인 다운스트림 평가의 필요성을 인정하였다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.