Towards High-Quality Machine Translation for Kokborok: A Low-Resource Tibeto-Burman Language of Northeast India
이 논문은 인도 동북부 트리푸라 주의 저자원 티베토-버마어족 언어인 코코보록어 (Kokborok) 에 대해 SMOL 데이터셋, 성경 텍스트, 그리고 Gemini Flash 를 활용한 역번역 데이터를 결합하여 NLLB-200 모델을 미세 조정함으로써 기존 성능을 크게 향상시킨 고품질 신경 기계 번역 시스템 'KokborokMT'를 제안합니다.
이 논문은 인도 동북부의 '코코보로크 (Kokborok)'라는 언어를 위해 만든 고급 번역기 개발 이야기를 담고 있습니다. 이 내용을 마치 친구에게 이야기하듯, 쉬운 비유와 일상적인 언어로 설명해 드릴게요.
🌍 배경: 잊혀진 언어의 외로움
인도 트리푸라 주에는 약 150 만 명이 사용하는 '코코보로크'라는 언어가 있습니다. 공식 언어이지만, 컴퓨터나 인공지능 (AI) 세상에서는 아주 외로운 존재였습니다.
비유: 마치 도서관에 책이 100 권 있는데, 그중 99 권은 영어로 되어 있고 코코보로크 책은 딱 1 권 (성경 번역본) 만 있는 상황입니다.
문제: 기존 AI 는 이 언어를 거의 이해하지 못해, 번역을 하면 엉뚱한 말만 뱉어냈습니다 (점수 7 점 만점에 1 점 미만).
🛠️ 해결책: "코코보로크 번역기 (KokborokMT)" 만들기
저자들은 이 외로운 언어를 돕기 위해 세 가지 재료를 섞어 새로운 AI 를 만들었습니다.
전문가들의 손길 (SMOL 데이터):
구글의 'SMOL' 프로젝트에서 전문가들이 번역한 고품질 문장 9,000 여 개를 가져왔습니다.
비유: 요리할 때 미쉐린 스타 셰프가 쓴 레시피를 구한 셈입니다. 건강, 교육, 일상 대화 등 다양한 주제를 다룹니다.
기존의 보물 (성경 데이터):
과거에 사용되던 성경 번역 문장 1,700 여 개를 추가했습니다.
비유: 오래된 전통 레시피를 하나 더 추가한 것입니다. 비록 주제 (종교) 는 한정적이지만, 언어의 뼈대를 잡아줍니다.
마법의 지팡이 (LLM 을 이용한 합성 데이터):
가장 중요한 부분입니다. 구글의 '제미나이 (Gemini)'라는 AI 를 시켜, 영어 문장 25,000 개를 코코보로크로 번역하게 했습니다.
비유:마법 지팡이로 식재료를 무한히 증식시킨 것입니다. 실제로는 코코보로크 문장이 부족했지만, AI 가 "만약 이 영어 문장을 코코보로크로 번역했다면 이렇게 되었을 거야"라고 만들어낸 가상의 문장들을 학습에 썼습니다. 비용은 약 7 달러 (한화 1 만 원) 밖에 들지 않았습니다.
🧪 실험 결과: 놀라운 변화
이렇게 만든 AI 를 테스트해 보니 결과가 극적으로 변했습니다.
기존 AI: 번역이 거의 불가능했습니다. (점수 1~7 점)
새로운 AI (KokborokMT):
영어 → 코코보로크: 점수 17.3 (약 2.5 배 향상)
코코보로크 → 영어: 점수 38.5 (약 13 배 향상!)
사람 평가: 실제 코코보로크 화자 3 명이 번역문을 평가했을 때, "의미는 잘 전달되고 (3.74/5), 문장도 자연스럽다 (3.70/5)"고 평했습니다.
💡 중요한 발견 (혹은 경고)
저자들은 "합성 데이터 (AI 가 만든 데이터) 중 엉터리가 섞여 있지 않을까?" 싶어 필터링 도구를 썼습니다. 하지만 여기서 중요한 교훈을 얻었습니다.
발견: 기존에 쓰던 필터링 도구 (LaBSE) 는 코코보로크처럼 자신도 배워보지 않은 언어에는 전혀 작동하지 않았습니다. 점수가 낮게 나와도 실제 번역은 괜찮았습니다.
비유: "새로운 언어를 가르치려는데, 그 언어를 모르는 교사가 학생의 시험지를 채점하러 온 꼴"입니다. 그래서 모든 데이터를 다 믿고 사용하기로 했습니다.
🚀 결론
이 연구는 적은 자원으로도 AI 를 훈련시킬 수 있다는 것을 보여줍니다.
전문가 번역 + 기존 자료 + AI 가 만들어낸 가상의 자료를 섞으면, 아주 드문 언어도 AI 가 잘 이해하게 만들 수 있습니다.
이제 이 모델과 데이터는 모두 공개될 예정이며, 앞으로 코코보로크를 포함한 동북부 인도 언어들의 디지털 발전을 위한 발판이 될 것입니다.
한 줄 요약:
"외롭고 잊혀진 언어를 위해, 전문가의 레시피와 AI 의 마법 지팡이를 섞어 '고급 번역기'를 만들어냈습니다. 이제 이 언어도 디지털 세상에서 자유롭게 소통할 수 있게 되었습니다!"
논문 요약: 동북 인도 저자원 티베트 - 버마어족 언어 '코코보로크 (Kokborok)' 를 위한 고품질 기계 번역
1. 문제 정의 (Problem Statement)
배경: 코코보로크 (Kokborok, ISO 639-3: trp) 는 인도 트리푸라 주 (Tripura) 의 공식 언어이자 약 150 만 명의 화자가 사용하는 티베트 - 버마어족 (Tibeto-Burman) 언어입니다.
현황: 공식 언어 지위와 상당한 화자 수에도 불구하고, 자연어 처리 (NLP) 커뮤니티에서는 극심한 자원이 부족한 (Low-Resource) 언어로 남아 있습니다.
기존 한계:
기존 기계 번역 (MT) 연구는 소규모 성경 기반 코퍼스 (Corpus) 에만 의존하여 BLEU 점수가 7 미만으로 매우 낮았습니다.
WMT 2025 공유 과제에서 가장 좋은 결과조차 BLEU 6.99 (en→trp) 및 2.99 (trp→en) 에 그쳤습니다.
공개된 병렬 코퍼스 (Parallel Corpus) 가 거의 존재하지 않아 데이터 부족이 주요 병목 현상이었습니다.
2. 방법론 (Methodology)
가. 데이터 구축 (Data Construction) 연구팀은 총 36,052 개의 문장 쌍으로 구성된 다중 소스 병렬 코퍼스를 구축했습니다.
전문 번역 데이터 (SMOL): 9,284 문장. Google 의 SMOL 데이터셋에서 추출한 전문 번역가들이 번역한 다양한 도메인 (보건, 교육, 문화 등) 의 데이터.
도메인 특화 데이터 (WMT Bible): 1,769 문장. WMT 공유 과제에서 제공된 성경 번역 데이터 (기존 연구와의 비교를 위해 사용).
합성 역번역 데이터 (Synthetic Back-Translation): 24,999 문장.
소스: Tatoeba 프로젝트의 영어 문장.
생성: Google Gemini Flash API 를 사용하여 영어를 코코보로크로 역번역 (Back-translation) 생성.
비용: 약 7 달러 (INR 600) 로 매우 저렴하게 대량의 데이터를 확보.
나. 모델 및 학습 전략
기반 모델: Facebook 의 NLLB-200-distilled-600M 모델을 파인튜닝 (Fine-tuning) 했습니다.
새로운 토큰 도입: 코코보로크가 NLLB 의 지원 언어 목록에 없으므로, 새로운 언어 토큰 **trp_Latn**을 토크나이저 어휘에 추가하고 임베딩 행렬을 재조정했습니다. 이를 통해 모델이 코코보로크를 별도의 타겟 언어로 인식하고, 버마어나 티베트어 등 유형론적으로 유사한 언어의 표현을 활용할 수 있게 했습니다.
학습 설정: 양방향 번역 (en↔trp) 을 동시에 학습하도록 데이터를 구성하여 총 72,096 개의 학습 쌍을 생성했습니다.
품질 필터링 조사: 합성 데이터의 품질을 선별하기 위해 LaBSE 기반 필터링을 시도했으나, 코코보로크가 LaBSE 학습 데이터에 포함되지 않아 임베딩 유사도 점수가 신뢰할 수 없음을 발견하고 필터링 없이 전 데이터를 사용했습니다.
3. 주요 기여 (Key Contributions)
KokborokMT 개발: NLLB 기반의 고품질 신경 기계 번역 시스템을 최초로 개발하여 기존 결과를 획기적으로 개선했습니다.
대규모 병렬 코퍼스 구축: 전문 번역 데이터와 LLM(Gemini Flash) 을 활용한 합성 데이터를 결합한 3 만 6 천 개 이상의 대규모 코퍼스를 공개했습니다.
LLM 기반 데이터 증강의 유효성 입증: 저자원 언어에서 LLM 을 통한 역번역 데이터 생성이 모든 평가 지표에서 일관된 성능 향상을 가져옴을 증명했습니다.
부정적 발견 (Negative Finding): LaBSE 와 같은 다국어 임베딩 기반 품질 필터링이 모델 학습 데이터에 없는 언어 (Unseen Languages) 에 대해서는 신뢰할 수 없음을 보고했습니다.
오픈 소스 공개: 모델, 데이터, 평가 스크립트를 CC-BY-4.0 라이선스로 공개하여 향후 연구를 촉진합니다.
4. 결과 (Results)
가. 자동 평가 지표 (Automatic Metrics)
BLEU 점수:
en→trp: 17.30 (기존 WMT 최우수 6.99 대비 약 2.5 배 향상)
trp→en: 38.56 (기존 WMT 최우수 2.99 대비 약 13 배 향상)
기타 지표: chrF, ROUGE-L, METEOR, COMET 등 모든 지표에서 기존 시스템 (System 1: 합성 데이터 없음) 보다 System 2(합성 데이터 포함) 가 우월한 성능을 보였습니다. 특히 trp→en 방향에서 SMOL 테스트 세트 기준 BLEU 가 5.65 포인트 증가했습니다.
Zero-Shot 성능: 파인튜닝 없는 Zero-Shot NLLB 는 BLEU 0.09~0.63 으로 거의 번역이 불가능했으나, 소량의 고품질 데이터만으로도 약 30 배 이상의 성능 향상을 보였습니다.
나. 인간 평가 (Human Evaluation)
평가자: 코코보로크 언어 구조 전문가, 원어민 화자, 코코보로크 언어학 연구자 등 3 명.
결과 (5 점 척도):
적절성 (Adequacy): 3.74/5
유창성 (Fluency): 3.70/5
의의: 대부분의 경우 원문의 의미를 잘 보존하고 자연스러운 출력을 생성함을 확인했습니다. 전문가 간 일치도 (Cohen's κ = 0.67) 가 높았습니다.
5. 의의 및 결론 (Significance & Conclusion)
저자원 언어 해결책 제시: 소규모 전문 번역 데이터와 저렴한 비용으로 생성 가능한 LLM 기반 합성 데이터를 결합하면, 극도로 자원이 부족한 언어에서도 실용적인 기계 번역 시스템을 구축할 수 있음을 입증했습니다.
기술적 통찰:
다국어 모델에 새로운 언어 토큰을 추가하고 파인튜닝하는 방식이 효과적입니다.
기존에 널리 쓰이던 LaBSE 기반 품질 필터링이 학습 데이터에 없는 언어에는 적용 불가능할 수 있음을 경고했습니다.
사회적 영향: 동북 인도 지역의 소수 언어인 코코보로크의 디지털 접근성을 높이고, 해당 언어의 NLP 연구 생태계를 활성화하는 기반을 마련했습니다.
이 연구는 단순히 번역 성능을 높이는 것을 넘어, 데이터가 부족한 언어를 위한 효율적인 데이터 구축 전략과 평가 방법론에 대한 중요한 통찰을 제공합니다.