Expanding the Lexicon of Ge'ez Based African Languages: A Comparative Study of Amharic and Tigrinya
이 논문은 암하라어 및 티그리냐어와 같은 게즈(Ge'ez) 문자를 사용하는 언어에 맞춤화된 XLM-R의 어휘 확장 변형인 VEXMLM을 소개하며, 이는 전문화된 2단계 학습 전략을 통해 어휘 미포함(out-of-vocabulary) 비율과 과도한 서브워드 파편화를 줄임으로써 질의응답, 감성 분석, 개체명 인식과 같은 다운스트림 태스크에서의 성능을 크게 향상시켰을 뿐만 아니라 17개의 다른 저자원 아프리카 언어에도 이점을 제공한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 수천 가지 다른 언어로 쓰인 책들이 가득한 거대하고 북적이는 도서관이라고 상상해 보세요. 오랫동안 사서들(우리가 인공지능이라 부르는 똑똑한 컴퓨터 프로그램들)은 영어, 스페인어, 프랑스어와 같은 라틴 알파벳으로 쓰인 책들을 읽는 법만 알고 있었습니다. 그들은 이 언어들을 위한 방대한 사전을 가지고 있었지만, 에티오피아와 에리트레아에서 사용되는 게즈(Ge'ez) 문자로 쓰인 책을 읽으려고 하면 혼란에 빠졌습니다. 그들은 단어를 의미 없는 아주 작은 조각들로 잘게 쪼개거나, 그냥 손을 들어 올리며 "이 단어는 모르겠어요!"라고 말하곤 했습니다. 이것은 수백만 명의 사람들을 디지털 대화에서 소외시키는 문제입니다. 그들은 텍-스트를 이해하거나, 답을 찾거나, 중요한 이름을 인식하는 데 필요한 최고의 도구들을 사용할 수 없게 됩니다.
이를 해결하기 위해 연구자들은 AI 모델에게 새로운 단어를 가르치기 위해 노력해 왔습니다. 하지만 이는 까다로운 작업입니다. 만약 단순히 기존의 사전에 새로운 단어들을 강제로 집어넣기만 하고, 그 단어들이 어떻게 서로 어우러지는지 가르치지 않는다면 AI는 길을 잃게 됩니다. 이 논문은 바로 그 구체적인 과제, 즉 기존의 지능을 망가뜨리지 않으면서도 아름다운 게즈 문자로 쓰인 두 주요 언어인 암하라어와 티그리냐어를 마침내 읽고 이해할 수 있도록 초지능형 AI를 업그레이드하는 방법에 대해 다룹니다.
문제점: 붙지 않는 "접착제"
현대적인 AI 언어 모델을 100가지 다른 언어로 놀라운 요리를 할 수 있는 숙련된 셰프로 생각해 보세요. 하지만 이 셰프에게는 매우 구체적인 규칙이 있습니다. 그들은 주로 라틴 문자 언어를 위해 설계된 미리 준비된 식재료 세트(이를 "토큰"이라고 부릅니다)만을 사용해야 한다는 것입니다. 셰프가 암하라어나 티그리냐어로 요리를 하려고 할 때, 식재료가 맞지 않습니다. 이 스크립트는 다르며, 각 기호가 단일 문자가 아닌 자음과 모음이 결합된 형태를 나타내는 "음절 아부기다(syllabic abugida)" 방식이기 때문입니다.
셰프의 식재료 목록이 이 언어들에 맞지 않기 때문에, 결과적으로 단어들을 쓸모없는 작은 부스러기로 잘게 쪼개게 됩니다. 하나의 단어가 다섯 개나 여섯 개의 조각으로 나뉠 수도 있고, 많은 단어가 셰프의 찬장에 아예 존재하지 않을 수도 있습니다. AI가 모르는 단어를 마주하면, 단순히 "UNK"(알 수 없음)라고 표시하며 모든 의미를 버려버립니다. 이로 인해 AI는 뉴스 기사에서 사람의 이름을 찾거나 트윗이 행복한지 슬픈지를 파악하는 것과 같은 작업에서 형편없는 성능을 보이게 됩니다.
해결책: 맞춤 양복점, VEXMLM
연구진은 VEXMLM이라는 새로운 접근 방식을 도입했습니다. VEXMLM을 기존의 고품질 정장(AI 모델)을 가져와 새로운 체형에 딱 맞게 맞춰주는 숙련된 재단사라고 상상해 보세요. 그들은 단순히 새로운 식재료를 찬장에 던져 넣은 것이 아니라, 특정한 정교한 레시피를 가지고 작업했습니다.
먼저, 그들은 암하라어와 티그리냐어에 특화된 완전히 새로운 맞춤형 사전을 구축했습니다. 그들은 게즈 스크립트에 완벽하게 부합하는 30,000개의 새로운 서브워드 조각(단어의 덩어리)을 가져와 AI의 어휘 목록에 추가했습니다. 이것은 셰프에게 그들이 요리하려는 식재료에 실제로 적합한 특수 칼과 향신료 세트를 주는 것과 같습니다.
하지만 여기서 영리한 점은, 레시피에 새로운 식재료를 그냥 붙여 넣는다고 해서 즉시 맛이 제대로 날 것이라 기대할 수 없다는 것입니다. 새로운 단어들은 어떻게 행동해야 하는지 알아야 합니다. 연구진은 "평균 초기화(mean initialization)"라는 기술을 사용했습니다. 새로운 단어들이 무엇을 의미해야 하는지 무작정 추측하는 대신, AI의 뇌 속에 있는 기존 단어들의 평균적인 "풍미"를 계산하여, 새로운 단어들에게 시작 단계에서 그 평균적인 풍미를 부여했습니다. 이는 새로운 단어들이 시스템에 충격을 주지 않고 부드럽게 녹아들 수 있도록 보장합니다.
마지막으로, 그들은 단순히 단어를 추가하는 데 그치지 않았습니다. 그들은 AI가 암하라어와 티그리냐어 텍스트의 방대한 컬렉션을 사용하여 한동안 "공부"하도록 했습니다. 이것이 바로 "지속적 사전 학습(continued pretraining)" 단계입니다. 이것은 셰프가 새로운 식재료로 요리하는 연습을 하여 맛을 마스터할 때까지 연습하게 하는 것과 같습니다. 이 학습 세션이 끝난 후, 그들은 질문 답변, 이름 인식, 감정 탐지와 같은 특정 작업들을 통해 AI를 테스트했습니다.
결과: 커다란 도약
결과는 인상적이었습니다. 암하라어와 티그리냐어에 대해 테스트했을 때, 새로운 VEXMLM 모델은 확실한 승자였습니다.
- 질문 답변: 텍스트에서 답을 찾도록 요청되었을 때, 기존 모델(XLM-R)은 정확히 일치하는 답을 66%의 확률로 찾아냈습니다. VEXMLM은 이를 **87%**까지 끌어올렸습니다. 이는 엄청난 향상이며, AI가 문장의 전체 맥락을 훨씬 더 잘 이해하게 되었음을 의미합니다.
- 감정 분석: 메시지가 긍정적인지 부정적인지를 파악하는 데 있어, VEXMLM은 80%의 정확도에 도달하여 기존 모델의 77%를 앞질렀으며, 단 46%의 정확도를 보인 거대 경쟁 모델(Glot500)을 압도했습니다.
- 이름 인식 (NER): 이 부분은 보통 "알 수 없는 단어" 문제가 가장 큰 타격을 주는 지점입니다. 기존 모델은 모르는 단어 때문에 어려움을 겪으며 81.4%의 정확도만을 보였습니다. VEXMLM은 이를 **94.3%**로 높였습니다.
흥미롭게도, 연구진은 새로운 어휘가 암하라어와 티그리냐어에 특화되어 구축되었음에도 불구하고, 그 혜택이 다른 아프리카 언어들로도 전이되었다는 것을 발견했습니다. 게즈 스크립트를 사용하지 않는 언어들조차도 어휘 외 단어(out-of-vocabulary words)를 인식하는 데서 개선을 보였습니다. 저자들은 이것이 "학습 세션(지속적 사전 학습)"이 AI로 하여금 특정 새로운 단어뿐만 아니라 복잡한 단어 구조를 일반적인 차원에서 더 잘 다루도록 도와주었기 때문이라고 설명합니다.
이것이 의미하는 바
이 논문은 저자원 언어를 돕기 위해 거대하고 비싼 AI를 처음부터 새로 만들 필요는 없다는 것을 보여줍니다. 대신, 강력한 기존 모델을 가져와 특정 스크립트에 맞춘 맞춤형 어휘를 부여하고, 실제 텍스트로 연습하게 하면 됩니다. 이 연구는 이러한 표적 접근 방식이 단순히 모델을 더 크게 만들거나 스스로 배우기를 기대하는 것보다 더 효과적이라는 것을 입증합니다.
하지만 연구진은 이것이 모든 문제에 대한 마법의 지팡이는 아니라는 점을 주의 깊게 언급했습니다. 개선은 그들이 구체적으로 학습시킨 언어들(암하라어와 티그리냐어)에서 가장 극적으로 나타났습니다. 다른 언어들의 경우, 그 이득은 새로운 어휘의 직접적인 결과라기보다는 훈련 과정의 유익한 부수 효과였습니다. 또한 그들은 자신들의 모델이 한 번에 읽을 수 있는 최대 문장 길이와 같은 한계를 여전히 가지고 있으며, 이로 인해 매우 긴 문서를 다룰 때 어려움을 겪을 수 있다고 지적했습니다.
결국, VEXMLM은 하나의 개념 증명입니다. 적절한 도구와 약간의 집중적인 연습이 있다면, 우리는 AI를 훨씬 더 포용적으로 만들 수 있으며, 이를 통해 게즈 스크립트 사용자들이 디지털 시대에서 뒤처지지 않도록 보장할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.