← 최신 논문
💬 NLP

One Form to Transfer Them All: Pretraining Multilingual Language Models Beyond Native Orthography

이 논문은 다국어 언어 모델을 사전 학습할 때 고유 문자나 국제 음성 기호(IPA) 대신 로마자 표기 텍스트를 사용하는 것이 다양한 문자 체계 간의 교차 언어 지식 전이를 유의미하게 향고시킨다는 점을 입증하며, 이는 로마자 표기가 사후 적응 방식이 아닌 핵심적인 사전 학습 설계 선택 사항이 되어야 함을 시사한다.

원저자: Muge Zhang, Aaron Jencks, Krishna Badikela, Yulia Tsvetkov, Sachin Kumar

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Muge Zhang, Aaron Jencks, Krishna Badikela, Yulia Tsvetkov, Sachin Kumar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

단 하나의 컴퓨터 프로그램이 지구상의 모든 언어를 동일한 유창함으로 읽고, 쓰고, 이해할 수 있는 세상을 상상해 보십시오. 이것은 다국어 인공지능이 약속하는 미래이며, 이 분야는 최근 몇 년 동안 놀라운 발전을 이루었습니다. 이러한 프로그램은 방대한 양의 텍텍스트를 읽음으로써 문법과 의미의 패턴을 흡수하며 학습합니다. 이들이 작동하는 핵심 방식 중 하나는 단어 파편 또는 서브워드(subword)로 구성된 공유 사전이며, 이를 통해 서로 다른 언어 간의 유사성을 인식할 수 있습니다. 영어와 스페인어처럼 두 언어가 같은 알파벳을 사용하는 경우, 이들은 자연스럽게 많은 파편을 공유하게 되어 컴퓨터가 한 언어에서 다른 언어로 지식을 전이하기가 용이해집니다. 그러나 세상에는 러시아어의 키릴 문자, 힌디어의 데바나가리 문자, 또는 우르두어의 아랍 문자처럼 완전히 다른 문자 체계를 사용하는 언어들로 가득 차 있습니다. 이러한 스크립트 간에 겹치는 부분이 없을 때, 컴퓨터의 공유 사전은 무너지고 한 언어로부터 학습하여 다른 언어를 돕는 능력이 사라집니다. 이 장벽은 진정한 범용 언어 모델을 만드는 데 있어 오랫동안 걸림돌이 되어 왔습니다.

이를 해결하기 위해 연구자들은 서로 다른 문자 체계를 공통된 형태로 강제 변환하려는 시도를 해왔습니다. 한 가지 접근 방식은 텍스트를 인간의 음성을 나타내는 보편적인 기호 집합인 국제 음성 알파벳(IPA)으로 변환하는 것입니다. 또 다른 방식은 모든 언어를 하나의 공유된 스크립트로 다시 쓰는 것, 즉 텍스트를 영어에서 사용하는 라틴 알파벳으로 음차(transliterate)하는 것입니다. 이러한 방법들은 소규모 실험에서 가능성을 보여주었지만, 처음부터 크고 강력한 모델을 구축할 때 어떤 접근 방식이 진정으로 우월한지, 혹은 모델을 이미 훈련시킨 후에 단순히 텍는 변환하는 것이 똑같이 효과적일지는 여전히 불분명했습니다. 오하이오 주립대학교와 워싱턴 대학교의 연구진은 네 개의 언어 가족에 걸친 8개의 뚜렷한 언어를 다루도록 설계된 일련의 언어 모델을 구축하고 테스트함으로써 이 질문들에 답하고자 했습니다.

연구진은 영어와 스페인어, 러시아어와 폴란드어, 힌디어와 우르두어, 그리고 타밀어와 말라얄람어라는 8개의 언어를 사용하여 통제된 실험을 구성했습니다. 이 쌍들은 관계의 다양성을 제공하도록 선택되었습니다. 일부는 스크립트를 공유하지만, 다른 것들은 소리는 공유하면서도 완전히 다른 문자 체계를 사용합니다. 연구진은 약 4억 6,700만 개에서 10억 개 이상의 파라미터에 이르는 세 가지 크기에 대해 각각 세 가지 버전의 언어 모델을 구축했습니다. 각 크기마다, 첫 번째 모델은 원래의 고유 스크립트로, 두 번째 모델은 국제 음성 알파벳으로 변환된 텍스트로, 세 번째 모델은 라틴 알파벳으로 변환된 텍스트로 훈련시켰습니다. 결정적으로, 데이터의 양, 컴퓨터 아키텍처, 훈련 시간을 모두 동일하게 유지했습니다. 이를 통해 모델의 학습 및 지식 전이 능력에 미치는 문자 체계 자체의 효과를 분리해 낼 수 있었습니다.

결과는 매우 놀랍고 명확했습니다. 텍스트를 라틴 알파벳으로 변환한, 즉 로마자화(romanized)된 텍ối로 훈련된 모델이 모든 테스트에서 다른 모델들을 지속적으로 앞질렀습니다. 질문에 답하는 작업이든, 문장의 의미를 이해하는 것이든, 혹은 뉴스 기사를 요약하는 것이든, 로마자화된 모델은 한 언어에서 다른 언어로 지식을 전이하는 가장 강력한 능력을 보여주었습니다. 이 이점은 모델이 커질수록 더 커졌습니다. 음성 알파벳으로 훈련된 모델은 대부분의 경우 원래의 스크립트로 훈련된 모델보다 성능이 좋았지만, 일반적으로 로마자화된 모델에는 미치지 못했습니다. 유일한 예외는 힌디어와 우르두어 쌍이었습니다. 이 두 언어는 소리는 거의 동일하지만 사용하는 문자는 완전히 다르기 때문에, 음성적 접근 방식이 매우 효과적이었으며 로마자화 모델의 성능과 일치했습니다. 그러나 모델이 한 번도 본 적 없는 언어에 대해 테스트했을 때도 로마자 방식이 가장 견고했습니다.

아마도 가장 놀라운 발견은 이 분야에서 흔히 사용되는 전략, 즉 이미 고유 스크립트로 훈련된 모델을 나중에 로마자 데이터로 미세 조정(fine-tuning)하는 방식에 관한 것이었습니다. 많은 연구자들은 이것이 전체 모델을 재훈련하는 비용 없이 로마자화의 이점을 얻을 수 있는 효율적인 지름길이라고 가정해 왔습니다. 연구 결과는 그 반대가 사실임을 보여주었습니다. 연구진이 이 지름길을 모델에 적용했을 때, 모델이 이미 알고 있던 언어들에 대한 성능이 오히려 크게 떨어졌습니다. 이 개입은 모델이 이전에 노출된 적이 없는 언어를 처리할 때만 도움이 되었으며, 그 경우에도 처음부터 로마자 텍스트로 모델을 훈련시켰을 때와 비교하면 개선 정도가 미미했습니다. 이는 로마자화의 이점이 단순히 최종 출력 형식에 관한 것이 아니라, 모델이 초기 훈련 단계 동안 언어의 근본적인 구조를 어떻게 학습하느냐에 달려 있음을 시사합니다.

연구진은 또한 이러한 서로 다른 문자 체계의 효율성을 조사했습니다. 타밀어나 말라얄람어와 같이 복잡한 스크립트를 사용하는 언어는 라틴 알파벳을 사용하는 언어에 비해 동일한 양의 텍스트를 표현하는 데 훨씬 더 많은 컴퓨터 토큰을 필요로 했습니다. 이는 원래의 스크립트로 훈련하는 것이 언어 간 학습을 더 어렵게 만들 뿐만 아니라, 더 비싸고 느리다는 것을 의미했습니다. 이러한 압축 방식은 음성적 접근 방식과 로마자화 접근 방식 모두 텍ex의 양을 줄여주어, 이 언어들의 비용과 속도를 다른 언어들과 일치시켰습니다. 이러한 압축은 서로 다른 스크립트 간의 지식 공유 능력을 향상시키는 것과 결합되어, 다양한 문자 체계를 아우르는 다국어 모델을 구축하는 데 있어 로마자 방식이 가장 효과적인 설계 선택임을 입증했습니다.

궁극적으로, 이 연구는 인공지능이 세계의 수많은 언어 사이의 간극을 진정으로 메우기 위해서는 텍스트를 어떻게 표현하느냐가 사소한 기술적 세부 사항이 아닌 근본적인 설계 결정이라는 점을 시사합니다. 증거에 따르면, 다양한 스크립트를 공유된 라틴 형태로 변환하여 훈련하는 것이 가장 좋은 결과를 낳으며, 이를 통해 시스템이 언어적 경계를 넘어 작동하는 통합된 구조를 내재화할 수 있게 합니다. 텍스트를 음성 기호로 변환하는 것이 일부 이점(특히 소리는 비슷하지만 형태가 다른 언어의 경우)을 제공하지만, 그것이 통일된 스크립트의 이점을 대체할 수는 없습니다. 이 연구 결과는 모델을 구축한 후에 단순히 조정하는 것만으로는 충분하지 않다는 생각을 반박하며, 대신 디지털 지능이 세상을 읽는 법을 배우는 과정에서 의도적이고 선제적인 전략이 필요함을 지적합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →