EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training
이 논문은 지속적 사전 학습을 에스토니아어 강화 다국어 리플레이 및 경량화된 사후 정렬과 결합하는 것이 다국어 LLM의 영어 성능과 일반적 추론 능력을 효과적으로 보존하면서 에스토니아어 능력을 실질적으로 향상시킨다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대 언어 모델은 오늘날 가장 진보된 인공지능 도구들의 핵심 엔진이며, 이야기를 쓰고, 문제를 해결하며, 질문에 답할 수 있는 능력을 갖추고 있습니다. 이 시스템들은 인터넷의 방대한 텍텍스트 데이터를 통해 학습하며, 수십억 개의 사례를 읽음으로써 인간 언어의 패턴을 익힙니다. 그러나 이들을 가르치는 데 사용되는 데이터는 영어에 크게 치우쳐 있습니다. 영어가 디지털 세계를 지배하고 있기 때문에, 이 모델들은 영어에는 전문가가 되는 반면, 디지털 표현이 훨씬 적은 에스토니아어와 같은 소수 언어에는 어려움을 겪는 경우가 많습니다. 이러한 불균형은 AI가 영어로는 완벽한 에세이를 쓸 수 있어도, 에스토니아어로 동일한 작업을 수행하도록 요청받았을 때 혼란스럽거나 부정확한 텍스트를 생성할 수 있음을 의미합니다. 현재 연구자들은 이 격차를 해결하기 위해, 이미 보유한 기술을 망가뜨리지 않으면서 이 강력하고 영어 중심적인 모델들에게 새로운 언어를 가르치는 것이 가능한지를 탐구하고 있습니다.
에스토니아의 한 연구팀은 에스토니아어에 특화된 거대 언어 모델을 제작함으로써 이 질문에 답하기 위해 나섰습니다. 그들은 두 가지 기존 모델로 시작했습니다. 하나는 영어 데이터로 집중 학습된 모델이었고, 다른 하나는 이미 여러 언어에 어느 정도 익숙한 모델이었습니다. 연구진은 새로운 모델을 처음부터 구축하지 않았습니다. 대신, 이 기존 시스템들을 가져와 특정 데이터의 조합을 사용하여 집중적인 '재교육'을 실시했습니다. 먼저, 모델들이 언어 지식의 토대를 쌓을 수 있도록 문학, 학술적 글쓰기, 웹 콘텐츠를 포함한 방대한 양의 에스토니아어 텍스트에 노출시켰습니다. 모델이 추론하거나 다른 주제를 이해하는 법을 잊지 않도록 하기 위해, 학습 단계 동안 영어 텍스트, 코드, 수학 문제를 함께 섞었습니다. '지속적 사전 학습(continued pretraining)'이라고 알려진 이 과정은 모델이 일반적인 지능을 유지하면서 에스토니아어를 배울 수 있게 해주었습니다.
이 초기 학습 후에, 연구진은 챗봇과 어시스턴트에게 필수적인 기술인 명령 수행 능력을 개선하기 위해 모델을 정교하게 다듬었습니다. 그들은 실제 인간의 대화와 합성 예시를 혼합하여 사용하여, 모델이 에스토니아어와 영어 모두로 사용자의 명령에 응답하는 법을 가르쳤습니다. 그들의 과정에서 핵심적인 단계는 '채트 벡터 병합(chat vector merging)'이라 불리는 기술을 포함했습니다. 모델을 새로운 언어를 배웠지만 예의 바르게 말하거나 복잡한 규칙을 따르는 법을 잊어버린 학생이라고 상 imagin 해 보십시오. 연구진은 원래의 영어 버전 모델이 가진 '명령 수행 능력'에 대한 지식을 추출하여, 자신들의 새로운 에스토니아어 학습 버전 모델에 혼합했습니다. 이를 통해 최종 결과물은 유창한 에스토니아어를 구사하면서도 두 언어 모두에서 명령을 명확하게 따르는 능력을 유지할 수 있었습니다.
이 실험의 결과는 놀랍고도 유의미했습니다. 학습이 시작되기 전에는 이미 다국어 능력을 갖춘 모델이 영어 중심 모델보다 에스토니아어 과업에서 더 나은 성능을 보였습니다. 그러나 적응 과정 이후에는 상황이 역전되었습니다. 강력한 영어 기반을 가졌던 모델이 에스토니아어에서 훨씬 더 큰 향상을 보였으며, 결국 다국어 모델을 능가했습니다. 이는 모델의 특정 언어에 대한 시작점이 반드시 그 언어를 나중에 얼마나 잘 배울지를 예측하는 것은 아님을 시사합니다. 연구진은 적응된 모델들이 이전보다 훨씬 더 잘 에스토니아어 문법을 이해하고, 텍-스트를 번역하며, 논리 퍼즐을 풀 수 있다는 것을 발견했습니다. 또한 그들은 인간 사용자들이 모델과 대화하며 최고의 응답에 투표할 수 있는 공개적인 장에서 이 모델들을 테스트했습니다. 새로운 에스토니아어 모델들은 높은 순위를 기록하며 훨씬 더 크고 복잡한 시스템들과 성공적으로 경쟁했습니다.
이 연구는 또한 이러한 모델들이 학습하는 데 있어 중요한 한계를 드러냈습니다. 연구진은 일부 다른 연구들에서 사용했던 방식인, 에스토니아어 학습 데이터를 여러 번 반복하는 것이 모델의 학습을 돕는지 테스트했습니다. 그들은 이 규모의 모델의 경우, 데이터를 두 번째로 훑는 것이 실질적인 이득을 주지 못하며 단순히 컴퓨팅 자원의 낭비라는 것을 발견했습니다. 한 번의 학습 사이클이면 충분했습니다. 더욱이, 연구진은 모델이 에스토니아어에는 매우 뛰어나졌지만, 약간의 트레이드오프(trade-off)가 존재한다는 것을 발견했습니다. 즉, 영어로 명령을 따르는 능력이 약간 감소했습니다. 그러나 채트 벡터 병합 기술은 이 상실된 영어 능력을 대부분 복구하는 데 성공했으며, 이는 일반적인 역량을 희생하지 않고도 특정 소수 언어를 위해 모델을 전문화하는 것이 가능하다는 것을 입증했습니다.
이 작업은 종종 간과되는 언어들을 위한 인공지능을 개선하는 명확한 경로를 제공합니다. 새로운 언어 데이터를 기존 지식과 신중하게 혼합하고, 서로 다른 모델의 행동을 결합하는 스마트한 기술을 사용함으로써, 연구자들은 처음부터 다시 시작할 필요 없이 특정 공동체를 위한 강력한 도구를 만들 수 있습니다. 이 발견은 거대 언어 모델을 적응시키는 가장 효과적인 방법이 이미 그 언어를 알고 있는 모델에서 시작하는 것이 아니라, 일반적인 추론 능력이 강한 모델을 가져와 균형 잡힌 데이터 식단을 통해 새로운 언어를 가르치는 것일 수 있음을 시사합니다. 결과물인 모델들은 현재 다른 사람들이 사용할 수 있도록 공개되어 있으며, 글로벌 지능의 견고함을 유지하면서도 에스토니아어 사용자들에게 고품질의 모국어 수준 경험을 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.