MoganBert-TR: A Turkish Encoder Foundation Model Trained from Scratch with a CLM-to-MLM Curriculum
이 논문은 새로운 CLM-to-MLM 커리큘럼과 특화된 롱 컨텍스트 스케줄링을 사용하여 처음부터 학습된 1억 4,900만 개의 파라미터를 가진 터키어 인코더 파운데이션 모델인 MoganBert-TR을 소개하며, 이는 터키어 NLP 벤치마크에서 최첨단 성능을 달ей하고 75억 7,000만 개의 파라미터를 가진 교사 모델 점수의 99.5%에 도달하는 매우 효율적인 임베딩 모델을 생성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 광활한 풍경 속에는 컴퓨터가 인간의 언어를 이해하도록 학습하는 두 가지 주요 방법이 있습니다. 종종 뉴스에 등장하는 한 가지 접근 방식은 텍스트를 생성하여 처음부터 이야기를 쓰거나 질문에 답하는 모델을 포함합니다. 다른 하나는 더 조용하지만 똑같이 중요한 접근 방식으로, 강력한 검색 엔진 및 분류기 역할을 하는 모델을 사용합니다. 이러한 "인코더(encoder)" 모델은 문장을 읽고 이를 압축된 수학적 요약본으로 변转换하여, 컴퓨터가 아이디어를 비교하고, 관련 문서를 찾거나, 놀라운 속도로 정보를 분류할 수 있게 해줍니다. 수년 동안 이 모델들을 가르치는 표준적인 방법은 특정한 유형의 추측 게임이었습니다: 컴퓨터는 일부 단어가 숨겨진 문장을 보고 누락된 부분을 예측해야 합니다. 마스크드 언어 모델링(masked language modeling)이라고 알려진 이 방법은 잘 작동해 왔지만, 연구자들은 특히 터키어와 같이 단어 형태가 복잡하고 풍부한 언어에 대해, 기계에게 언어의 구조를 가르치는 더 나은 방법이 있지 않을까 오랫동안 의문을 품어왔습니다.
연구팀은 이제 터키어 이해를 위한 새로운 토대를 구축했으며, 모델을 어떻게 가르치느냐가 모델이 구축된 구조만큼이나 중요하다는 것을 입증했습니다. 그들은 방대한 양의 터키어 텍스트를 바탕으로 밑바닥부터 학습된 MoganBert-TR이라는 모델을 만들었습니다. 전통적인 추측 게임을 고수하는 대신, 그들은 2단계 학습 커리큘럼을 도입했습니다. 먼저, 모델은 마치 사람이 책을 읽는 것처럼 문장의 다음 단어를 예측하며 왼쪽에서 오른쪽으로 텍스트를 읽는 법을 배웠습니다. 이 초기 단계가 끝난 후에야 비로소 그들은 단어를 숨기고 모델에게 빈칸을 채우도록 요구하는 전통적인 방식으로 전환했습니다. 이러한 교육 전략의 변화는 세심하게 정제된 데이터셋, 그리고 긴 문장을 처리하는 새로운 방식과 결려져, 이전 버전들보다 터키어를 더 잘 이해하며, 특히 대규모 데이터베이스에서 관련 정보를 찾는 데 탁ên한 성능을 보이는 모델을 만들어냈습니다.
연구진은 최근의 웹 페이지와 오래된 기록물을 포함하여 인터넷에서 방대한 양의 텍스트를 수집하는 것으로 시작했지만, 단순히 이 데이터를 학습 시스템에 쏟아붓지는 않았습니다. 그들은 스팸이나 반복적인 광고와 같은 저품질 콘텐츠를 걸러내고 텍스트가 진정으로 유용한지 확인하기 위해 정교한 파이프라인을 구축했습니다. 터키어 텍스트의 품질을 자동으로 판단할 기존 도구가 없었기 때문에, 그들은 작은 전문화된 모델을 '교사' 역할을 하도록 학습시킨 뒤, 이 교사가 더 빠른 시스템에게 동일한 품질 판단을 내리는 법을 가르치도록 했습니다. 이를 통해 수백만 개의 문서를 효율적으로 처리하며 고품질 자료만을 남길 수 있었습니다. 또한 그들은 이전의 시도들보다 더 효율적으로 터키어 단어를 더 작은 조각으로 나누는 새로운 사전(dictionary)을 만들었는데, 이는 터키어 단어가 문장 내 역할에 따라 형태가 크게 변할 수 있기 때문에 매우 중요합니다.
그들의 발견의 핵심은 학습 과정 중 작업 순서에 있습니다. 그들은 단어를 숨기는 방법으로 전환하기 전에 왼쪽에서 오른쪽으로 예측하는 방법을 먼저 시작하는 것이 차이를 만드는지 테스트했습니다. 동일한 컴퓨팅 파워와 동일한 데이터를 사용한 통제된 실험에서, 새로운 2단계 접근 방식은 정보 검색 측면에서 전통적인 방식을 크게 압도했습니다. 두 방법 모두 단순한 분류 작업에서는 비슷하게 수행되었지만, 새로운 접근 방식은 검색 테스트에서 관련 문서를 찾는 능력이 거의 4배나 더 뛰어났습니다. 연구진은 전통적인 방식이 모델의 내부 표현을 좁고 무익한 형태로 붕괴시켜, 모든 의미가 너무 유사해 보이게 만든다는 것을 발견했습니다. 새로운 커리큘럼은 이러한 붕괴를 방지하여, 모델이 언어의 의미에 대해 더 넓고 뚜렷한 관점을 유지할 수 있게 해주었습니다.
모델을 더욱 정교하게 만들기 위해, 연구진은 컴퓨터가 학습의 마지막 단계에서 어떻게 학습하는지에 대해 실험했습니다. 그들은 과정을 두 갈래로 나누었습니다: 하나는 모델이 짧은 문장으로 학습을 계속하는 경로였고, 다른 하나는 훨씬 긴 문장으로 학습하는 경로였습니다. 이 두 경로를 비교함으로써, 학습을 짧은 문장으로 마무리하는 것이 긴 문장으로 마무리하는 것보다 모델의 전반적인 성능을 실제로 더 향arly 개선한다는 것을 발견했습니다. 이는 긴 문맥이 흔히 더 좋다고 여겨지는 점을 고려할 때 놀라운 결과였습니다. 또한 그들은 여러 학습된 모델들의 가중치를 평균 내어 최선의 조합을 얻고자 하는 "모델 수프(model soup)"라는 기법도 테스트했습니다. 그러나 그들의 단순한 분기(branching) 방식은 실행 비용이 아주 조금 더 들 뿐이었음에도, 복잡한 평균화 기법보다 더 나은 결과를 만들어냈습니다.
최종 결과물인 MoganBert-TR은 이 연구에서 사용된 현대적 구조를 기반으로 한 터키어 모델 중 가장 높은 점수를 기록했습니다. 이 모델은 자연어 설명으로부터 적절한 프로그래밍 코드 조각을 찾아내는 작업인 코드 검색(code retrieval)에서 뛰어난 성능을 보였는데, 이는 이전 모델들을 크게 앞지르는 성과였습니다. 이러한 성공은 코드의 간격과 구조를 보존하는 새로운 사전과, 학습 데이터에 프로그래밍 텍스트를 의도적으로 많이 포함시킨 덕분인 것으로 분석되었습니다. 팀은 또한 검색 친화적인 텍스트 요약을 생성하기 위해 설계된 동반 모델을 만들었습니다. 이 더 작은 모델에게 훨씬 더 크고 강력한 교사를 모방하도록 가르침으로써, 거대한 교사와 거의 대등한 결과를 얻으면서도 실행에 필요한 컴퓨팅 파워는 51배나 적게 사용했습니다.
이 연구는 터키어와 같은 언어의 경우, 단순히 모델의 구조를 업데이트하는 것만으로는 충분하지 않으며, 학습 방법 자체를 재고해야 한다는 점을 강조합니다. 연구진은 순차적 예측에서 시작하여 단어 마스킹으로 넘어가는 2단계 커리큘럼이 언어에 대한 더 견고한 이해를 형성한다는 것을 보여주었습니다. 또한 그들은 학습의 마지막 단계가 처리되는 텍스트의 길이와 같은 작은 변화가 성능에 측정 가능한 영향을 미칠 수 있는 결정적인 설계 공간임을 입증했습니다. 모델이 특정 문법 테스트 등에서 문장 구조를 이해하는 데 여전히 약점이 있기는 하지만, 이는 터키어 기술의 토대를 마련한 중요한 진전입니다. 연구팀은 자신들의 모델, 사전, 그리고 이를 구축하는 데 사용된 코드를 대중에게 공개하여 다른 이들이 이 토대 위에서 발전시켜 나갈 수 있도록 했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.