← 최신 논문
💻 computer science

ModernBERT-TR: A Modern Encoder Foundation Model for Turkish

이 논문은 ModernBERT 아키텍처와 커스텀 토크나이저를 사용하여 1444억 개의 토큰으로 처음부터 사전 학습된 1억 5천만 파라미터 규모의 터키어 인코더인 ModernBERT-TR을 소개하며, 이는 훨씬 적은 자원으로 학습되었음에도 불구하고 기존의 터키어 베이스라인 모델들을 크게 능가하고 더 큰 규모의 동시 모델들과 대등한 성능을 보여준다.

원저자: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

게시일 2026-07-29
📖 2 분 읽기☕ 가벼운 읽기

원저자: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 모든 책이 서로 다른 언어로 쓰여 있는 거대하고 혼란스러운 도서관이라고 상상해 보세요. 오랫동안 사서들(컴퓨터 과학자들)은 컴퓨터가 한 번에 모든 언어를 이해할 수 있도록 하나의 거대하고 초고밀도인 백과사전을 만들었습니다. 하지만 그 거대한 책 안에서 아주 작고 구체적인 언어에 관한 특정 사실을 찾으려고 하면, 정보가 다소 흐릿해집니다. 이는 마치 붐비는 경기장에서 속삭임을 들으려고 노력하는 것과 같습니다. 신호가 소음 속에 묻혀버리는 것이죠.

이를 해결하기 위해 연구자들은 단일 언어만을 위한 더 작고 전문화된 사전들을 만들기 시작했습니다. 터키어를 위한 가장 유명한 사전은 2러 2020년에 만들어졌습니다. 그것은 좋은 시작이었지만, 모두가 스포츠카를 몰고 있을 때 자전거와 같은 오래된 도구로 만들어졌습니다. 그 사이 세상의 나머지 부분은 더 빠르게 읽고, 더 긴 문장을 기억하며, 문법의 굴곡을 훨씬 더 잘 이해할 수 있는 "현대적인" 엔진으로 나아갔습니다. 여기서 핵심적인 질문은 이것이었습니다. 엄청난 예산이나 달 크기만 한 도서관 없이도, 이 현대적인 도구들을 사용하여 터키어만을 위한 완전히 새로운, 초고속 스포츠카를 만들 수 있을까?

이 논문은 컴퓨터를 위한 궁극적인 "터키어 두뇌"로 설계된 새로운 인공지능 모델인 ModernBERT-TR을 소개합니다. 연구진은 최신이자 가장 진보된 아키텍처 설계(ModernBERT 엔진)를 가져와 오직 터키어 텍스트만을 사용하여 처음부터 학습시켰습니다. 그들은 단순히 방대한 양의 데이터를 쏟아부은 것이 아니라, 고품질의 터키어 글쓰기와 터키어 단어가 구성되는 독특한 방식에 특별히 맞춰 제작된 맞춤형 사전(토크나이저)을 사용하여 균형 잡힌 혼합물을 정성스럽게 선별했습니다.

결과는 놀라울 정도로 강력합니다. 이 새로운 모델은 약 1억 5천만 개의 "뉴런"(파라미터)을 포함하고 있어 상대적으로 작음에도 불구하고, 뉴런이 거의 4배나 더 많은 일부 거대 모델들보다 뛰어난 성능을 보였습니다. 혐오 표현 탐지나 영화 리뷰 이해와 같은 11가지의 서로 다른 터키어 과업에서 테스트했을 때, ModernBERT-TR은 평균 **60.2%**를 기록하며 차순위 모델을 상당한 차이로 앞질렀습니다. 심지어 전체 파인튜닝 테스트에서는 약 7배 더 많은 데이터(1조 토큰 대 1,444억 4천만 토큰)로 학습된 경쟁 모델과도 대등한 성적을 거두며, 스마트한 학습과 더 나은 아키텍처가 원시적인 데이터 양을 이길 수 있음을 증명했습니다.

저자들은 비결이 단순히 모델의 크기가 아니라 데이터 혼합의 품질이었다고 제안합니다. 그들은 학습 과정에서 특정 고품질 터키어 데이터셋을 다섯 번 반복하는 것이 배치 크기와 같은 다른 설정을 조정하는 것보다 훨씬 더 중요했다는 것을 발견했습니다. 요컨대, 그들은 가장 커야 하는 것이 아니라 가장 현대적이고 가장 집중해야 한다는 것을 보여주는, 날렵하고 강력한 터키어 구사 기계를 만들어낸 것입니다. 그들은 터키어를 사용하는 기술을 구축하려는 모든 이들에게 큰 힘이 되기를 바라며, 모든 코드와 모델 자체를 대중에 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →