Mecellem Models: Turkish Models Trained from Scratch and Continually Pre-trained for the Legal Domain
이 논문은 1127억 개의 토큰을 바탕으로 혁신적인 체크포인트 선택 전략을 사용하여 처음부터 사전 학습된 ModernBERT 기반 인코더와, 4단계의 지속적 사전 학습 커리큘럼을 통해 강화된 Qwen 기반 디코더 모델을 특징으로 하는 터키어 법률 도메인 적응을 위한 프레임워크인 Mecellem을 소개하며, 이들은 결합적으로 최첨단 검색 성능과 개선된 계산 효율성을 통한 유의미한 퍼플렉시티 감소를 달성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
개요: 터키 법률 지능 구축하기
당신에게 영어를 포함한 인터넷의 거의 모든 내용을 읽은 아주 똑똑하고 다국어에 능통한 학생(거대 언어 모델)이 있다고 상상해 보세요. 이 학생은 매우 영리하지만, 터키 법률에 대해 물어보면 당황합니다. 특정 단어나 복잡한 문장 구조, 혹은 터키 법 체계의 엄격한 규칙들을 알지 못하기 때문입니다.
이 논문의 저자들은 이 문제를 해결하고자 했습니다. 그들은 터키 법률 세계를 위해 특별히 설계된 전문 AI 프레임워크인 **메젤렘(Mecellem)**을 구축했습니다. 그들은 단순히 이 학생에게 몇 개의 새로운 단어를 가르친 것이 아니라, 법률 전문가가 되기 위한 두 가지 서로 다른 유형의 집중 훈련을 제공했습니다.
전략 1: "전문 사서" (인코더 모델)
목표: 질문을 받았을 때 에세이를 쓰는 것이 아니라, 방대한 도서관에서 당신이 필요로 하는 정확한 법률 문서를 즉각적으로 찾아내는 초고속 사서와 같은 모델을 만드는 것입니다.
방법:
기존의 영어 사서에게 터키어를 가르치려고 노력하는 대신, 그들은 처음부터 새로운 사서를 구축했습니다.
- 훈련: 이 새로운 사서에게 판결문, 학술 논문, 법률 등을 포함한 1127억 개의 터키어 단어를 학습시켰습니다.
- "골디락스(Goldilocks)"의 발견: 보통 모델을 훈련할 때, 우리는 "오차율"(모델이 저지르는 실수 횟수)이 가장 낮아지는 시점에 멈춥니다. 하지만 저자들은 반전된 사실을 발견했습니다. 최고의 사서는 오차율이 가장 낮은 사서가 아니었습니다.
- 비유: 시험 공부를 하는 학생을 상상해 보세요. 만약 모든 사실을 완벽하게 암기할 때까지(최저 오차) 공부한다면, 오히려 실제 문제에 그 사실을 어떻게 적용해야 하는지 잊어버릴 수도 있습니다. 저자들은 모델이 모든 것을 암기하기 전인 어떤 "적절한 지점(sweet spot)"에서 성능이 가장 좋다는 것을 발견했습니다. 너무 오래 훈련시키면 오히려 답을 찾는 능력이 떨어졌습니다.
- 결과: 그들은 거대하고 느린 사서들만큼이나 뛰어난 성능을 내는 작고 효율적인 사서(단 1억 5,500만 개의 "뇌 세포" 또는 파라미터)를 만들어냈습니다. 이는 마치 거대한 트럭만큼 빠르게 달리는 소형 스포츠카를 가진 것과 같습니다.
전략 2: "법학자" (디코더 모델)
목표: 법률 문제를 '읽고', 깊은 추론 과정을 이해하며, 법률적인 답변이나 설명을 '작성'할 수 있는 모델을 만드는 것입니다.
방법:
그들은 기존의 강력한 모델 두 개(Qwen3-1.7B 및 Qwen3-4B)를 가져와 법학 교육과 유사한 특별한 커리큘럼을 부여했습니다.
- 커리큘럼 학습 방식: 법률 서적을 한꺼번에 쏟아부은 것이 아니라, 4단계 계획을 사용했습니다.
- 1단계: 기본적인 터키어 문장에 익숙해지도록 쉽고 일반적인 터키어 텍스트를 읽습니다.
- 2단계: 법률 기사와 판례 요약문을 읽기 시작합니다.
- 3단계: 길고 복잡하며 어려운 법률 문서(전체 판결문 등)에 몰입합니다.
- 4단계: 기술을 연마하기 위한 전문적인 정교화 과정을 거칩니다.
- 이것이 중요한 이유: 학생에게 기초 문법도 알기 전에 박사 학위 논문을 던져준다면, 학생은 혼란에 빠지고 이미 알고 있던 것조차 잊어버리게 됩니다(이를 "파괴적 망각"이라고 합니다). 이러한 단계별 접근 방식은 모델이 일반적인 터키어를 구사하는 능력을 잃지 않으면서도 복잡한 법률 용어를 배울 수 있도록 보장했습니다.
- 결과: 이 모델은 터키 법률 텍스트를 이해하는 능력이 현저히 향상되었으며, 혼란도(perplexity)를 약 36% 감소시켰습니다.
"품질 관리" 필터
가장 큰 과제 중 하나는 데이터를 정제하는 것이었습니다. 법률 문서는 지저도합니다. 표가 있고, 스캔된 이미지와 이상한 형식을 가지고 있습니다.
- 비유: 페이지 절반이 찢겨 있거나, 커피 얼룩이 묻어 있거나, 다른 언어로 쓰여 있는 교과서를 가지고 학생을 가르치는 상황을 상상해 보세요.
- 해결책: 저자들은 고급 AI(시각-언어 모델)를 사용하여 스캔된 문서를 읽고 텍스트를 완벽하게 추출하는 정교한 "정제 기계"를 구축했습니다. 또한 터키어 문법 규칙에 기반한 특별한 필터를 사용했습니다.
- 비유: 터키어는 "교착어"로, 의미를 바꾸기 위해 단어에 많은 작은 조각들(접사)을 붙이는 언어입니다. 저자들은 텍스트가 이러한 단어 조각들을 자연스럽고 풍부하게 사용하는지 확인하는 필터를 만들었습니다. 만약 텍스트가 너무 반복적이거나 로봇 같다면(템플릿처럼), 필터가 이를 걸러냈습니다. 이를 통해 모델이 고품질의 인간다운 법률 문장으로부터 학습하도록 보장했습니다.
일반 대중을 위한 핵심 요약
- 단순히 낮은 오차율만을 쫓지 마라: 복잡한 작업을 위해 AI를 훈련할 때, 훈련 중 모델이 실수를 가장 적게 하는 지점이 항상 가장 유용한 지점은 아닙니다. 때로는 일찍 멈추는 것이 더 똑똑한 모델을 만들어냅니다.
- 작은 것이 더 나을 수 있다: 터키 법률에 능숙해지기 위해 반드시 거대하고 비싼 컴퓨터 뇌가 필요한 것은 아닙니다. 잘 훈련된 작은 모델이 거대하고 일반적인 모델보다 더 뛰어난 성능을 보일 수 있습니다.
- 단계별 학습이 효과적이다: 모델에게 복잡한 법률적 추론을 가르칠 때는 한꺼번에 압도하기보다는 간단한 개념부터 시작하여 점진적으로 난이도를 높이는 것이 가장 좋습니다.
- 언어가 중요하다: 영어에 통하는 방식이 터키어에도 항상 통하는 것은 아닙니다. 터키어는 문법적으로 매우 복잡하기 때문에, AI는 단순히 영어에서 번역되는 것이 아니라 해당 언어에 맞춰 특별히 구축되고 훈련되어야 합니다.
요약하자면, 저자들은 밑바닥부터 구축하고, 스마트한 단계별 커리큘럼으로 훈련하며, 최상의 결과를 얻기 위해 언제 훈련을 멈춰야 할지를 정확히 파악함으로써 특화된 터키 법률 AI를 구축했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.