Mellum2 Technical Report
Mellum 2는 10.6조 개의 토큰에 걸친 3단계 학습 커리큘럼과 다중 토큰 예측(Multi-Token Prediction)과 같은 구조적 혁신을 통해 더 큰 모델들과 경쟁력 있는 성능을 달성하며, 소프트웨어 엔지니어링 및 에이전트 작업에 특화된 120억 개의 파라미터를 가진 오픈 웨이트 혼합 전문가(Mixture-of-Experts) 언어 모델로, 토큰당 25억 개의 활성 파라미터를 사용합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신의 컴퓨터 안에 살고 있는 초지능형 코딩 어시스턴트를 만들려고 한다고 상상해 보세요. 도전 과제는 이 모델이 매우 똑똑하면서도(시니어 엔지니어처럼), 동시에 매우 빠르고 저렴하게 구동되어야 한다는 것입니다(표준 사무용 노트북처럼). 보통은 하나를 선택해야 합니다: "똑똑한" 버전은 거대하고 느리며, "빠른" 버전은 어려운 문제를 처리하기에는 너무 단순합니다.
JetBrains 팀은 바로 이 문제를 해결하기 위해 Mellum 2를 만들었습니다. 그 방법을 쉽게 설명하면 다음과 같습니다.
1. "맥가이버 칼" 같은 두뇌 (아키텍처)
대부분의 AI 모델은 모든 것을 수행하는 하나의 거대한 뇌 세포와 같습니다. 하지만 Mellum 2는 다릅니다. 이 모델은 전문가 혼합(Mixture-of-Experts, MoE) 방식으로 구축되었습니다.
- 비유: 64명의 서로 다른 전문 사서가 있는 거대한 도서관을 상상해 보세요. 질문을 던질 때마다 모델은 64명의 사서를 모두 깨우지 않습니다. 대신, 똑똑한 매니저가 당신의 특정 질문에 가장 적합한 8명의 전문가만을 골라냅니다.
- 결과: 이 모델은 120억 개의 파라미터를 가진 "거대한" 뇌의 전체 지식을 보유하고 있지만, 단어 하나를 쓸 때마다 25억 개의 파라미터를 가진 뇌의 힘으로만 "생각"합니다. 덕분에 표준 하드웨어에서도 실행될 만큼 빠르면서도 매우 똑똑합니다.
2. "슬라이딩 윈도우"와 "초안 작성" 기술
더 빠르게 만들기 위해 그들은 두 가지 영리한 지름길을 추가했습니다:
- 슬라이딩 윈도우 (Sliding Window): 대화 중에 입력한 모든 단어를 전부 기억하려고 하면 속도가 느려지기 때문에(슬라이딩 윈도우가 기차 위의 창문처럼 움직이는 것처럼), 모델은 마지막 1,024개의 단어에 집중합니다. 이는 가장 최근의 문맥을 선명하게 유지하면서 오래된 세부 사항은 서서히 흐릿하게 만들어 에너지를 크게 절약합니다.
- "초안" 어시스턴트: 모델 내부에는 작은 "초안 작성" 어시스턴트가 내장되어 있습니다. 최종 답변을 확정하기 전에, 이 작은 어시스턴트가 다음 몇 단어를 미리 추측합니다. 만약 이 추측이 맞으면, 메인 모델은 작업을 건너뛰고 이를 그대로 수용합니다. 이는 작가가 글을 쓸 때 친구가 다음 문장을 속삭여 주어 더 빨리 타이핑할 수 있게 하는 것과 같습니다.
3. "3단계" 학습 커리큘럼
그들은 단순히 무작위 데이터를 모델에게 먹인 것이 아닙니다. 학교 커리큘럼처럼 세 가지 특정 단계로 가르쳤습니다:
- 1단계 (제너럴리스트): 방대한 양의 일반 인터넷 데이터(70%)와 일부 코드(23%)를 섞어 시작했습니다. 이를 통해 모델은 인간이 말하고 글을 쓰는 방식에 대한 폭넓은 이해를 갖게 되었습니다.
- 2단계 (스페셜리스트): 고품질의 코드(42%)와 수학의 비중을 높였습니다. 여기서부터 모델은 프로그래밍의 구체적인 규칙들을 배우기 시작했습니다.
- 3단계 (마스터): 마지막 단계에서는 코드와 수학의 비중이 거의 전체(59% 코드)였습니다. 이것은 모델이 전문가가 되기 위해 기술을 연마하는 "부트 캠프" 단계입니다.
4. 두 가지 인격: "Instruct"와 "Thinking"
동일한 훈련된 뇌로부터 두 가지 버전의 모델을 출시했습니다:
- "Instruct" 모델: 직설적인 작업자입니다. 질문을 하면 즉시 답을 줍니다. 빠른 작업에 적합합니다.
- "Thinking" 모델: 깊이 생각하는 모델입니다. 답변을 내놓기 전, 문제를 해결한 과정인 "추론 흔적(reasoning trace)"—즉, 단계별 설명—을 작성합니다. 이는 학생이 수학 시험에서 풀이 과정을 보여주는 것과 같습니다. 연구 결과에 따르면, 이 "생각하기" 모드는 모델이 어려운 논리 퍼즐과 복잡한 코딩 챌린지를 해결하는 데 훨씬 더 뛰어나게 만듭니다.
5. "증명" (테스트)
그들은 Mellum 2를 다른 인기 있는 모델들과 테스트했습니다.
- 속도: 70억 개의 파라미터를 가진 모델만큼 빠르게 실행되지만(전체 크기는 120억 개임에도 불구하고), 그 크기의 다른 모델들보다 더 똑똑합니다.
- 코딩: 코드를 작성하고, 디버깅하며, 도구(웹 검색이나 명령 실행 등)를 사용하는 데 탁월합니다.
- 트레이드오프 (Trade-off): 코딩 전문가가 되는 데 집중했기 때문에, 일반적인 챗봇으로 훈련된 모델들에 비해 일반적인 세상 지식(역사나 생물학 등)에 대해서는 약간 덜 해박할 수 있습니다. 하지만 개발자를 돕는다는 본래의 목적에 있어서는 최상위 성능을 보여줍니다.
요약
Mellun 2는 "전문가 팀" 아키텍처를 사용하여 똑똑하면서도 빠른 특화된 코딩 어시스턴트입니다. 코드와 수학을 마스터하기 위해 정교하게 설계된 커리큘럼을 통해 훈련되었으며, 빠른 답변을 위한 버전과 깊은 단계별 추론을 위한 버전 두 가지 형태로 제공됩니다. 팀은 누구나 더 나은 소프트웨어를 만들 수 있도록 이 모델을 무료로 공개했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.