Index SLM Technical Report
Bilibili는 2.8조 개의 토큰으로 학습된 1.9B 파라미터 기반의 특화된 Warmup-Stable-Decay 스케줄 및 Norm-Head 레이어를 특징으로 하며, 표준 벤치마크에서 경쟁력 있는 성능을 달성하고 순수 사전 학습, 채팅 정렬, 캐릭터 기반 역할 수행을 위한 변체들을 포함하는 오픈 소형 언어 모델 시리즈인 Index-1.9B를 선보입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 주머니에 쏙 들어가는 작고 똑똑한 로봇 뇌를 만들고 있다고 상상해 보세요. 대부분의 사람들은 더 큰 뇌가 항상 더 좋을 것이라고 생각하지만, Bilibili의 한 팀은 자신의 체급을 훨씬 뛰어넘는 성능을 내는 19억 파라미터 규모의 로봇(Index-1.9B라고 부릅시다)을 만들 수 있는지 확인해 보기로 했습니다. 그들은 단순히 거대한 모델을 축소한 것이 아니라, 주로 중국어와 영어로 된 2.8조 개의 단어 읽기 자료를 사용하여 엔진을 밑바닥부터 다시 구축했습니다.
이것은 그들이 어떻게 그것을 해냈는지, 무엇을 발견했는지, 그리고 그 과정에서 발견한 기묘한 놀라움에 대한 이야기입니다.
비밀 레시피: 뇌를 훈련시키는 방법
1. 읽기 목록 (데이터)
훈련 데이터를 로봇의 도서관이라고 생각해 보세요. 그들은 인터넷 전체를 그냥 쏟아부은 것이 아닙니다. 마치 정리되지 않은 다락방을 정리하는 사서처럼 데이터를 깨끗하게 다듬었습니다. 중복된 내용을 제거했습니다(심지어 실수로 월 이름 메뉴가 156,000번이나 복사된 것도 찾아냈습니다!). 또한 편향성을 걸러냈습니다.
- 구성: 도서관은 주로 책과 웹 페이지로 구성되어 있지만, 그들은 6%의 코드와 10%의 고품질 자료(학술 논문 및 백과사전 등)를 포함하도록 확실히 했습니다.
- 놀라움: 그들은 훈련의 마지막 단계에서 "지시 사항(instruction manuals)"(예: "시를 써줘" 또는 "이 수학 문제를 풀어줘")을 읽는 것이 로봇을 테스트에서 훨씬 더 똑똑하게 만든다는 것을 발견했습니다. 실제로 이 지시 데이터 7%를 추가하는 것만으로도 테스트 점수를 약 7점 높였습니다. 그들은 심지어 이 추가적인 읽기 과정을 거친 버전과 그렇지 않은 버전 두 가지를 모두 출시하여, 이것이 얼마나 도움이 되었는지 누구나 확인할 수 있게 했습니다.
2. 뇌 구조 (아키텍처)
보통 정해진 "뇌의 힘"(파라미터)이 있을 때, 뇌를 넓게 만들거나(한 층에 많은 뉴런) 깊게(여러 층을 쌓음) 만들 수 있습니다.
- 발견: 팀은 "깊고 좁은" 설계(36개 층)와 "넓고 얕은" 설계(9개 층)를 비교 실험했습니다. 결과는 깊은 설계의 압승이었습니다. 이는 마치 넓고 평평한 창고를 짓는 대신 마천루를 짓는 것과 같습니다. 이 크기에서는 옆으로 넓히는 것보다 위로 쌓는 것이 더 효과적이었습니다.
- 안정기: 그들은 또한 특별한 "Norm-Head" 층을 추가했습니다. 로봇의 뇌가 희귀한 단어를 예측하려고 할 때 약간 어지러움을 느끼는 상황을 상상해 보세요. 이 새로운 층은 로봇이 매우 빠르게 학습할 때도 뇌를 차분하게 유지해 주는 안정 장치 역할을 합니다.
3. 학습 일정 (WSD 방식)
대부분의 로봇은 일정한 속도로 배우거나 점진적으로 속도를 줄입니다. Index-1.9B는 "Warmup–Stable–Decay"(WSD) 일정을 사용합니다.
- 전략: 먼저, 예열(Warmup) 단계를 거칩니다. 그다음, 도서관 전체를 읽으며 일정한 높은 속도로 학습하는 "Stable(안정)" 단계를 거칩니다. 마지막으로, "Decay(감쇠)" 단계에서는 속도를 늦추되, 가장 엄선된 최고의 책들(학술 논문과 백과사전)만을 읽도록 전환합니다.
- 결과: 고품질의 데이터를 읽으면서 속도를 늦추는 이 조합은 성능을 가장 크게 끌어올렸습니다.
기묘한 놀라움: "서지(Surge)"
여기는 저자들조차 아직 완전히 설명하지 못하는 부분입니다.
로봇이 일정한 속도로 읽고 있던 "Stable" 단계 중에 이상한 일이 일 발생했습니다. 1.0조에서 1.2조 토큰 사이를 읽던 중, 로봇의 테스트 점수가 갑자기 급등했습니다. 학습 속도나 데이터의 종류를 바꾸지 않았음에도 불구하고, 평균 수준에서 7B 모델들을 능가하는 수준으로 뛰어올랐습니다.
- 확실성: 논문은 이것이 미스터리라고 인정합니다. 그들은 아마도 고품질의 데이터와 빠른 학습률이 그 순간 딱 맞아떨어졌기 때문이라고 추측하지만, 정확히 왜 그런지는 증명하지 못했습니다. 이는 마치 학생이 선생님이 수업 계획을 바꾸지 않았는데도 특정 단원을 읽고 나서 갑자기 모든 것을 이해하게 된 것과 같습니다.
로봇의 다양한 버전들
팀은 모델 하나에 그치지 않고 하나의 가족을 출시했습니다:
- Index-1.9B-Base: 무엇이든 할 준비가 된 가공되지 않은 똑똑한 뇌입니다.
- Index-1.9B-Pure: 지시 사항을 전혀 읽지 않은 대조군 버전입니다. 이는 메인 모델의 "똑똑한" 점수가 정말로 그 추가적인 읽기에서 온다는 것을 입증합니다.
- Index-1.9B-Chat: "직접 선호 최적화(DPO)"라는 기술을 사용하여 인간에게 친절하게 말하도록 학습된 Base 모델입니다. 이것은 로봇에게 단순히 답하는 법이 아니라, 좋은 대화와 나쁜 대화의 예시를 보여줌으로써 "잘" 대답하는 법을 가르치는 것과 같습니다.
- Index-1.9B-Character: 역할극을 할 수 있는 버전입니다. 이 모델은 특정 캐릭터와의 과거 대화를 찾아내어 캐릭터를 유지하는 "검색(retrieval)" 기술을 사용합니다. 이 기능이 매우 뛰어나서 역할극 테스트에서 훨씬 더 큰 모델들을 제치고 높은 순위를 차지합니다.
할 수 있는 것 (그리고 할 수 없는 것)
승리한 부분:
- 지능: 수학, 추론, 일반 지식에 대한 표준 테스트에서 Index-1.9B는 평균 64.92점을 기록했습니다. 이는 몇 배나 더 큰 모델들과 경쟁하거나 때로는 그들을 능가하는 수준입니다. 구체적으로, 전체 평균 점수에서 Llama-2-13B 모델을 앞지르지만, 모든 벤치마크에서 모든 더 큰 모델을 이기는 것은 아닙니다.
- 언어: 중국어와 영어에 탁p합니다. 또한, 그들이 만든 토크나이저는 비교 대상인 다른 토크나이저들 중 일본어와 한국어에 대해 가장 강력한 압축률을 달성하여, 이 언어들에 효율적입니다.
- 역할극: 일관성 있게 캐릭터를 연기할 수 있으며, 주요 리더보드에서 종합 9위를 차지하여 많은 7B~14B 모델들을 제쳤습니다.
한계:
- 수학 및 코드: 준수한 수준이지만, 저자들은 이 분야가 여전히 개선이 필요한 영역임을 인정합니다. 아직 수학 천재는 아닙니다.
- 사실 관계: 크기가 작기 때문에 여전히 사실을 지어내거나 복잡한 지시를 오해할 수 있습니다.
- 미스터리: 훈련 중에 발생한 그 갑작스러운 성능 급등 말인가요? 그들은 여전히 정확한 이유를 모릅니다.
결론
이 논문은 똑똑해지기 위해 반드시 거대하고 비싼 뇌가 필요한 것은 아니라는 점을 보여줍니다. 작은 로봇에게 적절한 혼합의 고품질 서적을 먹이고, 넓게 읽기보다 깊게 읽도록 가르치며, 뇌를 위한 특별한 안정 장치를 제공한다면, 거인들과 경쟁할 수 있습니다. 또한 그들은 "지시 데이터"(명령을 따르는 법을 배우는 것)가 테스트 점수를 높이는 데 엄청난 치트키라는 것을 증명했으며, 아무도 사실을 숨길 수 없도록 그 증거를 공개했습니다.
이것은 강한 개성과 몇 가지 미해결 과제를 가진, 잠재력이 매우 큰 작은 모델입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.