← 최신 논문
🤖 AI

NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research

이 논문은 데이터 큐레이션 및 학습 전략에 대한 전면적인 어블레이션 연구를 통해 일반적인 지시 이행 능력과 특화된 추론 능력을 모두 크게 향상시킨, 최적화된 SFT, GRPO 강화 학습 및 교사 기반 증류를 활용하는 8B 규모 LLM을 위한 완전 투명하고 재현 가능한 사후 학습 파이프라인인 NebulaExp를 소개한다.

원저자: Qiaobo Hao, Yangqian Wu, Shunyi Wang, Zhongjian Zhang, Ziqun Li, Yayin He, Muqing Li, Chen Zhong

게시일 2026-06-26
📖 5 분 읽기🧠 심층 분석

원저자: Qiaobo Hao, Yangqian Wu, Shunyi Wang, Zhongjian Zhang, Ziqun Li, Yayin He, Muqing Li, Chen Zhong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하고 박학다식한 학생(80억 개의 파라미터를 가진 AI 모델)을 상상해 보세요. 이 학생은 방금 "사전 학습(pre-training)"을 마쳤습니다(인터넷 전체를 다 읽었습니다). 이 학생은 많은 사실을 알고 있지만, 조금은 무질서합니다. 지시 사항을 항상 잘 따르는 것은 아니며, 복잡한 수학 문제를 어려워하기도 하고, 답변이 일관적이지 않을 때도 있습니다.

**"NebulaExp-8B"**라는 논문은 ZTE의 한 팀이 이 가공되지 않은 학생을 데려와 엄격하고 투명한 "사후 학습(post-training)" 부트 캠프를 통해 일류 실력자로 탈바꿈시킨 과정에 대한 상세한 보고서입니다. 그들은 단순히 최종 성적만을 보여주는 것이 아니라, 어떻게 커리큘럼을 만들고, 숙제를 필터링하고, 선생님을 선정했는지 그 과정을 투명하게 공개했습니다.

이 여정의 이야기를 다음과 같이 쉬운 비유로 나누어 설명합니다.

1. 문제점: "노이즈가 섞인" 도서관

팀은 다양한 공개 출처에서 수집한 거대한 숙제 더미(데이터)로부터 시작했습니다. 하지만 이 도서관은 엉망진창이었습니다:

  • 일관성 없는 스타일: 어떤 답변은 격식을 갖춘 에세이처럼 쓰여 있었고, 다른 답변은 문자 메시지처럼 쓰여 있었습니다.
  • 틀린 답: 어떤 숙제에는 잘못된 풀이가 포함되어 있었습니다.
  • 뒤섞인 난이도: "쉬운" 질문과 "불가능한" 퍼즐이 명확한 등급 없이 뒤섞여 있었습니다.

해결책: 그들은 **데이터 처리 파이프라인(Data Processing Pipeline)**을 구축했습니다. 이것은 학생이 숙제를 보기 전에 숙제를 분류하고, 깨끗하게 정리하며, 등급을 매기는 하이테크 공장과 같습니다.

  • 증류(Distillation): 그들은 매우 똑똑한 "교장 선생님"(거대 AI 모델)을 사용하여 모든 답변을 일관되고 논리적인 어조로 다시 쓰게 했습니다.
  • 필터링(Filtering): 틀린 답이 있거나, 횡설수설하거나, 유해한 내용이 담긴 숙제는 모두 버렸습니다.
  • 등급 매기기(Grading): 학생이 처음에 얼마나 잘 맞혔는지를 기준으로 질문을 "쉬움", "중간", "어려움"으로 분류했습니다.

2. 두 가지 경로: "제너럴리스트" vs "스페셜리스트"

팀은 학생이 혼란에 빠지지 않고 한 번에 모든 것을 완벽하게 해내도록 훈련하는 것이 불가능하다는 것을 깨달았습니다. 그래서 훈련을 두 개의 뚜로 다른 갈래로 나누었습니다.

경로 A: "인스트럭트(Instruct)" 모델 (예의 바른 조수)

이 갈래는 규칙을 따르고 도움이 되는 것에 집중합니다.

  • 발견: 그들은 재미있는 트레이드오프(상충 관계)를 발견했습니다. 수학을 잘하려면 학생이 길고 복잡하며 어려운 이야기를 읽어야 했습니다. 하지만 코딩을 잘하려면 짧고 정밀하며 따라하기 쉬운 지침이 필요했습니다. 만약 어려운 수학 문제만 먹이면 코딩을 못 하게 되었고, 코딩 작업만 먹이면 수학을 못 하게 되었습니다.
  • 해결책: 그들은 "균형 잡힌 식단"을 만들었습니다. 데이터를 세심하게 섞었습니다: 약간의 어려운 수학, 약간의 정밀한 코드, 그리고 많은 양의 일반적인 긴 글을 섞었습니다.
  • 결과: 이러한 재료들을 완벽하게 배합함으로써, 학생의 평균 시험 점수를 크게 높였습니다. 또한, 강화 학습(RL)—즉, 정답을 맞혔을 때 학생에게 "보상"을 주는 방식—이 학생이 지시를 더 잘 따르도록 도와준다는 것을 발견했지만, 한 가지 유형의 문제에만 과도하게 집중하는 것을 피하기 위해 세심한 튜닝이 필요했습니다.

경로 B: "리즈닝(Reasoning)" 모델 (논리의 대가)

이 갈래는 어려운 퍼즐, 수학, 과학 문제를 푸는 데 집중합니다.

  • 전략: 학생에게 단순히 더 많은 데이터를 던져주는 대신, 커리큘럼을 사용했습니다.
    • 1단계: 짧고 쉬운 추론 체인을 먼저 시작하여 학생에게 단계별로 생각하는 법을 가르칩니다.
    • 2단계: 길고 복잡한 체인으로 넘어가 깊이 있는 문제 해결 능력을 가르칩니다.
  • 발견: 그들은 **양보다 질(Quality > Quantity)**이 중요하다는 것을 발견했습니다. 완벽하게 필터링된 고품질의 숙제 더미가 엉망인 데이터의 거대한 더미보다 훨씬 나았습니다. 또한 수학, 코드, 과학 데이터를 함께 섞는 것이 한 가지 주제에만 집중하는 것보다 학생이 더 잘 배우는 데 도움이 된다는 것을 발견했습니다.

3. 비밀 병기: "온-폴리시 증류(On-Policy Distillation, OPD)"

보통 학생을 더 잘 가르치려면, 학생의 작업을 확인하고 점수(보상)를 줄 "검증자(Verifier, 엄격한 채점자)"가 필요합니다. 하지만 창의적인 글쓰기나 개방형 질문의 경우 단 하나의 "정답"이 없기 때문에 이를 수행하기 어렵습니다.

팀은 OPD라는 새로운 기술을 시도했습니다:

  • 비유: 검증자가 점수를 주는 대신, **마스터 셰프(선생님)**가 학생 옆에 서 있다고 상상해 보세요. 학생이 요리를 하면, 마스터 셰프는 단순히 "좋다" 또는 "나쁘다"라고 말하는 것이 아니라, "여기에 소금을 한 꼬집 더 넣었어야 했어"라거나 "불을 약간 줄여야 해"라고 속삭여 줍니다.
  • 왜 멋진가: 이 "속삭임"(선생님의 사고 과정을 모방하는 것)은 단 하나의 정답을 검증할 수 없는 경우에도 작동합니다.
  • 놀라운 점:
    • 단일 교사: 단 하나의 교사 모델을 사용하여, 전통적인 "채점자" 방식보다 학생의 지시 이행 능력을 13배 적은 데이터만으로 더 잘 향상시켰습니다.
    • 다중 교사: 네 명의 전문 분야별 선생님(수학, 코드, 과학, 지시 이행 전문가)을 고용했습니다. 그리고 이들을 하나의 학생에게 융합시켰습니다.
    • 마법 같은 결과: 학생은 단순히 선생님들의 평균이 되지 않았습니다. 수학 테스트에서 학생은 실제로 최고의 개별 선생님보다 더 높은 성적을 냈습니다. 이는 마치 학생이 수학 천재, 코딩 마법사, 과학 전문가와 함께 공부한 뒤, 수학 문제를 풀 때 그 수학 천재보다 더 잘 풀게 된 것과 같습니다. 지식의 결합이 새롭고 더 강력한 것을 만들어낸 것입니다.

4. 핵심 요약 (치트 시트)

  • Garbage In, Garbage Out (쓰레기가 들어가면 쓰레기가 나온다): 데이터를 정제하는 것(틀린 답과 나쁜 스타일을 제거하는 것)이 가장 중요한 단계입니다. 이것은 화려한 훈련 알고리즘보다 더 중요합니다.
  • 모두에게 맞는 옷은 없다: 수학과 코딩은 서로 반대되는 유형의 훈련 데이터가 필요합니다. 따라서 이를 세심하게 섞어야 합니다.
  • 선생님의 크기보다 질이 중요하다: "속삭임" 방식(OPD)을 사용할 때는, 모든 것에 대해 "그저 그런" 거대 모델보다는 가르치려는 특정 주제에 강한 작은 모델을 사용하는 것이 더 좋습니다.
  • 적을수록 좋다 (Less is More): 성능을 높이기 위해 수백만 개의 예시가 필요한 것은 아닙니다. 때로는 엄격하게 선별된 10,000개의 고품질 예시만으로도 엄청난 도약을 이룰 수 있습니다.

요약

이 논문은 더 똑똑한 AI를 만들기 위해 더 크고 비싼 뇌를 만들 필요는 없다는 것을 증명합니다. 대신, 더 나은 훈련 레시피가 필요합니다: 깨끗한 데이터, 균형 잡힌 주제의 혼합, 그리고 정답을 일일이 검증할 필요 없이 최고의 전문가로부터 배울 수 있게 하는 스마트한 교수법입니다. 그들은 이 전체 레시피를 공개하여 누구나 이를 복제하여 자신만의 똑똑한 AI를 만들 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →