← 최신 논문
💬 NLP

TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation

이 논문은 수학, 코딩, 과학 분야에서 기존 증류 기반 모델들을 크게 능가하면서도 더 큰 DeepSeek-R1 교사 모델의 성능과 대등한 결과를 보이는 32B 파라미터 모델인 TinyR1-32B-Preview를 소개하며, 이는 전문 학생 모델들을 선택적으로 학습시키고 이를 병합하는 새로운 Branch-Merge 증류 방식을 통해 개발되었습니다.

원저자: Lin Sun, Guangxiang Zhao, Xiaoqi Jian, Yuhan Wu, Weihong Lin, Yongfu Zhu, Qilong Shi, Change Jia, Aomufei Yuan, Yuxuan Tian, Linglin Zhang, Jinzhu Wu, Junfeng Ran, Sai-er Hu, Zihan Jiang, Junting Zhou
게시일 2026-04-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lin Sun, Guangxiang Zhao, Xiaoqi Jian, Yuhan Wu, Weihong Lin, Yongfu Zhu, Qilong Shi, Change Jia, Aomufei Yuan, Yuxuan Tian, Linglin Zhang, Jinzhu Wu, Junfeng Ran, Sai-er Hu, Zihan Jiang, Junting Zhou, Wenrui Liu, Xusen Xiao, Bin Cui, Tong Yang, Xiangzheng Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

TinyR1-32B-Preview 논문에 대한 설명을 일상적인 비유와 함께 간단한 개념으로 나누어 정리합니다.

큰 문제: "모든 것을 아는 만능 전문가" 딜레마

당신은 고급 수학, 복잡한 코딩, 심층 과학 등 모든 것을 아는 천재적인 세계적 수준의 교수 (대규모 AI 모델) 를 상상해 보세요. 당신은 이 교수를 자신의 노트북에서 실행할 수 있는 작고 저렴한 버전으로 만들고 싶습니다.

이를 수행하는 일반적인 방법은 교수의 방대한 노트를 한 번에 작은 공책에 모두 밀어 넣는 것입니다. 하지만 이 논문은 이러한 방식이 보통 실패한다고 주장합니다. 수학, 코딩, 과학 노트를 한 큰 더미에 섞어 놓으면 학생이 혼란에 빠집니다. 수학 노트가 코딩 노트와 "싸우게" 되어 학생이 모든 것을 덜 배우게 될 수 있습니다. 마치 바이올린 연주법, 미적분 풀이, 수플레 요리법을 모두 한 권의 거대하고 뒤죽박죽인 책을 읽으며 동시에 배우려 하는 것과 같습니다. 그 결과는 종종 모든 것은 어느 정도 잘하지만 아무것도 뛰어나지 않은 학생이 되는 것입니다.

해결책: "분리 및 병합" 전략

저자들은 이 작은 학생을 가르치는 더 지혜로운 방법을 제안하는데, 이를 **Branch-Merge Distillation(분기 - 병합 증류)**이라고 부릅니다. 이는 전문 훈련 캠프 followed by 최종 팀워크와 같습니다.

1 단계: 분기 (전문 훈련)

모든 것을 섞는 대신, 그들은 교수의 지식을 세 개의 별도의 "분기" 또는 전문 튜터로 나눕니다:

  1. 수학 튜터: 수학 문제만 가르칩니다.
  2. 코딩 튜터: 프로그래밍만 가르칩니다.
  3. 과학 튜터: 과학 개념만 가르칩니다.

그들은 세 개의 별도의 "전문가" 버전의 작은 학생을 훈련시킵니다. 각 학생이 한 과목에만 집중하기 때문에 다른 과목에 혼란을 겪지 않고 해당 분야의 진정한 마스터가 됩니다.

  • 비유: 한 학생이 세 과목을 동시에 배우려 하는 대신, 세 명의 다른 튜터를 고용합니다. 한 명은 수학만, 한 명은 코딩만, 한 명은 과학만 가르칩니다. 각 학생은 자신의 특정 과목에서 전문가가 됩니다.

2 단계: 병합 (팀워크)

이제 팀에는 세 명의 천재 전문가가 있지만, 세 가지를 모두 아는 단일 학생이 필요합니다. 세 학생의 두뇌를 단순히 평균 내면 각자의 독특한 천재성이 손실될 수 있습니다.

대신, 그들은 이들을 결합하는 지능적인 "병합" 도구 (Arcee Fusion) 를 사용합니다. 이 도구는 매우 엄격한 편집자처럼 행동합니다. 세 명의 전문가를 보며 이렇게 묻습니다: "수학 튜터의 이 새로운 지식 조각이 학생의 두뇌를 실제로 향상시키는가, 아니면 단순히 노이즈인가?"

  • 규칙: 수학 튜터가 현재 학생이 가지고 있지 않은 brillant하고 독특한 통찰력을 가지고 있다면, 편집자는 그것을 유지합니다. 통찰력이 약하거나 학생이 이미 알고 있는 것과 충돌한다면 편집자는 그것을 폐기합니다.
  • 비유: 세 명의 요리사가 있다고 상상해 보세요. 한 명은 완벽한 스테이크를, 한 명은 완벽한 수프를, 한 명은 완벽한 케이크를 만듭니다. 당신은 단순히 그들의 재료를 블렌더에 섞지 않습니다. 대신, 가장 좋은 스테이크 레시피, 가장 좋은 수프 레시피, 가장 좋은 케이크 레시피를 가져와 하나의 마스터 요리책에 결합합니다. 당신은 정말로 훌륭한 부분들만 유지합니다.

결과: 슈퍼 학생

이 과정의 결과는 TinyR1-32B-Preview입니다.

  • 성능: 이 작은 모델은 모든 데이터를 섞어 훈련한 "옛 방식"의 다른 작은 모델들보다 수학, 코딩, 과학 분야에서 훨씬 뛰어납니다.
  • 비교: 훨씬 작음에도 불구하고 거대한 "DeepSeek-R1" 교사 모델과 거의同等한 성능을 발휘합니다.
  • 효율성: 이 방법은 또한 놀랍도록 빠르고 저렴합니다. 논문은 이러한 모델을 병합하는 데 강력한 컴퓨터에서 단 4 시간이 걸렸다고 밝히는데, 반면 혼합된 데이터로 모델을 재훈련하는 데는 740 시간이 걸렸을 것입니다. 마치 30 일 대신 4 시간 만에 마스터 요리사를 얻는 것과 같습니다.

왜 중요한가 (논문에 따르면)

이 논문은 이것이 AI 세계에서 "공짜 점심"이라고 주장합니다. 학습을 먼저 분리한 다음 최상의 부분들을 신중하게 결합함으로써 "작업 간섭"(한 가지를 배우는 것이 다른 것을 배우는 능력을 해치는 문제) 의 문제를 해결합니다.

논문이 주장하지 않는 것:

  • 이 모델이 의료 진단이나 법적 조언에 준비되었다고 주장하지 않습니다.
  • 이 방법이 모든 가능한 유형의 AI 작업에 작동한다고 주장하지 않습니다 (그들은 수학, 코딩, 과학만 테스트했습니다).
  • 모델이 완벽하다고 주장하지 않습니다. 복잡한 지시 따르기나 안전 점검과 같은 부분에서는 여전히 작업이 필요하다고 인정합니다.

요약하자면, 이 논문은 작고 똑똑한 AI 를 원한다면 한 번에 모든 것을 가르치려 하지 말라고 보여줍니다. 한 번에 한 가지씩 가르치고 전문가가 된 다음, 그 전문가들을 신중하게 이어 붙이십시오.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →