← 최신 논문
💬 NLP

Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization

이 논문은 수학 및 프로그래밍 벤치마크 전반에서 확률 질량을 보존하고 학생 모델의 성능을 향상시키기 위해, 공유된 바이트 공간에 대한 교사 분포를 재표현하는 새로운 교차 토크나이저 온-폴리시 증류 방법인 바이트-프리픽스 마진얼라이제이션(Byte-Prefix Marginalization, BPM)을 소개한다.

원저자: Hao Wang, Kun Yuan, Wenlin Zhong, Minglei Zhang, Han Xiao, Ming Sun, Honggang Qi

게시일 2026-07-27
📖 5 분 읽기🧠 심층 분석

원저자: Hao Wang, Kun Yuan, Wenlin Zhong, Minglei Zhang, Han Xiao, Ming Sun, Honggang Qi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

서로 다른 설계자들이 각자의 고유한 언어를 사용하여 사고하는 거대하고 찬란한 AI 뇌들이 구축된 세상을 상상해 보십시오. 어떤 설계자는 길고 유려한 문장을 사용하는 반면, 다른 설계자는 생각을 아주 작고 빠른 음절 단위로 잘게 쪼개기도 합니다. 이것이 현대의 "거대 언어 모델(LLM)"이 처한 현실입니다. 이들은 매우 똑똑하지만, 종종 서로 다른 "토큰" 언어를 사용합니다. 토큰이란 컴퓨터가 정보를 처리하기 위해 사용하는 단어, 단어의 일부, 또는 심지어 단일 글자와 같은 텍스트의 덩어리를 의미합니다.

이제 여러분이 이 거대한 스승들로부터 배울 수 있는 더 작고, 빠르고, 저렴한 AI 학생을 만들고 싶다고 상상해 보십시오. 이를 "증류(distillation)"라고 부릅니다. 보통은 단순히 학생이 스승의 정답을 복사하게 하면 됩니다. 하지만 여기에 문제가 있습니다. 만약 스승과 학생이 서로 다른 토큰 언어를 사용한다면, 직접적인 복사 및 붙여넣기는 불가능합니다. 이는 영어를 말하는 학생에게 이모지와 기호로만 쓰인 교과서를 건네주며 가르치는 것과 같습니다. 학생은 기호를 보지만, 그 기호가 어떤 영어 단어와 일치하는지는 알지 못합니다. 만약 억지로 매칭을 시도한다면, 여러분은 실수로 고양이 그림이 "사과"를 의미한다고 가르치거나, 더 나아가 스승의 지혜 중 절반을 학생의 사전에 맞지 않는다는 이유로 버리게 될 수도 있습니다.

이 논문은 바로 그 골칫거리를 다룹니다. 연구진은 다음과 같은 질문을 던졌습니다. "우리는 학생 AI가 스승과 완전히 다른 '토큰' 언어를 사용하더라도, 스승의 탁월함을 잃거나 엉뚱한 것을 배우게 하지 않고 학습할 수 있을까?"

해결책: "바이트-프리픽스(Byte-Prefix)" 번역기

저자들(KwaiKAT 및 중국과학원 팀)은 **바이트-프리픽스 마진얼라이제이션(Byte-Prefix Marginalization, BPM)**이라는 영리하고 새로운 방법을 소개했습니다. 이 방법이 어떻게 작동하는지 이해하기 위해, 복잡한 수학은 잠시 접어두고 컴퓨터가 실제로 텍스트를 어떻게 보는지 생각해 봅시다.

서로 다른 AI들이 텍스트를 서로 다른 크기의 "토큰"(덩어리)으로 나누더라도, 그들은 근본적인 **바이트(bytes)**에 대해서는 모두 동의합니다. 바이트는 모든 글자, 공백, 문장 부호를 구성하는 아주 작고 보이지 않는 빌딩 블록인 0과 1입니다. 어떤 AI가 "unbelievable"이라는 단어를 하나의 거대한 토큰으로 보든, 혹은 "un", "bel", "ievable"로 나누어 보든, 그들은 모두 "un"에 해당하는 바이트가 먼저 오고, 그 뒤에 "bel"의 바이트가 온다는 사실에 동의합니다.

저자들은 서로 다른 크기로 쪼개진 지저한 토큰들을 맞추려고 노력하는 대신, 스승의 지혜를 이 공유된 "바이트 언어"로 먼저 번역할 수 있다는 점을 깨달았습니다. BPM의 단계별 과정은 다음과 같습니다.

  1. 바이트 맵(The Byte Map): 스승의 다음 예측이 확률의 구름이라고 가정해 봅시다. 스승은 "다음 단어가 'unbelievable'일 확률이 30%이다"라고 말합니다.
  2. 최장 일치(The Longest Match): 학생의 토크나이저가 "unbelievable"의 바이트를 살펴보고 다음과 같이 묻습니다. "내 사전에서 이 바이트들의 시작 부분에 들어맞는 가장 긴 덩어리는 무엇인가?" 아마도 학생은 "un"이라는 토큰과 "belie"라는 토큰을 가지고 있을 것입니다.
  3. 전달(The Transfer): BPM은 "unbelievable"에 대한 스승의 30% 확률을 가져와 학생의 토큰인 "un"(또는 가장 긴 일치 항목인 "belie")에 전달합니다. 이는 마치 "만약 스승이 'unbelievable'이 유력하다고 생각한다면, 'un'이 그 단어의 첫 부분이기 때문에 학생도 반드시 'un'이 유력하다고 생각해야 한다"라고 말하는 것과 같습니다.
  4. 안전망(The Safety Net): 만약 스승이 학생의 사전에 아예 시작조차 할 수 없는 내용을 말한다면 어떻게 될까요? BPM은 그 확률을 그냥 버리지 않습니다. 대신 그것을 특별한 "잔차(residual)" 버킷에 담아, 100%의 확률 질량이 보존되도록 합니다. 아무것도 손실되지 않습니다.

이 방법은 완벽하고 "질량을 보존하는(mass-preserving)" 타겟을 만들어냅니다. 이는 스승과 학생이 서로 다른 언어를 사용하더라도, 바이트에 대해 동의하는 한 학생이 스승이 의도한 바를 정확하게 배우도록 보장합니다.

"공백(Whitespace)"의 함정과 해결책

그러나 연구진은 재미있고 까첨 까다로운 문제를 발견했습니다. 스승과 학생이 코드를 작성할 때, 때때로 다음 "토큰"은 단순히 여러 개의 공백이나 탭(들여쓰기)일 수 있습니다. 서로 다른 토크나이저는 공백을 서로 다르게 쪼개기 때문에, 스승은 "나는 세 개의 공백을 추가하고 있다"라고 말하는 반면, 학생의 토크나이저는 이를 "나는 하나의 큰 공백 토큰을 추가하고 있다"라고 인식할 수 있습니다.

만약 학생이 이러한 공백 토큰에 대해 스승의 정확한 확률을 복사하려고 시도하면 혼란에 빠집니다. 학생은 코드의 실제 로직이 아니라 스승 특유의 "공백 쪼개기 스타일"을 배우기 시작합니다. 저자들은 이러한 혼란이 어떤 경우에는 학생의 코드 능력을 완전히 붕괴시킨다는 것을 발견했습니다. 즉, 작동하는 프로그램을 작성하는 능력이 49%에서 처참한 9%로 급락했습니다.

이를 해결하기 위해 그들은 간단한 "공백 마스크(whitespace mask)"를 추가했습니다. 이는 마치 심판처럼 "이봐, 만약 다음 단계가 단순히 공백이라면, 스승의 정확한 공백 토큰 확률을 복사하려고 애쓰지 마. 그냥 그 부분은 무시해"라고 말하는 것과 같습니다. 이 작은 규칙이 상황을 구했고, 학생이 코드의 실제 로직에 집중할 수 있게 하여 붕괴를 막았습니다.

결과: 더 똑똑한 학생, 더 빠른 속도

연구팀은 세 가지 거대 AI 스승(Qwen3-32B, GLM-Z1-9B, MiniMax-M2.7)을 데려와 하나의 작은 학생 모델(Qwen3.5-2B)에게 가르치는 방식으로 이 방법을 테스트했습니다. 이 스승들은 서로 매우 다른 토큰 언어를 가지고 있어 작업 난도가 높았습니다.

그들은 이 새로운 BPM 방식이 서로 다른 토크나이저를 다루는 기존의 다른 방식들과 어떻게 다른지 비교했습니다. 결과는 명확했습니다.

  • 더 높은 점수: 수학 및 코딩에 관한 6개의 까다로운 벤치마크에서, BPM으로 훈련된 학생들은 다른 방식들을 지속적으로 앞질렀습니다. 이들은 가장 강력했던 이전 시도들보다 평균 점수를 3.7에서 6.6점 더 높였습니다.
  • 격차 해소: 이 방법은 작은 학생과 거대한 스승 사이의 성능 격차를 **33.5%에서 43.9%**까지 줄였습니다. 이는 스승의 두뇌 용량 중 엄청난 부분을 학생에게 전수했음을 의미합니다.
  • 강건성(Robustness): 이 방법은 스승과 학생이 매우 다를 때도(MiniMax 스승의 경우처럼) 잘 작동하여, "바이트-프리픽스" 접근법이 보편적인 번역기임을 입증했습니다.

이것이 왜 중요한가

이 논문은 우리가 서로에게 배우기 위해 모든 AI 모델이 동일한 사전을 사용할 필요는 없다는 점을 시사합니다. "바이트"라는 공유된 언어를 가교로 사용함으로써, 우리는 서로 다른 가문의 최고의 스승들을 섞어서 활용할 수 있으며, 스승의 지식을 잃지 않고도 효율적인 학생들에게 가르칠 수 있습니다. 이는 마치 사람들이 서로 다른 방언을 사용하더라도 모두가 알파벳에는 동의한다는 사실을 깨닫는 것과 같습니다. 학생에게 알파벳을 먼저 읽는 법을 가르친다면, 스승이 누구든 상관없이 무엇이든 가르칠 수 있습니다.

저자들은 이 접근 방식이 단순한 이론적 아이디어가 아니라 오늘날 실제로 작동하는 실용적인 도구임을 보여주었습니다. 이를 통해 거대한 스승들이 가진 막대한 컴퓨팅 파워 없이도 복잡한 수학 및 코딩 문제를 해결할 수 있는, 더 작고 빠르며 똑똑한 AI 모델을 만들 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →