← 최신 논문
🤖 machine learning

Breaking the Tokenizer Barrier: On-Policy Distillation across Model Families

이 논문은 서로 다른 토크나이저를 가진 서로 다른 모델 패밀리 간에 온-폴리시 증류(On-Policy Distillation)가 작동할 수 있게 하는 정밀한 토큰 매핑 알고리즘을 소개하며, 기존의 한계를 극복하고 기존의 교차 토크나이저 방식과 비교하여 현저히 향상된 컴퓨팅 효율성을 입증한다.

원저자: Yifan Niu, Han Xiao, Dongyi Liu, Zelong Wang, Dihong Gong, Yasheng Wang, Jia Li

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yifan Niu, Han Xiao, Dongyi Liu, Zelong Wang, Dihong Gong, Yasheng Wang, Jia Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 문제: 서로 다른 언어를 사용하는 두 전문가

당신에게 수학 문제를 푸는 데 전문가인 아주 똑똑한 선생님(대규모 AI 모델)이 있다고 상상해 보세요. 또한 그 선생님으로부터 배우고 싶어 하는 학생(소규모 AI 모델)도 있습니다.

과거에는 학생이 선생님으로부터 효과적으로 배우기 위해서, 반드시 똑같은 "언어"를 사용해야만 했습니다. AI 용어로 말하자면, 이들은 정확히 동일한 **토크나이저(Tokenizer)**를 사용해야 했습니다.

  • 토크나이저란 무엇인가? 문장을 작은 조각(토큰)으로 나누는 사전이라고 생각하면 됩니다.
    • 선생님의 사전: "running"이라는 단어를 run + ning이라는 두 개의 조각으로 나눌 수 있습니다.
    • 학생의 사전: "running"을 하나의 단일 조각인 running으로 유지할 수 있습니다.

만약 선생님이 "너의 run 부분은 아주 훌륭했어"라고 말한다면, (단일 조각인 running만을 보는) 학생은 혼란에 빠집니다. 학생은 자신의 단일 조각 중 어느 부분이 칭찬받은 것인지 알지 못합니다. 이러한 불일치 때문에, 강력한 "온-폴리시 증류(On-Policy Distillation, 학생이 연습하는 동안 학습하는 고도의 기술적 교수법)"는 이미 같은 사전을 공유하는 가족 관계인 모델들 사이에서만 일어날 수 있었습니다.

해결책: 스마트한 번역기

이 논문은 **교차 토크나이저 온-폴리시 증류(Cross-Tokenizer On-Policy Distillation)**라는 새로운 방법을 소개합니다. 저자들은 선생님과 학생이 완전히 다른 사전을 사용하더라도 서로에게서 배울 수 있도록 하는 "스마트한 번역기"를 구축했습니다.

이 시스템이 작동하는 단계별 과정은 다음과 같습니다.

1. "듀얼 포인터"의 춤 (매칭 찾기)

선생님과 학생이 모두 같은 이야기를 읽고 있지만, 선생님은 짧은 구절로 읽고 학생은 긴 문장으로 읽는다고 상상해 보세요.

  • 저자들은 **듀얼 포인터 청크 정렬(Dual-Pointer Chunk Alignment)**이라 불리는 알고리즘을 만들었습니다. 이는 마치 두 사람이 나란히 걷는 것과 같습니다.
  • 한 사람은 선생님의 청크를 가리키고, 다른 한 사람은 학생의 청크를 가리킵니다.
  • 그들은 텍s의 단어 수가 다르더라도 의미가 완벽하게 일치하는 지점을 찾을 때까지 손가락을 앞으로 움직입니다.
  • 결과: 이들은 "동기화된 청크(Synchronized Chunks)"를 식별해 냅니다. 예를 들어, 선생님의 세 개의 작은 단어(1, 2, 0)가 학생의 하나의 큰 단어(120)와 정확히 같다는 것을 알아내는 식입니다.

2. "크레딧 할당(Credit Assignment)" (칭찬 나누기)

매칭되는 청크를 찾았다면, 이제 선생님의 피드백을 어떻게 나눌지 결정해야 합니다.

  • 문제: 선생님은 세 개의 작은 단어에 대해 점수를 주었습니다. 하지만 학생은 하나의 큰 단어만을 가지고 있습니다. 이 점수를 어떻게 나누어야 할까요?
  • 해결책: 이 논문은 "시맨틱 프라이어(Semantic Prior, 학생이 이미 알고 있던 생각)"를 사용합니다.
    • 만약 학생이 이미 단어 120에 대해 꽤 확신하고 있었다면, 선생님의 칭찬 중 더 적은 몫을 가져갑니다.
    • 만약 학생이 120에 대해 혼란스러워했거나 놀랐다면, 더 빠르게 배울 수 있도록 더 많은 칭찬의 몫을 가져갑니다.
  • 이를 통해 학생은 자신만의 독특한 사고 방식을 잃지 않으면서도 올바른 교훈을 얻을 수 있습니다.

이것이 왜 중요한가 (결과)

저자들은 "Llama" 모델(학생)에게 "Qwen" 모델(선생님)을 가르치는 방식으로 이를 테스트했습니다. 이 둘은 서로 다른 사전을 가진 매우 다른 계열의 AI입니다.

  1. 더 효과적입니다: 학생은 단순히 선생님의 답을 암기하려고 노력할 때보다 훨씬 더 빠르게 학습했으며, 수학과 코딩 분야에서 더 똑똑해졌습니다.
  2. 엄청난 에너지를 절약합니다: 이것이 가장 놀라운 부분입니다.
    • 기존 방식 (SFT): 동일한 수준의 지능을 얻기 위해 학생은 480,000개의 추가 예시를 읽어야 했습니다.
    • 새로운 방식 (OPD): 학생은 동일한 수준에 도달하기 위해 단 20,000개의 예시만 필요했습니다.
    • 비유: 이는 사전을 10번 읽으며 언어를 배우는 것과, 실시간으로 실수를 교정해 주는 원어민과 대화를 나누며 배우는 것의 차이와 같습니다. 대화(OPD)가 훨씬 효율적입니다.

핵심 요약

이 논문은 AI 모델들을 고립시켰던 "벽"을 허물었습니다. 이전에는 선생님과 똑같은 "토큰 언어"를 사용하는 학생에게만 가르칠 수 있었습니다. 이제 이 새로운 "스마트한 번역기" 덕분에, 단어를 어떻게 나누는지와 상관없이 어떤 강력한 AI라도 어떤 작은 AI와도 짝을 지어 지식을 효율적으로 전달할 수 있습니다.

저자들은 이 방법이 가능할 뿐만 아니라 기존 방식보다 훨씬 저렴하고 빠르다는 것을 발견했으며, 이는 훨씬 더 다양한 종류의 AI 모델들이 서로 학습할 수 있는 문을 열어주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →