← 최신 논문
🤖 machine learning

OISD: On-Policy Internal Self-Distillation of Language Models

이 논문은 GRPO 최적화 과정에서 로그와 어텐션 정렬을 통해 최종 층의 예측 신호와 중간 표현을 정렬함으로써 언어 모델의 추론 능력을 향상시키는 새로운 온-정책 내부 자기 증류 프레임워크인 OISD 를 소개하며, 외부 특권 정보를 필요로 하지 않으면서 수학 추론 작업에서 기존 강화학습 기준 대비 상당한 개선을 달성합니다.

원저자: Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 수학 문제를 풀도록 학생을 가르친다고 상상해 보세요. 전통적인 방식에서는 학생이 사고 과정 전체를 적게 한 뒤, 마지막에 오직 점수만 줍니다. "정답" 또는 "오답"입니다. 만약 틀렸다면, 어디서 길을 잃었는지 또는 어떻게 다르게 생각해야 했는지 알려주지 않고, 다시 시도하라고만 말합니다. 이것이 현재 대부분의 AI 학습 방식입니다. 최종 답변에 집중하고 그 사이에 일어난 혼란스러운 사고 과정을 무시합니다.

**"OISD: On-Policy Internal Self-Distillation of Language Models"**라는 논문은 AI 모델을 가르치는 더 똑똑한 방식을 제안합니다. 간단한 비유를 들어 설명해 보겠습니다.

핵심 아이디어: "내부 멘토"

보통 AI 의 사고 능력을 향상시키려고 할 때, 더 똑똑한 AI 인 외부 "교사" 모델을 불러와 학생 AI 에게 어떻게 생각해야 하는지 보여줍니다. 하지만 이 논문은 말합니다. "이미 자신 안에 교사가 있는데, 왜 외부 교사를 데려와야 합니까?"

저자들은 대규모 AI 모델이 다층 건물과 같다는 점을 깨달았습니다.

  • 1 층 (초기 레이어): AI 가 사고를 시작하는 곳입니다. 다소 모호하며 문제를 여러 각도에서 바라봅니다.
  • 옥상 (최종 레이어): 최종 답변이 결정되는 곳입니다. AI 가 꼭대기에 도달할 때까지는 모든 정보를 처리했고, 정답이 무엇인지 정확히 알고 있습니다.

**OISD(On-Policy Internal Self-Distillation)**는 AI 가 문제를 풀면서 자신의 "옥상"(최종 레이어) 을 이용해 자신의 "1 층"(중간 레이어) 을 가르치는 방법입니다.

작동 방식: 두 가지 유형의 수업

논문은 "옥상"이 "1 층"을 가르치는 두 가지 구체적인 방식을 제시합니다.

  1. "어떻게 생각할지" (Logit Alignment):

    • 비유: 1 층이 "아마 답은 4 일 수도 있고, 5 일 수도 있겠지?"라고 추측한다고 상상해 보세요. 옥상이 내려다보며 말합니다. "아니, 99% 확률로 4 야. 5 라고 추측하는 걸 멈춰."
    • 역할: 초기 사고 단계가 최종 답변의 확신과 논리에 정렬되도록 강제합니다. 모델이 올바른 신념을 어떻게 형성하는지 가르칩니다.
  2. "어디를 볼지" (Attention Alignment):

    • 비유: 1 층이 긴 이야기를 읽다가 잘못된 단어에 주의를 빼앗긴다고 상상해 보세요. 옥상이 가리키며 말합니다. "저 단어는 보지 마. 특정 숫자를 봐. 그게 네가 필요한 단서야."
    • 역할: 초기 레이어가 최종 레이어가 결정을 내리는 데 사용하는 문제의 중요한 부분에 주의를 집중하도록 강제합니다. 모델이 증거를 어디서 찾아야 하는지 가르칩니다.

이것이 특별한 이유 ("On-Policy" 부분)

과거에 "교사"를 이용해 AI 를 가르치고 싶다면, 종종 다른 사전 훈련된 모델을 사용해야 했습니다. 이는 학생이 자신의 방식이 아닌 다른 사람의 스타일을 배우게 되어 불일치를 초래했습니다.

OISD 는 **"On-Policy"**입니다. 즉:

  • AI 가 자신의 사고 (rollout) 를 생성합니다.
  • AI 의 최종 답변이 자신의 초기 사고에 대한 교사로 작용합니다.
  • 외부 교사가 없으며, 특별한 "우대" 힌트도 없고 불일치도 없습니다. 이는 단일 모델 내부에서 일어나는 자기 개선 루프입니다.

결과

연구자들은 이 방식을 고등학교 경시대회 문제와 같은 수학 문제에 적용해 테스트했습니다. 다른 강력한 방법들과 OISD 방식을 비교했습니다.

  • 결과: OISD 모델은 훨씬 더 높은 점수를 받았습니다. 단순히 정답을 더 자주 맞힌 것을 넘어, 문제의 시작부터 끝까지 일관되고 논리적인 "사고 과정"을 개발했습니다.
  • 교훈: 뇌의 초기 부분이 최종 부분처럼 생각하도록 가르침으로써, 전체 시스템이 더 똑똑하고 신뢰할 수 있게 됩니다.

요약

OISD 를 시험이 끝날 때까지 실패했는지 확인하기만 기다리는 모델이 아니라, 문제 해결 중에도 "너는 잘못된 단서를 보고 있어"와 "이 단계에서는 더 확신해야 해"라고 속삭이는 내장된 코치 (자신의 최종 레이어) 를 가진 모델로 생각하세요. 이는 모델이 단순히 더 잘 추측하도록 하는 것이 아니라, 더 잘 생각하도록 학습시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →