← 최신 논문
💬 NLP

ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains

본 논문은 기존 온-정책 자기 증류 방법의 과적합 및 일반화 성능 저하라는 한계를 극복하기 위해, 자기 반성기를 활용하여 오류를 국소화하고 오류에 특화된 표적 증류를 유도함으로써 도메인 전반에 걸친 언어 모델 추론 능력을 향상시키는 반성적 온-정책 자기 증류 (ROSD) 프레임워크를 소개합니다.

원저자: Ziqi Zhao, Xinyu Ma, Liu Yang, Yujie Feng, Daiting Shi, Jingzhou He, Xin Xin, Zhaochun Ren, Xiao-Ming Wu

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ziqi Zhao, Xinyu Ma, Liu Yang, Yujie Feng, Daiting Shi, Jingzhou He, Xin Xin, Zhaochun Ren, Xiao-Ming Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 학생에게 복잡한 수학 문제를 푸는 법을 가르친다고 상상해 보세요. 당신은 스스로 연습하며 배우려는 똑똑한 교사 (AI 모델) 를 가지고 있습니다.

문제: "모방자" 교사

과거에 이 학생이 실수를 했을 때, 그들을 가르치는 표준적인 방법은 교과서에서 완벽한 최종 답안을 보여주고 "이걸 봐! 너는 네 답안을 이걸과 정확히 똑같이 써야 해"라고 말하는 것이었습니다.

이 논문은 이를 **온-정책 자기 증류 (On-Policy Self-Distillation, OPSD)**라고 부릅니다. 문제는 학생이 "모방자"처럼 행동하기 시작한다는 점입니다.

  1. 해결책이 아닌 스타일을 암기합니다: 그들이 왜 실수했는지 배우는 대신, 교사의 특정 단어와 형식을 그대로 복사합니다.
  2. 이미 옳았던 것을 망칩니다: 학생이 답안의 앞부분은 올바르게 풀었지만 뒷부분을 틀렸다면, 교사는 교과서와 일치하도록 전체를 다시 쓰게 강요합니다. 이는 우연히 그들이 이미 알고 있던 좋은 부분을 덮어쓰게 하여, 자신의 유효한 추론을 잊게 만듭니다.

이 방식은 특정 연습 문제에는 그럭저럭 작동하지만, 학생이 새로운 유형의 문제 (다른 도메인) 를 마주치면 실패합니다. 그들은 답안의 "외형"을 암기했을 뿐, 논리는 배우지 못했기 때문입니다.

해결책: ROSD ("성찰적 튜터")

저자들은 ROSD(Reflective On-Policy Self-Distillation, 성찰적 온-정책 자기 증류)라는 새로운 방법을 제안합니다. ROSD 를 완성된 에세이를 건네주는 교사가 아니라, 돋보기를 사용하는 비판적 편집자로 생각하세요.

ROSD 가 작동하는 방식은 다음과 같습니다.

1. "자기 반성자" (탐정)
완벽한 답안만 보여주는 대신, 시스템은 먼저 탐정처럼 행동합니다. 학생의 틀린 답안과 정답을 나란히 살펴봅니다.

  • 질문합니다: "정확히 어디서 논리가 무너졌나요?"
  • 찾아냅니다: 학생이 길을 잃은 특정 문장이나 단계를 찾아냅니다.
  • "수정 아이디어"를 생성합니다: (예: "여기서 단위를 변환하는 것을 잊었습니다"와 같이) 그 특정 실수를 어떻게 고칠지 설명하는 짧은 메모를 작성합니다. ("전체 에세이를 여기 있습니다"가 아니라)

2. "오류 인용" (하이라이터)
시스템은 단순히 추측하지 않습니다. 학생의 답안에서 오류가 발생한 정확한 텍스트 덩어리를 물리적으로 하이라이트합니다. 마치 교사가 붉은 펜으로 틀린 문장만 동그라미를 치고 페이지의 나머지는 건드리지 않는 것과 같습니다.

3. 표적 수정 (수술)
이제 "자기 교사"가 개입합니다. 하지만 학생에게 에세이 전체를 다시 쓰게 하는 대신, 교사는 하이라이트된 오류에 대해서만 지침을 제공합니다.

  • 학생은 자신의 올바른 서론과 유효한 추론 단계 (유효한 접두사) 를 유지합니다.
  • 그들은 "수정 아이디어"에 안내받아 틀린 부분만 다시 씁니다.

비유: 고장 난 자동차 수리

  • 구식 방법 (OPSD): 당신의 차가 타이어가 펑크 났습니다. 정비사는 차 전체를 분해하고, 엔진, 좌석, 바퀴를 버린 뒤 청사진을 바탕으로 차를 처음부터 새로 만듭니다. 작동은 하지만, 이미 작동하던 모든 것을 잃게 됩니다.
  • ROSD: 정비사는 차를 살펴보고 펑크 난 타이어 (오류) 를 찾아냅니다. 그리고 "알겠습니다, 엔진과 좌석은 괜찮습니다. 이 타이어 하나만 교체하고 제대로 공기압이 차 있는지 확인합시다"라고 말합니다.

결과

이 논문은 다양한 "과목"(물리학, 화학, 컴퓨터 도구 사용 등) 에서 이를 테스트했습니다.

  • 과목 능력 향상: 학생들은 이전보다 자료를 더 잘 학습했습니다.
  • 새로운 과목에 대한 적응력 향상: 답안의 스타일을 암기하는 대신 오류를 수정하는 논리를 배웠기 때문에, 이전에 본 적 없는 문제를 푸는 데 훨씬 능숙해졌습니다.
  • 안정성: 구식 방법은 학생이 너무 많이 복사하려고 시도하며 혼란스러워질수록 시간이 지남에 따라 종종 더 나빠졌습니다. ROSD 는 안정적으로 유지되며 계속 발전했습니다.

요약하자면: ROSD 는 AI 가 처음부터 끝까지 완벽한 모델을 복사하도록 강요하는 대신, 자신의 추론 중 좋은 부분을 보존하면서 자신의 실수를 외과적으로 수정하도록 가르칩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →