← 최신 논문
🤖 machine learning

Self-Distilled RLVR

이 논문은 정보 누출과 훈련 불안정성을 해결하기 위해 환경 피드백으로부터 신뢰할 수 있는 업데이트 방향을 도출하는 RLVR 과 자기 증류로부터 세밀한 업데이트 크기를 결정하는 자기 증류를 결합한 새로운 프레임워크인 'RLSD'를 제안합니다.

원저자: Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, Jiaqi Wang, Nan Duan

게시일 2026-04-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, Jiaqi Wang, Nan Duan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎓 비유: "스승과 제자"의 훈련 방식

인공지능을 가르칠 때, 보통 두 가지 방식이 있습니다.

  1. 정답 확인 방식 (기존 RLVR): 학생이 문제를 풀고, 스승님이 "맞았나요? 틀렸나요?"라고 딱 한 번만 알려줍니다. (예: "이 수학 문제 답이 5 라면 O, 아니면 X")
    • 단점: 학생이 어디에서 실수했는지, 어떤 단어가 문제였는지 구체적으로 모릅니다. 그냥 "틀렸다"는 말만 듣고 전체를 다시 수정해야 하니까 비효율적입니다.
  2. 스승님의 상세한 지도 방식 (기존 OPSD): 학생이 풀고 있는 과정마다 스승님이 옆에 서서 "이 단어는 잘 썼네, 저 단어는 좀 어색해"라고 매 순간 상세한 피드백을 줍니다.
    • 단점: 여기서 큰 문제가 생깁니다. 스승님은 **정답 (비밀 정보)**을 미리 알고 있기 때문에, 학생이 그 정답을 모른 채 풀고 있는데 스승님은 "정답을 보고 이 단어가 좋네"라고 말합니다.

🚨 문제: "보이지 않는 정답"에 대한 중독

이 논문은 **두 번째 방식 (OPSD)**에 치명적인 결함이 있다고 지적합니다.

비유:
학생이 시험을 치는데, 스승님이 "정답이 '사과'라는 걸 알고 있으니, 네가 '사과'라고 말하면 칭찬해 줄게"라고 합니다.
학생은 정답을 모르고 추측해서 "사과"라고 말했을 때, 스승님은 "와, 정말 잘했어!"라고 칭찬합니다.
하지만 실제 시험장 (실제 세상) 에는 스승님이 정답을 알려주지 않습니다.

결과: 학생은 시험장에서 "아, 내가 '사과'라고 말해야 스승님이 좋아하네?"라고 착각합니다. 하지만 정작 시험지에는 '사과'라는 힌트가 없습니다. 학생은 **보이지 않는 정답 (스승님의 비밀)**에 의존하는 버릇이 생겨, 실제 시험에서는 엉뚱한 말을 하거나 망쳐버립니다.

논문의 실험 결과, 이런 방식으로 훈련된 AI 는 초반에는 급격히 실력이 늘다가, 나중에는 정답을 유추하는 버릇이 생겨 오히려 성능이 떨어지는 현상이 발생했습니다.

💡 해결책: "RLSD" (스승님의 역할을 바꾼다)

저자들은 "그럼 아예 스승님을 아예 안 쓰자"가 아니라, **"스승님의 역할을 바꾸자"**라고 제안합니다.

RLSD 의 핵심 아이디어:

  • 방향은 '환경'이 정한다: "맞았나 틀렸나?"는 **정답 (환경)**만 결정합니다. (스승님이 정답을 알려주지 않음)
  • 강도는 '스승님'이 정한다: "맞았다면, 어떤 단어가 가장 중요했는지"를 스승님이 알려줍니다.

비유:
학생이 문제를 풀고 정답을 맞췄다고 가정해 봅시다.

  • 기존 방식: "정답이니까 전체를 칭찬해!" (모든 단어가 똑같이 중요함)
  • RLSD 방식:
    • 환경 (정답 확인): "오! 정답이네! 잘했어!" (방향: 칭찬)
    • 스승님 (비밀 정보 활용): "근데 그중에서 **'3 곱하기 4'**라고 계산한 부분이 정말 결정적이었어. 그 부분을 특히 잘했어! 반면에 '그럼' 같은 말은 별로 중요하지 않았어."

결국: 학생은 "정답을 맞췄으니 칭찬받는다"는 큰 방향은 유지하면서, 어떤 부분이 진짜 중요한지를 스승님의 도움을 받아 세밀하게 배웁니다. 하지만 스승님이 "정답을 미리 봤다"는 사실은 학생이 직접 정답을 맞추는 데 영향을 주지 않습니다.

🏆 왜 RLSD 가 더 좋은가?

  1. 안정성: 정답을 미리 알지 못하게 하므로, AI 가 "비밀 정답"에 중독되어 망가지는 일이 없습니다.
  2. 효율성: "맞았나 틀렸나"만 보는 것보다 훨씬 더 정교하게 (단어 하나하나마다) 학습할 수 있어, 같은 시간 안에 더 빨리 실력이 늡니다.
  3. 최고의 성능: 실험 결과, 기존 방법들보다 수학이나 복잡한 추론 문제에서 훨씬 높은 점수를 받았습니다.

📝 한 줄 요약

"기존의 '스승님 지도' 방식은 학생이 보이지 않는 정답에 의존하게 만들어 망가뜨렸지만, RLSD는 스승님에게 **'어떤 부분이 중요한지'**만 물어보고, **'맞았는지 틀렸는지'**는 정답 (환경) 에게만 맡겨, 가장 안전하고 빠른 학습을 가능하게 했습니다."

이 방법은 인공지능이 더 똑똑하고 안정적으로 성장할 수 있는 새로운 길을 열어주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →