← 최신 논문
💻 computer science

SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR

이 논문은 과도한 지도 미세 조정(SFT)이 롤아웃 분포를 압축하여 엔트로피 붕괴를 유발하고, 이것이 이후의 그룹 상대 정책 최적화(GRPO) 학습에서 순위 역전과 성능 저하로 이어진다는 것을 입증하며, 이러한 실패 모드는 RL 전 엔트로피와 초기 GRPO 역학을 모니터링함으로써 예측 및 완화될 수 있음을 보여준다.

원저자: Siddharth Aphale, Kelly Liu

게시일 2026-06-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Siddharth Aphale, Kelly Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문에 대한 설명을 쉬운 언어와 일상적인 비유를 사용하여 설명해 드립니다.

핵심 요약: "너무 완벽한" 함정

당신이 로봇에게 코딩을 가르치고 있다고 상상해 보세요. 표준 레시피는 두 단계로 구성됩니다:

  1. 지도 미세 조정 (SFT): 로봇이 패턴을 배울 수 있도록 수천 개의 올바른 코드 예시를 보여줍니다.
  2. 강화 학습 (RL): 로봇이 스스로 새로운 문제를 해결하도록 둡니다. 만약 정답을 맞히면 보상(간식)을 주고, 실패하면 아무것도 주지 않습니다.

문제점: 이 논문은 만약 1단계에서 로봇을 너무 많이 훈련시키면(1단계 과적합), 오히려 2단계에서 성능이 저하된다는 것을 발견했습니다.

보통 우리는 "1단계에서 로봇이 더 많은 예시를 암기할수록 더 잘하게 될 것"이라고 생각합니다. 하지만 저자들은 그 반대를 발견했습니다: 1단계에서 가장 많이 암기한 로봇이 사실 2단계에서 최악의 성적을 거둡니다. 실제로, 1단계에서 가장 적게 암기한 로봇이 챔피언이 됩니다.

비유: 뻣뻣한 무용수 vs 유연한 무용수

왜 이런 일이 발생하는지 이해하기 위해, 무작위 음악에 맞춰 즉흥적인 안무를 수행해야 하는 경기를 준비하는 두 명의 무용수를 상상해 보세요.

  • "과적합된" 무용수 (Deep SFT): 이 무용수는 똑같이 완벽한 10가지 안무를 수천 번 연습했습니다. 매우 정교하지만, 음악이 바뀌면 얼어붙어 버립니다. 오직 그 10가지 동작만 알 뿐입니다. 다른 방식으로 움직이는 법은 전혀 모릅니다.
  • "딱 적당한" 무용수 (Shallow SFT): 이 무용수는 기초를 연습하면서도 몸을 느슨하고 유연하게 유지했습니다. 규칙은 알지만, 음악이 바뀔 때 몸을 흔들거나 비틀거나 새로운 시도를 할 수 있습니다.

경쟁 (RL):
경기는 어떤 동작이 가장 효과적인지 확인하기 위해 여러 가지 동작을 동시에 시도할 것을 요구합니다.

  • 과적합된 무용수는 매번 똑같은 완벽한 동작만 하려고 합니다. 모든 동작이 똑같아 보이기 때문에, 심사위원(알고리즘)은 어떤 동작이 더 나은지 구분할 수 없습니다. 무용수는 갇혀버리고 새로운 것을 배울 수 없게 됩니다.
  • 유연한 무용수는 매우 다양한 동작을 시도합니다. 심사위원은 "아, 이 동작은 효과가 있었고, 저 동작은 아니구나!"라고 판단할 수 있으며, 무용수는 빠르게 학습합니다.

기술적 이유: 엔트로피 붕괴 (Entropy Collapse)

논문에서는 "다양성" 또는 "유연성"을 뜻하는 멋진 단어로 **엔트로피(Entropy)**라는 용어를 사용합니다.

  1. 엔트로피 붕괴: 로봇이 과적합되면, 로봇의 "마음"이 너무 좁아집니다. 다양한 가능성을 탐색하는 것을 멈추고 똑같은 몇 가지 답변만 반복합니다. 논문 용어로는 엔트로피가 붕괴되었다고 합니다.
  2. 신호의 소멸: 학습 알고리즘(GRPO라고 불림)은 서로 다른 답변들을 비교함으로써 작동합니다. 만약 로봇이 똑같은 답을 8번 연속으로 내놓는다면, 알고리즘은 혼란에 빠집니다. 비교할 차이가 없기 때문에 "그래디언트(개선 방향)"를 계산할 수 없습니다. 이는 마치 핸들이 앞을 향해 고정되어 있어 조향할 수 없는 자동차를 운전하려는 것과 같습니다.
  3. 순위 역전 (Rank Inversion): 이는 순위 역전이라는 이상한 결과를 초래합니다.
    • 두 번째 훈련 단계가 시작되기 에는, 과적합된 로봇은 천재처럼 보입니다 (연습 테스트에서 100% 정답을 맞힘).
    • 두 번째 훈련 단계가 끝난 에는, 그것은 재앙이 됩니다.
    • 반면, 처음에는 약간 못해 보였던 "덜 완벽한" 로봇이 슈퍼스타가 됩니다.

두 모델: 두 도시 이야기

저자들은 이 현상을 두 가지 서로 다른 로봇 뇌(모델)를 통해 테스트했습니다:

  1. Qwen (희생자): 이 모델은 함정에 빠졌습니다. 1단계 훈련을 많이 할수록 더 뻣뻣해졌습니다. "가장 좋아 보이는" 체크포인트(최고 점수)가 다음 단계를 위한 최악의 시작점이 되었습니다.
  2. DeepSeek (생존자): 이 모델은 본래 더 유연했습니다. 집중 훈련 후에도 뻣뻣해지지 않았습니다. 여전히 학습할 수 있는 "안전 지대"에 머물러 있었습니다. 이는 문제가 두 번째 훈련 단계 자체에 있는 것이 아니라, 첫 번째 단계가 Qwen 모델의 유연성을 망가뜨렸다는 것을 증명합니다.

해결책: 2단계 점검법

저자들은 단순히 문제점을 찾아내는 데 그치지 않고, 시간과 돈을 낭비하기 전에 이를 포착할 수 있는 진단 도구를 만들었습니다.

  • 1단계: "스트레칭" 테스트 (Pre-RL Entropy): 두 번째 훈련 단계를 시작하기 전, 로봇의 마음이 얼마나 "느슨한지" 확인합니다. 만약 로봇이 너무 경직되어 있다면(낮은 엔트로피), 위험도가 높은 것으로 분류합니다.
  • 2단계: "조기 경보" 모니터링: 두 번째 단계를 시작하면 처음 몇 분 동안 관찰합니다. 만약 로봇이 새로운 시도를 멈추고 즉시 자기 자신을 반복하기 시작한다면, 자원을 아끼기 위해 훈련을 조기에 중단합니다.

효과가 없었던 것들

저자들은 표준적인 기법들을 사용하여 고장 난 로봇을 고치려 노력했습니다:

  • 패널티 추가: "원래 훈련 내용에서 너무 벗어나지 마라." (이것은 상황을 더 악화시켰습니다).
  • 레이블 평활화 (Smoothing the labels): "답변에 대해 조금 덜 확신해라." (이것은 로봇이 다시 자신감 있어 보이게 만들었지만, 경쟁에서는 여전히 실패했습니다).

결론: 경기가 진행되는 동안 뻣뻣한 무용수에게 "더 열심히 해봐"라고 말한다고 해서 고칠 수 있는 것이 아닙니다. 애초에 너무 경직되게 훈련하지 않는 것이 중요합니다. 이 논문은 모델이 계속 학습하기 위해서는 완벽함보다 다양성(엔트로피)이 더 중요하다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →