SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
이 논문은 기존의 혼합 정책(mixed-policy) 최적화 방식들이 DeepSpeed와 OpenRLHF의 구현 버그로 인해 잘못된 기준점(baseline)을 사용해 왔음을 지적하며, 버그를 수정한 표준적인 'SFT 후 RL(SFT-then-RL)' 방식이 혼합 방식보다 수학적 추론 성능에서 훨씬 더 우수함을 입증했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🍎 제목: "잘못된 기초 체력 테스트가 만든 가짜 우승자"
1. 배경: AI를 가르치는 두 가지 방법
AI에게 수학 문제를 풀게 하는 방법에는 크게 두 가지가 있습니다.
- 방법 A (SFT-then-RL): "교과서 먼저, 그다음 실전 연습"
먼저 정답이 적힌 완벽한 교과서(SFT)를 달달 외우게 해서 기초를 다진 뒤, 그다음 실전 문제(RL)를 풀며 스스로 깨우치게 하는 방식입니다. (정석 코스) - 방법 B (Mixed-Policy): "교과서와 실전을 동시에!"
교과서도 보고 문제도 풀면서, 두 가지를 한꺼번에 섞어서 배우는 방식입니다. 최근 많은 연구자들이 "이게 더 효율적이고 똑똑하다!"라며 이 방식을 밀고 있었습니다.
2. 사건의 발단: "가짜 챔피언의 등장"
최근 여러 연구 논문들이 **"방법 B(섞어서 배우기)가 방법 A(정석 코스)보다 훨씬 뛰어나다!"**라고 발표했습니다. 마치 "교과서 따로 공부하는 건 구식이야, 실전과 병행해야 천재가 돼!"라고 주장하는 것과 같았죠.
3. 반전: "범인은 바로 '고장 난 체력 측정기'였다!"
그런데 이 논문의 저자들은 의구심을 품었습니다. "정말 방법 B가 좋은 걸까, 아니면 방법 A가 너무 못 나온 걸까?" 조사해 보니 충격적인 사실이 밝혀졌습니다.
방법 A(정석 코스)를 테스트할 때 사용한 '측정 도구(학습 프레임워크)'에 치명적인 버그(오류)가 있었던 것입니다!
이 상황을 운동선수 선발 과정에 비유해 볼게요.
- 상황: 아주 유능한 선수를 뽑기 위해 '기초 체력 테스트'를 합니다.
- 문제 발생: 그런데 테스트 기계(DeepSpeed, OpenRLHF 등)가 고장 나 있었습니다. 선수가 100미터를 달렸는데, 기계가 첫 10미터만 기록하고 나머지 90미터는 아예 무시해 버린 것입니다.
- 결과: 정석대로 공부한 선수(방법 A)들은 기계 오류 때문에 실력이 형편없게 측정되었습니다. 반면, '섞어서 배우는 방식(방법 B)'은 다른 기계를 사용했기 때문에 제대로 측정되었죠.
- 착각: 사람들은 "와! 기초 체력 테스트(SFT)는 별로인데, 실전 위주로 훈련한 선수(Mixed-Policy)가 훨씬 대단하네!"라고 잘못된 결론을 내린 것입니다.
4. 결론: "기초가 튼튼해야 진짜 실력이 나온다"
저자들이 고장 난 기계를 고쳐서(버그 수정) 다시 제대로 테스트해 보니 결과는 완전히 뒤집혔습니다.
- 정석 코스의 승리: 고장 난 기계를 고쳐서 '교과서 먼저 공부하고 실전 연습(SFT-then-RL)'을 시켰더니, 기존의 모든 '섞어서 배우는 방식'을 압도하는 성적이 나왔습니다.
- 가성비 최고: 심지어 정석 코스는 실전 연습을 아주 조금만 해도(50단계만 해도), 섞어서 배우는 방식보다 훨씬 똑똑하고 효율적이었습니다.
- 기초의 중요성: 특히 수학 지식이 전혀 없는 모델(Llama-3.1)에게는, 기초(SFT)를 제대로 잡아주는 것이 얼마나 중요한지 증명되었습니다.
💡 요약하자면?
**"최근 AI 학계에서 '섞어서 배우는 게 최고'라고 떠들었던 건, 사실 기초 학습 도구에 버그가 있어서 기초 실력이 낮게 측정되었기 때문이었다. 도구를 고쳐서 다시 해보니, 역시 '기초부터 탄탄히 다지고 실전에 나가는 정석 방식'이 가장 빠르고 강력했다!"**는 이야기입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.