RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs
본 논문은 검증 가능한 보상을 활용한 강화 학습 (RLVR) 이 잘못된 궤적을 압축하고 추론을 더 적은 단계에 집중시키는 반면, 지도 미세 조정 (SFT) 은 올바른 궤적을 확장하고 추론을 여러 단계에 분산시켜 현재 2 단계 학습 패러다임의 상호 보완적 성공을 설명한다는 것을 궤적 및 단계 수준에서 추론 경로를 분석하는 새로운 프레임워크를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
다음은 논문 "RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLM(추론형 LLM 에 대한 비교 연구: RL 은 수축시키고 SFT 는 확장시킨다)"을 쉬운 언어와 창의적인 비유를 사용하여 설명한 내용입니다.
큰 그림: 로봇에게 사고하는 법을 가르치는 두 가지 방법
복잡한 수학 문제나 코딩 퍼즐을 푸는 데는 서툴지만 대화는 잘하는 로봇이 있다고 상상해 보세요. 이 로봇을 더 똑똑하게 만들기 위해 연구자들은 두 가지 주요 학습 방법을 사용합니다.
- SFT(지도 미세 조정): 이는 모방과 같습니다. 인간 전문가가 문제를 단계별로 해결하는 완벽한 예를 로봇에게 보여주고 "정확히 이렇게 해라"라고 말합니다.
- RL(강화 학습): 이는 점수판이 있는 시행착오와 같습니다. 로봇이 스스로 문제를 해결해 보게 합니다. 정답을 맞추면 '금별'(보상) 을 받고, 틀리면 아무것도 받지 못합니다. 시간이 지남에 따라 실패로 이어지는 경로를 피하는 법을 배우게 됩니다.
이 논문은 질문합니다: 이 두 가지 다른 방법을 사용할 때 로봇의 뇌 안에서 실제로 무슨 일이 일어날까요? 로봇이 무엇에 답하는지뿐만 아니라 어떻게 생각하는지도 바꿀까요?
저자들은 이 두 가지 방법이 로봇의 '사고 과정'에 정반대의 영향을 미친다는 사실을 발견했습니다.
비유 1: "추론의 길" (궤적 수준)
로봇의 사고 과정을 숨겨진 보물 (정답) 을 찾기 위해 거대한 안개 낀 숲을 걷는 등산객이라고 상상해 보세요. 수많은 길이 있습니다: 보물로 이어지는 길도 있고, 많은 길이 막다른 길이나 절벽으로 이어집니다.
SFT(모방자) 는 '좋은 길'을 '확장'합니다:
로봇에게 전문가의 지도 (SFT) 를 보여주면, 로봇은 올바른 길을 걷는 법을 배웁니다. 하지만 여기서 함정이 있습니다. 로봇은 그 올바른 길의 많은 다른 변형들 위에서도 걷기 시작합니다. 보물을 찾는 방식에서 매우 창의적이고 다양해집니다.- 함정: 나쁜 길 걷기를 멈추지는 않습니다. 로봇이 이미 늪 (실수) 으로 헤매고 있었다면, SFT 는 로봇에게 걷는 새로운 방법들을 가르치지만, 여전히 가끔 늪으로 헤매게 할 수 있습니다. SFT 는 올바른 경로의 수를 '확장'하지만, 나쁜 경로들을 반드시 제거하지는 않습니다.
RL(점수판) 은 '나쁜 길'을 '수축'시킵니다:
로봇에게 보상 (RL) 을 주는 게임으로 참여하게 하면, 로봇은 늪 길이 점수 0 으로 이어진다는 것을 빠르게 깨닫습니다. 그래서 그곳으로 걷는 것을 멈춥니다. 모든 잘못된, 혼란스러운, 또는 막다른 길들을 존재하지 않게 '수축'시킵니다.- 함정: 좋은 경로도 '수축'시키는 경향이 있습니다. 정답에 대한 창의적인 변형들을 탐색하는 것을 멈추고, 가장 잘 작동하는 한 가지 경로에만 매달릴 수 있습니다. 매우 집중적이지만 다양성은 떨어집니다.
승리의 조합 (SFT + RL):
이 논문은 현재 가장 좋은 관행이 먼저 SFT 를 수행한 후 RL 을 수행하는 것인 이유를 설명합니다.- 먼저 SFT를 사용하여 로봇에게 보물을 찾는 새로운 방법들을 가르칩니다 (올바른 경로 확장).
- 그런 다음 RL을 사용하여 로봇이 늪으로 헤매는 것을 처벌합니다 (잘못된 경로 수축).
- 결과: 문제를 해결하는 많은 방법을 알고 있지만 실수를 피하는 데 매우 엄격한 로봇을 얻게 됩니다.
비유 2: "사고의 도시" (단계 수준)
이제 로봇의 사고를 단일 경로가 아니라 도시 지도로 살펴보겠습니다. 추론의 각 '단계'(예: '면적을 계산한다' 또는 '공식을 확인한다') 는 이 도시의 건물입니다. 단계들 사이의 연결은 도로입니다.
RL 은 '허브 - 스포크' 도시를 만듭니다:
RL 학습 후 도시의 모습이 변합니다. 로봇은 몇 가지 특정하고 매우 중요한 건물 (허브) 에 크게 의존하기 시작합니다. 로봇은 이 핵심 단계들을 반복적으로 방문합니다.- 효과: 도시는 매우 효율적이 되지만 이 몇몇 지점 주변으로 붐빕니다. 로봇은 자신의 '사고력'을 소수의 중요한 단계에 집중합니다. 마치 다른 모든 다리를 무시하고 강을 건너기 위해 오직 세 개의 특정 다리만 이용하는 통근자와 같습니다.
SFT 는 '분산된' 도시를 만듭니다:
SFT 학습 후 도시는 다르게 보입니다. 로봇은 사고를 분산시킵니다. 많은 다른 건물을 방문하며, RL 도시에서처럼 단일 건물이 압도적으로 많이 방문되지 않습니다.- 효과: 사고가 '동질화'되거나 고르게 분산됩니다. 모든 사람이 다양한 거리를 이용하고 어느 단일 도로도 교통 체증이 없는 도시와 같습니다.
핵심 발견:
- RL은 로봇의 사고를 몇 가지 핵심 단계에 집중적이고 강렬하게 만듭니다 (수축).
- SFT는 로봇의 사고를 많은 단계에 걸쳐 넓고 분산되게 만듭니다 (확장).
도시의 모양 (위상)
연구자들은 기하학을 사용하여 이러한 사고 도시들의 '모양'도 살펴보았습니다.
- 기본 모델 (학습 전): 도시는 고립된 동네 (커뮤니티) 들로 나뉩니다. 한 동네에서 다른 동네로 이동하기 어렵습니다. 로봇은 지역적인 루프에 갇히게 됩니다.
- RL: 동네 사이의 벽을 무너뜨립니다. 모든 것을 연결하는 몇 개의 거대한 '허브'가 지배하는 도시를 만듭니다. 이는 로봇이 올바른 허브를 맞출 경우 정답을 매우 빠르게 찾게 하지만, 그 특정 허브들에 의존하게 만듭니다.
- SFT: 벽도 무너뜨리지만, 허브를 만드는 대신 모든 것이 서로 연결된 웹을 구축합니다. 이는 도시를 매우 견고하게 만들고 어떤 지점에서든 다른 어떤 지점으로 이동하기 쉽게 만듭니다.
논문의 주장 요약
- RL 은 '수축기'입니다: 잘못된 사고 경로를 압도하고 로봇의 추론을 몇 가지 매우 효율적이고 교통량이 많은 단계에 집중시킵니다. 나쁜 옵션들을 제거함으로써 로봇이 첫 시도에 정답을 얻는 것 (Pass@1) 을 매우 잘하게 만듭니다.
- SFT 는 '확장기'입니다: 로봇에게 올바르게 사고하는 새로운 방법들을 가르치고 추론의 부담을 많은 단계에 분산시킵니다. 그러나 로봇이 이전에 사용했을지도 모르는 나쁜 경로들을 자동으로 제거하지는 않습니다.
- 왜 SFT + RL 이 작동하는가: 가장 좋은 결과는 로봇에게 올바르게 사고하는 방법을 가르치기 위해 SFT 를 사용한 후 (좋은 경로 확장), 실수를 멈추도록 강요하기 위해 RL 을 사용하는 것에서 나옵니다 (나쁜 경로 수축).
- 구조가 중요합니다: RL 은 '허브 중심'의 추론 구조를 만드는 반면, SFT 는 '분산된' 구조를 만듭니다. 둘 모두 학습되지 않은 모델의 '분열된' 구조와는 다릅니다.
이 논문은 이러한 기계적 차이를 이해하는 것이 현재 성공적인 '2 단계' 학습 레시피 (SFT 후 RL) 가 똑똑한 추론 AI 를 만드는 데 왜 그토록 효과적인지 설명하는 데 도움이 된다고 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.