방식: 전문가가 쓴 "질문과 정답" 쌍 (예: "파스타 만드는 법" -> "정확한 레시피") 을 대량으로 보여주고, AI 가 그걸 똑같이 베끼도록 가르칩니다.
장점: 기초가 탄탄해지고, 전문가처럼 정확한 답변을 빠르게 할 수 있습니다.
단점: 레시피에 없는 새로운 상황 (예: "파스타가 없으면 어떻게 할까?") 이 나오면 당황하거나, 레시피를 너무 맹신해서 창의성이 떨어질 수 있습니다.
**RL **(강화 학습)
비유: 요리를 배우는 실전 인턴십입니다.
방식: AI 가 직접 요리를 해보고, 셰프나 고객 (평가자) 이 "맛있다 (점수 +1)" 혹은 "너무 짜다 (점수 -1)"라고 피드백을 줍니다. AI 는 점수를 높이기 위해 스스로 시도하고 실패를 반복하며 배웁니다.
장점: 새로운 상황에 유연하게 대처하고, 창의적인 해결책을 찾아낼 수 있습니다.
단점: 처음부터 시작하면 실패가 너무 많아 시간이 오래 걸리고, 때로는 점수만 따기 위해 엉뚱한 짓을 하기도 합니다 (예: "맛있어 보이게만 하려고 가짜 재료를 쓴다").
🤝 2. 핵심 발견: "둘은 따로 놀지 않는다"
과거에는 이 두 방법을 따로 따로 쓰거나, 순서대로만 썼습니다. 하지만 이 논문은 **"이 둘은 사실 같은 가족"**이라고 말합니다.
통일된 관점: SFT 는 사실 RL 의 특별한 경우일 뿐입니다. (정답을 알려주는 것 = 점수를 100 점으로 주는 것)
상호 보완:
SFT 만 쓰면: 기초는 좋지만 새로운 문제를 풀 때 막힐 수 있습니다.
RL 만 쓰면: 처음에 너무 엉망이 될 수 있습니다.
**함께 쓰면 **(하이브리드) 먼저 SFT 로 기초를 닦고 (레시피 익히기), 그다음 RL 로 실전 감각을 기르는 (실전 요리하기) 방식이 가장 강력합니다.
🚀 3. 최근 트렌드: "혼합 훈련"이 대세
2023 년부터 2025 년까지의 연구 동향을 분석한 결과, 다음과 같은 변화가 뚜렷합니다.
혼합 훈련의 급부상: 예전에는 SFT 나 RL 중 하나만 썼다면, 이제는 둘을 섞어서 쓰는 연구가 70% 이상을 차지합니다. 마치 요리사에게 레시피도 주고, 실전 경험도 쌓게 하는 것과 같습니다.
데이터의 변화: 비싼 유료 API 를 쓰거나 사람이 직접 데이터를 만드는 방식에서, 오픈 소스 모델이 만든 데이터를 활용하는 방식으로 바뀌고 있습니다. (지속 가능하고 저렴해짐)
응용 분야 확대: 단순한 질문 답변 (QA) 에서 수학 문제 풀이, 코딩, 그리고 스스로 판단하고 행동하는 **에이전트 **(Agent) 분야까지 AI 의 활용 범위가 넓어졌습니다.
💡 4. 결론: 왜 이 논문이 중요한가?
이 논문은 "SFT 가 좋은가, RL 이 좋은가?"라는 이분법적인 질문을 던지는 대신, **"어떤 상황에 어떤 조합이 가장 효과적인가?"**를 알려줍니다.
새로운 AI 를 만들 때: 먼저 SFT 로 기본기를 다지고, 그다음 RL 로 유연성을 더하는 것이 정석입니다.
미래: 이 두 기술을 잘 섞어서, 더 적은 비용으로 더 똑똑하고 안전한 AI 를 만드는 것이 다음 단계의 핵심입니다.
한 줄 요약:
"AI 를 가르칠 때는 **명품 레시피 **(SFT)로 기초를 다진 뒤, **실전 경험 **(RL)으로 창의성을 키워주는 것이 가장 좋은 방법입니다. 이제 우리는 이 두 가지를 자연스럽게 섞어서 더 똑똑한 AI 를 만들고 있습니다."
1. 문제 정의 (Problem)
대규모 언어 모델 (LLM) 은 사전 학습 (Pre-training) 을 통해 광범위한 능력을 갖추었으나, 특정 작업이나 도메인에서 높은 정확도와 신뢰할 수 있는 추론 능력을 달성하기 위해서는 추가적인 후학습 (Post-training) 단계가 필수적입니다. 현재 LLM 의 후학습은 주로 지도 미세 조정 (SFT) 과 강화 학습 (RL) 두 가지 패러다임으로 나뉩니다.
SFT: 전문가가 작성한 프롬프트 - 응답 쌍을 기반으로 모델이 전문가 행동을 모방하도록 학습시키는 방식입니다.
RL: 인간 또는 자동화된 피드백을 기반으로 한 보상 신호를 최적화하여 모델을 조정하는 방식입니다.
기존 연구들은 이 두 방법을 별개의 것으로 간주하거나 순차적으로 적용 (예: SFT 후 RLHF) 하는 경향이 있었으나, 두 방법 간의 이론적 연결 고리와 상호 보완적 관계를 체계적으로 분석한 연구는 부족했습니다. 본 논문은 이 두 방법론의 관계, 통합 가능성, 그리고 실제 응용 분야에서의 트렌드를 종합적으로 규명하는 것을 목표로 합니다.
2. 방법론 (Methodology)
본 논문은 2023 년부터 2025 년까지의 최신 연구들을 대상으로 한 포괄적인 문헌 고찰 (Survey) 입니다. 주요 분석 프레임워크는 다음과 같습니다.
이론적 통합: SFT 와 RL 의 목적 함수 (Objective Function) 를 수학적으로 비교 분석합니다. SFT 를 RL 의 특수한 경우 (특정 보상 함수를 가진 RL) 로 해석하여, 두 방법론이 본질적으로 동일한 최적화 구조를 공유함을 보여줍니다.
SFT 목적: LSFT=E[−logπθ(y∣x)]
RL 목적: LRL=E[r(x,y)]
통합 관점: SFT 의 지시 함수 (Indicator function) 를 보상 함수의 대리자로 간주하여 두 방법을 하나의 통합된 프레임워크로 설명합니다.
방법론적 분류: 연구들을 알고리즘 중심 (Algorithm-centric) 과 데이터 중심 (Data-centric) 으로 분류하여 각각의 최신 기법 (예: Entropy Regularization, 데이터 선택, Curriculum Learning 등) 을 분석합니다.
하이브리드 접근법 분석: SFT 와 RL 을 단순히 순차적으로 적용하는 것을 넘어, 단일 단계 통합 (Single-stage integration), 적응형 가중치 조정, 프론트픽스 샘플링 등을 통해 두 방법의 장점을 결합하는 최신 기법들을 심층 분석합니다.
응용 분야별 분석: 일반 QA, 수학 추론, 에이전트 작업, 코드 생성 등 4 가지 주요 도메인에서 SFT 와 RL 의 적용 사례와 성과를 비교합니다.
3. 주요 기여 (Key Contributions)
체계적 비교 및 통합 프레임워크 제시: LLM 후학습에서 SFT 와 RL 을 최초로 체계적으로 비교하고, 알고리즘 및 데이터 관점에서 어떻게 확장될 수 있는지 명확히 정리했습니다. 또한 두 방법을 상호 보완적으로 통합하는 통일된 프레임워크를 제시했습니다.
하이브리드 학습 패러다임의 부상 규명: 2023~2025 년간의 연구 동향을 분석하여, 단일 방법론 (SFT 만 또는 RL 만) 에서 SFT 와 RL 을 결합한 하이브리드 학습 파이프라인으로의 급격한 전환을 확인했습니다.
데이터 소스의 변화 추적: API 기반의 라벨링 데이터에서 오픈 가중치 (Open-weight) 모델이 생성한 데이터를 활용한 학습으로의 전환이 가속화되고 있음을 실증했습니다.
실용적 가이드라인 제공: 어떤 작업에 SFT 가 적합한지, 어떤 상황에서 RL 이 필요한지, 그리고 두 방법을 언제 어떻게 결합해야 하는지에 대한 구체적인 통찰과 트레이드오프 분석을 제공합니다.
4. 결과 및 트렌드 (Results & Trends)
연구량 및 도메인 확장: 2023 년부터 2025 년까지 모든 주요 도메인 (QA, 수학, 에이전트, 코드) 에서 연구 논문 수가 급증했습니다. 특히 코드 생성과 수학 추론 분야에서 가장 빠른 성장세를 보였습니다.
하이브리드 학습의 지배적 지위: 2023 년에는 SFT 만을 사용하는 연구가 73% 를 차지했으나, 2024 년과 2025 년으로 갈수록 SFT 와 RL 을 모두 사용하는 하이브리드 접근법이 70% 이상으로 급격히 증가하며 주류가 되었습니다. 이는 두 방법론의 상호 보완적 효과가 입증되었음을 시사합니다.
모델 및 데이터 소스 변화:
모델: 비공개 API 기반 모델 의존도가 감소하고, 오픈 가중치 (Open-weight) 모델을 기반으로 한 연구가 크게 증가했습니다.
데이터: 인간이 직접 라벨링한 데이터나 웹 스크래핑 데이터보다, 더 강력한 오픈 모델이 생성한 데이터를 SFT/RL 학습에 활용하는 경향이 강화되었습니다.
성능 향상: 하이브리드 학습 (예: SFT 로 초기화 후 RL 로 정교화, 또는 단일 단계 통합 학습) 은 단일 방법론만 사용할 때보다 추론 정확도, 일반화 능력, 그리고 에이전트 작업 수행 능력을 크게 향상시키는 것으로 나타났습니다.
5. 의의 및 시사점 (Significance)
이 논문은 LLM 후학습 분야에서 SFT 와 RL 이 대립되는 개념이 아니라 상호 의존적이고 보완적인 관계임을 이론적, 실증적으로 입증했습니다.
이론적 통합: 두 방법론을 하나의 통합된 목적 함수 하에서 이해함으로써, 향후 더 효율적이고 강력한 학습 알고리즘 개발의 기초를 마련했습니다.
실무적 지침: 연구자와 실무자에게 특정 작업 (예: 복잡한 추론이 필요한 수학 문제 vs. 사실 기반 QA) 에 따라 SFT 와 RL 을 어떻게 조합하고, 어떤 데이터 소스를 활용해야 최적의 성능을 낼 수 있는지에 대한 명확한 로드맵을 제시합니다.
미래 방향: 희소하거나 간접적인 보상 신호 하에서의 학습, 계산 효율성 향상 (Sample-efficient methods), 그리고 오픈 모델 기반의 자동화된 학습 파이프라인 구축이 향후 핵심 연구 과제로 도출되었습니다.
결론적으로, 본 논문은 LLM 의 능력을 극대화하기 위해 SFT 의 안정성과 RL 의 탐색/일반화 능력을 조화롭게 결합하는 하이브리드 접근법이 현재 및 미래의 표준 패러다임임을 강력하게 주장합니다.