Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models
이 논문은 이질적인 도메인 간의 복잡성을 해결하고 추론 모드 전환 시 성능 저하 없이 최첨단 추론 능력을 달성하기 위해 제안된 'Nemotron-Cascade'라는 캐스케이드 강화학습 (Cascade RL) 프레임워크와 이를 통해 DeepSeek-R1-0528 을 능가하는 14B 모델의 성과를 소개합니다.
이 논문은 NVIDIA 가 개발한 **'네모트론 캐스케이드 (Nemotron-Cascade)'**라는 인공지능 모델을 소개합니다. 이 모델은 단순히 지식을 외우는 것을 넘어, 복잡한 문제를 해결하는 **'추론 능력 (Reasoning)'**에서 놀라운 성과를 냈습니다.
이 기술이 어떻게 작동하는지, 왜 중요한지 일상적인 비유로 쉽게 설명해 드리겠습니다.
1. 문제: "모든 것을 한 번에 배우면 혼란스럽다"
기존의 AI 를 가르칠 때는 수학, 코딩, 일반 대화, 법률 등 모든 과목을 섞어서 한 번에 가르치곤 했습니다.
비유: 마치 한 학생에게 수학 문제집, 요리책, 축구 규칙, 그리고 시가집을 모두 섞어서 한 번에 읽히며 시험을 치르게 하는 것과 같습니다.
결과: 학생은 머리가 복잡해지고, 어떤 과목에서는 잘하지만 다른 과목에서는 망가질 수 있습니다. 또한, 수학은 빠르게 풀리는 반면 코딩은 실행해 봐야 알 수 있어 학습 속도가 느려집니다.
2. 해결책: "단계별 사다리 (Cascade) 학습법"
이 논문은 **'캐스케이드 RL(연속된 강화학습)'**이라는 새로운 방식을 제안합니다.
비유: 이 방식은 사다리를 오르는 것과 같습니다.
1 단계 (기초 다지기): 먼저 가장 쉽고 빠른 수학 문제를 풀며 논리적 사고를 훈련합니다. (수학은 정답이 명확하고 빠르게 확인 가능)
2 단계 (응용): 그다음으로 코딩 문제를 풀며, 수학에서 배운 논리를 실제 프로그램에 적용합니다.
3 단계 (전문가): 마지막으로 **소프트웨어 엔지니어링 (실제 프로그램 수정)**이나 고급 추론을 배웁니다.
핵심: 각 단계를 거치면서, 이전 단계에서 배운 실력은 잊어버리지 않고 (망각 방지), 새로운 능력 위에 쌓아 올립니다. 마치 레고 블록을 하나씩 쌓아 성을 짓는 것처럼요.
3. 주요 성과: "작은 몸집, 거대한 두뇌"
이 방법으로 훈련된 모델은 놀라운 능력을 보여줍니다.
14B 모델 (중간 크기): 이 모델은 DeepSeek-R1이라는 거대하고 유명한 AI(671B, 14B 의 40 배 이상 큰 모델) 를 가르친 '선생님'보다도 코딩 능력에서 더 좋은 점수를 받았습니다.
올림픽 금메달급: 이 모델은 **2025 년 국제 정보올림피아드 (IOI)**에서 은메달 수준의 실력을 보여주었습니다. 이는 마치 고등학교 학생이 세계 최고 수준의 수학 경시대회에서 은메달을 땄다는 뜻입니다.
두 가지 모드: 이 모델은 **'생각하는 모드 (Deep Thinking)'**와 **'즉답 모드 (Instruct)'**를 상황에 따라 자유롭게 전환할 수 있습니다. 복잡한 문제는 머리를 깊게 굴려서 풀고, 간단한 질문은 빠르게 답합니다.
4. 왜 이것이 중요한가?
투명함: 많은 AI 회사들이 비법 (레시피) 을 숨기지만, NVIDIA 는 이 모델을 어떻게 훈련시켰는지, 어떤 데이터를 썼는지 모두 공개했습니다. 마치 요리 레시피를 다 공개하는 것과 같아, 누구나 따라 할 수 있습니다.
효율성: 거대한 모델을 만드는 대신, 작은 모델을 잘 훈련시켜 거대 모델 못지않은 성능을 냈습니다. 이는 에너지를 아끼고 더 많은 사람이 AI 기술을 활용할 수 있게 해줍니다.
요약
네모트론 캐스케이드는 AI 에게 "모든 것을 한 번에 배우지 말고, 쉬운 것부터 어려운 것까지 단계별로 차근차근 배워라"라고 가르친 결과물입니다. 그 결과, 작은 AI 가 거대 AI 를 능가하는 고급 추론 능력을 갖게 되었고, 이는 앞으로 AI 가 더 똑똑하고 효율적으로 발전할 수 있는 새로운 길을 열었습니다.
1. 문제 정의 (Problem)
기존의 범용 추론 모델을 강화 학습 (RL) 으로 훈련할 때 발생하는 주요 문제는 **도메인 간 이질성 (Cross-domain Heterogeneity)**입니다.
추론 길이와 검증 지연의 차이: 수학 문제는 기호 기반의 빠른 검증이 가능하지만, 코딩이나 소프트웨어 공학 (SWE) 문제는 실행 기반의 느린 검증이 필요합니다. 또한, 추론 과정 (Thinking) 이 필요한지 여부와 응답 길이가 도메인에 따라 크게 다릅니다.
RL 인프라의 복잡성: 이러한 이질성을 한 번에 처리하기 위해 모든 도메인의 프롬프트를 섞어 훈련하면 (Joint RL), 훈련 커리큘럼 설계, 하이퍼파라미터 선택, 검증 로직 통합이 매우 복잡해지고 훈련 속도가 느려집니다.
통합 모델의 성능 저하: 단일 모델이 '생각 모드 (Thinking)'와 '지시 모드 (Instruct)'를 모두 지원하려 할 때, 종종 전용 추론 모델에 비해 성능이 떨어지거나 (예: Qwen3 초기 버전), 두 모드를 효율적으로 통합하는 것이 어렵습니다.
2. 방법론 (Methodology)
저자들은 **계단식 도메인별 강화 학습 (Cascaded Domain-wise Reinforcement Learning, Cascade RL)**을 제안하여 위 문제를 해결했습니다.
2.1. 훈련 파이프라인
훈련은 크게 두 단계로 나뉩니다.
지도 미세 조정 (SFT):
다단계 SFT: 1 단계 (16K 토큰) 와 2 단계 (32K 토큰) 로 나뉘어 일반 대화, 수학, 코딩, 과학, 도구 사용, 소프트웨어 공학 (SWE) 데이터를 학습합니다.
이중 모드 데이터: 일반 도메인 데이터의 경우, 동일한 프롬프트에 대해 '생각 모드 (Thinking)'와 '비생각 모드 (Non-thinking/Instruct)' 두 가지 응답을 모두 생성하여 병렬로 학습시킵니다. 이는 단일 모델이 두 모드를 모두 구사할 수 있는 기반을 마련합니다.
교사 모델: DeepSeek-R1-0528(671B) 등을 사용하여 고품질의 SFT 데이터를 생성했습니다.
계단식 강화 학습 (Cascade RL):
순차적 도메인 훈련: 모든 도메인을 한 번에 섞어 훈련하는 대신, RLHF → 지시 따르기 RL (IF-RL) → 수학 RL (Math RL) → 코드 RL (Code RL) → 소프트웨어 공학 RL (SWE RL) 순서로 도메인별로 순차적으로 훈련합니다.
카테고리별 최적화: 각 도메인의 특성에 맞는 보상 함수와 훈련 커리큘럼을 적용합니다.
RLHF: 인간 선호도 정렬을 먼저 수행하여 응답의 불필요한 반복을 줄이고 추론 효율성을 높입니다.
IF-RL: 엄격한 지시 따르기 능력을 강화합니다.
Math/Code RL: 검증 가능한 보상 (Rule-based/Execution-based) 을 사용하여 추론 능력을 극대화합니다.
SWE RL: 코드 수정 (Patch) 생성 능력을 강화하며, 실행 없이도 보상 모델을 사용할 수 있는 효율적인 검증 방식을 도입했습니다.
2.2. 주요 기술적 혁신
Catastrophic Forgetting 방지: RL 은 정책 (Policy) 이 스스로 경험을 생성하므로, 새로운 도메인 학습 시 이전 도메인의 지식이 쉽게 잊히지 않습니다. 또한, 도메인별 RL 을 순차적으로 수행함으로써 특정 도메인의 성능이 다른 도메인에 의해 덮어쓰는 것을 방지합니다.
통합 모델의 모드 제어:/think 와 /no_think 태그를 사용자 프롬프트에 명시적으로 추가하여, 대화 중에도 실시간으로 '생각 모드'와 '비생각 모드'를 전환할 수 있게 했습니다.
보상 모델 (Reward Model) 전략: RLHF 단계에서는 72B 규모의 강력한 보상 모델을 사용하여 훈련 안정성을 확보했습니다. SWE RL 에서는 Docker 실행 없이 코드 패치 간의 유사도 (Lexical/Semantic Similarity) 를 기반으로 한 **실행 없는 보상 모델 (Execution-free Reward Model)**을 도입하여 확장성을 높였습니다.
3. 주요 기여 (Key Contributions)
범용 계단식 RL 프레임워크: 수학, 코딩, SWE, 일반 지시 따르기 등 다양한 도메인을 순차적으로 학습시키는 새로운 RL 아키텍처를 제안하고, 이를 통해 소규모 모델 (8B, 14B) 이도 초대규모 모델과 경쟁 가능한 성능을 달성함을 증명했습니다.
단일 통합 모델의 성취: '생각 모드'와 '비생각 모드'를 하나의 모델에서 완벽하게 통합했습니다. 8B 통합 모델은 전용 8B 추론 모델과 유사한 추론 성능을 내면서도 지시 따르기 성능은 더 뛰어났습니다.
오픈 소스 및 투명성: 훈련 데이터, 레시피, 모델 가중치를 모두 공개하여 커뮤니티의 지식 공유를 촉진했습니다.
SWE 및 경쟁적 코딩에서의 SOTA 달성: 14B 모델이 671B 규모의 DeepSeek-R1-0528(교사 모델) 을 능가하는 코딩 성능을 보였으며, 2025 국제 정보올림피아드 (IOI) 에서 은메달급 성능을 기록했습니다.
4. 주요 결과 (Results)
LiveCodeBench (코딩 벤치마크):
Nemotron-Cascade-14B-Thinking: LiveCodeBench v6 에서 **74.6%**의 정확도를 기록하여, 671B 모델인 DeepSeek-R1-0528(73.3%) 보다 높은 성능을 보였습니다.
Nemotron-Cascade-8B: 71.1% 의 성능으로 671B 모델과 거의 대등한 수준을 달성했습니다.
소프트웨어 공학 (SWE-bench Verified):
14B 모델이 **43.1%**의 패스율을 기록하여, 32B 전용 모델인 DeepSWE-32B(42.2%) 보다 높은 성능을 보였습니다.
8B 모델도 37.2% 를 기록하여 동급 모델 중 최상위권을 차지했습니다.
IOI 2025 (국제 정보올림피아드):
14B 모델이 테스트 타임 스케일링 (Test-Time Scaling) 기법을 적용하여 총점 343.37점을 획득, 은메달 (Silver Medal) 기준을 충족했습니다.
특히 Problem 2(Triples) 에서 OpenAI 내부 모델과 DeepSeek-V3.2-Speciale 을 능가하는 성능을 보였습니다.
일반 추론 및 정렬:
MMLU-Pro, GPQA-Diamond 등 지식 추론 벤치마크에서도 SFT 기반 모델 대비 RL 을 통해 상당한 성능 향상을 보였습니다.
ArenaHard 등 인간 선호도 정렬 벤치마크에서도 높은 점수를 기록했습니다.
5. 의의 및 결론 (Significance)
Nemotron-Cascade 연구는 단일 모델이 다양한 추론 도메인과 작동 모드 (Thinking/Instruct) 를 모두 효과적으로 처리할 수 있음을 입증했습니다.
효율성: 거대 모델 (671B+) 없이도 14B 이하의 소규모 모델로 최첨단 (SOTA) 성능을 달성할 수 있음을 보여주어, 추론 모델 개발의 비용과 복잡성을 크게 낮췄습니다.
확장성: 계단식 RL 프레임워크는 새로운 도메인을 추가할 때 기존 성능을 해치지 않으면서 확장 가능한 아키텍처임을 증명했습니다.
실용성: 소프트웨어 공학 (SWE) 과 같은 복잡한 실제 업무에서 실행 가능한 패치를 생성하는 능력은 산업적 적용 가능성을 높였습니다.
결론적으로, 이 논문은 RL 기반의 범용 추론 모델 개발을 위한 새로운 표준 (Standard) 을 제시하며, 오픈 소스 생태계를 통해 기술의 민주화와 발전을 이끌 것으로 기대됩니다.