← 최신 논문
💬 NLP

Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning

본 논문은 강화학습이 새로운 능력을 가르치는 것이 아니라 고엔트로피 의사결정 지점에서 희소하고 예측 가능한 수정을 수행함으로써 LLM 추론을 개선하며, 이는 최소한의 학습 비용으로 완전한 강화학습 성능을 달성하는 매우 효율적인 RL 없는 방법인 ReasonMaxxer의 개발로 이어진다고 주장한다.

원저자: Ömer Faruk Akgül, Rajgopal Kannan, Willie Neiswanger, Viktor Prasanna

게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ömer Faruk Akgül, Rajgopal Kannan, Willie Neiswanger, Viktor Prasanna

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "REASONMAXXER: Embarrassingly Cheap Post-Training" 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 풀어낸 것입니다.

핵심 아이디어: 모델은 이미 정답을 알고 있습니다

수학 시험을 보는 매우 똑똑한 학생 (기저 모델) 이 있다고 상상해 보세요. 이 학생은 대부분의 경우 정답을 알고 있지만, 조금은 결단력이 부족합니다. 까다로운 단계에 도달하면 두세 가지 가능한 경로 사이에서 망설이며 동전 던지기를 하듯 선택을 망설일 수 있습니다.

오랫동안 연구자들은 강화 학습 (RL) 이 학생에게 문제를 해결하는 새로운 방법을 가르치고, 처음부터 완전히 새로운 전략을 고안해 내는 초강력 코치라고 생각했습니다.

하지만 이 논문은 그것이 잘못되었다고 주장합니다.

저자들은 '코치' (RL) 가 학생에게 새로운 비법을 가르치는 것이 아니라, 단지 속삭인다는 사실을 발견했습니다. "이봐, 5 단계에서 망설일 때 너는 잘못된 경로를 선택했어. 그냥 네가 이미 생각하고 있던 두 번째로 좋은 옵션을 선택하면 돼."

학생은 이미 정답을 알고 있었습니다. 단지 그것을 선택하도록 아주 작은 자극이 필요했을 뿐입니다.

발견: 모두 '갈림길'에 관한 것입니다

연구자들은 AI 가 강화 학습을 통해 학습할 때 컴퓨터 내부에서 정확히 어떤 일이 일어나는지 살펴보았습니다. 그리고 세 가지 놀라운 사실을 발견했습니다.

  1. 매우 드뭅니다: RL 코치는 단계의 약 1% 에서 3% 에서만 학생의 마음을 바꿉니다. 시험의 97% 에서는 학생이 어차피 하고 싶었던 대로 정확히 행동합니다.
  2. 항상 '안전한' 변화입니다: 코치는 학생에게 결코 고려해 본 적 없는 미친 듯하고 기이한 답을 선택하라고 말하지 않습니다. 오직 학생이 이미 생각하고 있던 두 번째 또는 세 번째로 좋은 옵션으로 전환하라고만 말합니다.
  3. 오직 '갈림길' 순간에만 발생합니다: 이러한 변화는 학생이 혼란스러울 때 (높은 '엔트로피') 에만 일어납니다. 학생이 확신하면 코치는 침묵합니다. 학생이 불확실하면 코치는 올바른 갈림길을 가리킵니다.

비유:
익숙한 도로에서 차를 운전한다고 상상해 보세요. 당신은 경로를 완벽하게 알고 있습니다.

  • 기저 모델은 당신이 운전하는 것입니다.
  • RL 코치는 GPS 입니다.
  • 오래된 관점: 우리는 GPS 가 당신이 본 적도 없는 차를 운전하는 법을 가르친다고 생각했습니다.
  • 새로운 관점: GPS 는 단지 "당신은 혼란스러운 교차로에 있어요. 왼쪽으로 돌릴 뻔했지만, 오른쪽으로 돌려야 해요." 라고 말합니다. 당신은 이미 오른쪽으로 도는 법을 알고 있었습니다. 단지 상기시켜 줄 필요가 있었을 뿐입니다.

문제: 코치가 너무 비쌉니다

현재 이러한 '코치' (RL) 를 훈련시키는 것은 학생이 시험을 치르는 모습을 지켜보고, 수백만 가지 시나리오를 시뮬레이션하며, 그 작은 자극을 찾아내기 위해 복잡한 수학 계산을 수행하는 거대한 엔지니어 팀을 고용하는 것과 같습니다. 이는 수천 달러의 비용과 몇 주에 걸친 컴퓨터 시간이 소요됩니다.

이 논문은 질문합니다: 코치가 우리가 이미 가지고 있는 지도상의 몇몇 특정 지점만 가리킨다면, 그 비싼 코치 팀 전체가 필요한가요?

해결책: REASONMAXXER (스마트한 자극)

저자들은 REASONMAXXER라는 새롭고 매우 저렴한 방법을 개발했습니다. 거대한 코치 대신, 작고 저렴한 도구를 사용합니다.

작동 원리는 다음과 같습니다.

  1. 혼란 찾기: 시스템은 학생 (기저 모델) 의 생각 자체를 살펴봅니다. "어디서 혼란을 느끼고 있니?" 라고 묻습니다. 엔트로피라는 간단한 수학 트릭을 사용하여 학생이 불확실한 '갈림길' 순간을 찾습니다.
  2. 대조적 자극: 학생이 정답을 맞춘 몇 가지 예시와 틀린 몇 가지 예시를 가져옵니다. 그리고 말합니다: "이런 혼란스러운 순간에, 정답을 맞췄을 때는 이 경로를 선택했어. 틀렸을 때는 저 경로를 선택했지. 첫 번째 것을 선택하는 것을 기억해."
  3. 미세한 변화: 이 규칙을 기억하기 위해 모델의 뇌 (파라미터) 의 극히 일부 (1% 미만) 만 업데이트합니다.

결과: 똑똑함은 그대로, 비용은 극소수

이 논문은 이 새로운 방법을 여섯 가지 다른 수학 벤치마크에서 비싼 표준 RL 코치와 비교하여 테스트했습니다.

  • 성능: REASONMAXXER 는 비싼 RL 모델과 마찬가지로, 혹은 더 잘 수행했습니다.
  • 비용: 이것이 큰 충격입니다.
    • 표준 RL: 훈련 비용이 200 달러에서 100,000 달러 사이입니다.
    • REASONMAXXER: 훈련 비용이 약 4 달러에서 25 달러입니다.
    • 시간: 단일 컴퓨터 카드에서 몇 분이 소요되는 반면, RL 은 며칠에서 몇 주가 걸립니다.

결론

이 논문은 AI 추론을 가르치기 위해 거대하고 비싼 강화 학습을 사용하는 업계의 큰 추세가 과잉일 수 있다고 결론지었습니다.

'추론'은 우리가 해금하는 새로운 초능력이 아닙니다. 단지 AI 가 불확실할 때 올바른 선택을 하도록 돕는 문제일 뿐입니다.

이미 대부분 지어진 집을 짓기 위해 거대한 건설 인력이 필요하지 않습니다. 중요한 순간에 몇 개의 헐거워진 나사를 조일 수 있는 손님이 필요할 뿐입니다. REASONMAXXER 가 바로 그 손님이며, 몇 푼의 비용으로 그 일을 해냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →