← 최신 논문
🤖 machine learning

Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs

본 논문은 고정된 SFT 참조 정책과 학습 가능한 정책의 로지트를 평균화하여 KL 정규화나 크리틱 없이도 RL 의 추론 능력과 SFT 의 포맷 안정성을 효과적으로 결합함으로써 대규모 언어 모델을 위한 새로운 후속 학습 방법인 그룹 상대적 정책 최적화 (GRPO) 를 개선하는 방법을 제시한다.

원저자: Xingwei Gan, Ying Zhu

게시일 2026-05-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xingwei Gan, Ying Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.

큰 그림: 두 명의 교사, 한 명의 학생

거대 언어 모델 (AI) 을 수학 문제 해결을 위해 훈련한다고 상상해 보세요. 이 AI 를 가르치려 노력하는 두 명의 뚜렷한 "교사"가 있습니다:

  1. 형식 교사 (SFT): 이 교사는 AI 에게 답을 깔끔하게 작성하는 법, 올바른 기호 사용법, 그리고 최종 답을 괄호로 묶는 것과 같은 엄격한 규칙을 따르는 법을 가르치는 데 뛰어납니다. 그러나 이 교사는 실제 수학 논리에서 실수를 하기도 합니다.
  2. 추론 교사 (RL): 이 교사는 복잡한 방정식을 완벽하게 풀 수 있는 수학 천재입니다. 하지만 이 교사는 성실하지 않습니다. 종종 답을 괄호로 묶는 것을 잊거나, 단계를 건너뛰거나, 시험이 요구하는 형식과 맞지 않는 이상한 형식으로 작성합니다.

문제점:
전통적으로 이 두 가지를 결합하려 할 때, "KL 정규화"라는 방법을 사용합니다. 이는 추론 교사를 형식 교사에게 묶는 고무줄과 같습니다. 이 고무줄은 추론 교사가 형식 교사의 스타일에 가깝게 머무르도록 강제합니다.

  • 문제점: 형식 교사가 수학 실수를 하면, 고무줄이 추론 교사도 그 같은 실수로 끌어당깁니다. AI 는 "깔끔함"을 유지하려 애쓰지만 "지능"을 발휘하지 못하게 되어 갇히게 됩니다.

새로운 해결책: 로짓 평균화
이 논문의 저자들은 이 두 교사를 결합하는 새로운 방식을 제안합니다. 고무줄로 그들을 묶는 대신, 혼합된 목소리를 만듭니다.

AI 를 합창단이라고 상상해 보세요. 기존 방식은 가수들이 완벽한 동조 (이는 그들의 범위를 제한함) 를 유지하도록 강요하는 것이지만, 새로운 방법은 그들이 노래하기 전에 목소리를 섞습니다.

  • 형식 교사가 "답을 괄호로 묶어라"라고 말하고, 추론 교사가 "답은 5 이다"라고 말한다면, 혼합된 목소리는 "답을 괄호로 묶어라: 5"라고 말합니다.
  • 형식 교사가 수학 실수를 하여 (답이 6 이라고 말함) 하지만 추론 교수가 그것이 5 라는 것을 알고 있다면, 혼합된 목소리는 형식 교사의 "괄호로 묶어라"라는 지시를 유지하면서 추론 교사의 수학에 크게 의존합니다.

작동 원리 (로짓의 마법)

AI 용어로 모델의 "목소리"는 다음 단어나 숫자를 선택할 확률을 나타내는 **로짓 (logits)**이라는 숫자로 구성됩니다.

  1. 혼합: 연구자들은 형식 교사와 추론 교사의 숫자를 수학적으로 평균냅니다.
  2. 결과: 이는 새로운 임시 "혼합 정책"을 생성합니다.
  3. 훈련: AI 는 이 혼합 정책을 연습하며 학습합니다. 최종 답이 맞으면 보상 (점수) 을 받습니다.
    • 형식 교사가 혼합의 일부이므로, AI 는 깔끔하게 작성하는 법을 잊지 않습니다.
    • 추론 교사가 혼합의 일부이므로, AI 는 형식 교사의 수학 실수를 수정할 자유를 가집니다.

왜 이것이 더 나은가 (전문가들의 곱)

이 논문은 "전문가들의 곱 (Product of Experts)"이라는 개념을 사용합니다. 이를 위원회 결정과 같이 생각하세요:

  • **전문가 A (형식)**가 스타일에 확신이 있고, **전문가 B (추론)**가 수학에 확신이 있다면, 최종 결정은 둘 다 강력합니다.
  • 만약 전문가 A 가 수학에 대해 틀렸다면, 전문가 B 의 확신이 그것을 대체하지만, 전문가 A 의 스타일에 대한 확신은 유지됩니다.

논문에 따르면, 이 "혼합된 목소리" 접근 방식은 기존의 "고무줄" 방법보다 더 잘 작동합니다. AI 는 수학 문제를 올바르게 해결하는 법을 배우면서도 깔끔한 형식을 유지했지만, 기존 방법은 종종 AI 가 형식을 올바르게 작성하는 법을 잊거나 형식 교사의 수학 실수에 갇히게 만들었습니다.

실험

연구자들은 세 가지 다른 "시험" (데이터셋) 에서 이를 테스트했습니다:

  1. MATH: 어려운 수학 문제.
  2. cn-k12: 중국 중학교/고등학교 수학.
  3. MMLU: 일반 상식과 추론.

그들은 세 가지 다른 크기의 AI 모델 (소형, 중형, 대형) 에서 이를 테스트했습니다.

결과:

  • 거의 모든 경우에서, 새로운 "혼합된 목소리" 방법은 전통적인 방법보다 더 높은 점수를 받았습니다.
  • 특히 특정 문제를 해결하는 데 탁월했습니다: 전통적인 방법은 AI 가 더 어려운 수학을 배우면서 답을 작성하는 형식을 "잊게" 만드는 경향이 있었습니다. 새로운 방법은 수학 실력을 향상시키는 동시에 형식 기술을 온전하게 유지했습니다.

논문에서 제시된 구체적인 예시

논문은 기하학 문제의 구체적인 예를 제시합니다:

  • 형식 교사 (SFT): 방정식을 올바르게 설정하지만 수학 실수를 하여 반지름이 6이라고 결론 내립니다. 답을 깔끔하게 괄호로 묶습니다.
  • 추론 교사 (RL): 수학을 올바르게 계산하여 반지름이 5임을 찾지만, 답을 괄호로 묶거나 최종 형식으로 작성하는 것을 잊습니다.
  • 혼합된 목소리: 추론 교사로부터 올바른 수학 (5) 을 가져오고 형식 교사로부터 깔끔한 괄호 묶기 지시를 가져옵니다. 최종 출력은 깔끔하게 괄호로 묶인 5입니다.

요약

이 논문은 엄격한 위계 구조가 아닌 협력적인 팀처럼 작동하는 AI 모델 훈련 방법을 소개합니다. 깔끔하지만 성실하지 않은 교사와 똑똑하지만 성실하지 않은 교사의 "생각" (로짓) 을 수학적으로 평균함으로써, AI 는 똑똑하고 깔끔해지도록 배우며, 한쪽이 다른 쪽을 엄격하게 따르도록 강요하는 함정을 피합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →