← 최신 논문
🤖 AI

Towards On-Policy SFT: Distribution Discriminant Theory and its Applications in LLM Training

이 논문은 분포 판별 이론 (DDT) 을 기반으로 온-정책 SFT 를 가능하게 하는 새로운 프레임워크를 제안하여, 기존 RL 기반 방법론보다 뛰어난 일반화 성능을 유지하면서도 SFT 의 효율성을 보장함을 보여줍니다.

원저자: Miaosen Zhang, Yishan Liu, Shuxia Lin, Xu Yang, Qi Dai, Chong Luo, Weihao Jiang, Peng Hou, Anxiang Zeng, Xin Geng, Baining Guo

게시일 2026-03-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Miaosen Zhang, Yishan Liu, Shuxia Lin, Xu Yang, Qi Dai, Chong Luo, Weihao Jiang, Peng Hou, Anxiang Zeng, Xin Geng, Baining Guo

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎓 배경: "공부방" vs "현장 실습"의 대결

거대 언어 모델을 훈련시킬 때 주로 두 가지 방법을 씁니다.

  1. **SFT **(지도 학습)

    • 비유: 학생이 정답이 적힌 교과서를 보고 외우는 공부법입니다.
    • 장점: 효율이 매우 좋습니다. 정답만 보고 바로 배우니까요.
    • 단점: 교과서와 다른 새로운 상황 (실제 시험) 이 나오면 당황해서 틀릴 수 있습니다. 또한, 교과서의 정답이 학생의 원래 지식과 맞지 않으면, 학생이 혼란스러워해서 기존에 알던 것도 잊어버릴 수 있습니다 (기억 상실).
  2. **RL **(강화 학습)

    • 비유: 학생이 스스로 문제를 풀어보고, 정답을 맞췄을 때 점수를 얻는 현장 실습입니다.
    • 장점: 스스로 생각하며 배운 덕분에 새로운 상황에서도 잘 대처합니다 (일반화 능력).
    • 단점: 정답을 맞출 때까지 수많은 시행착오를 거쳐야 하므로 시간과 비용이 엄청나게 많이 듭니다. 또한, 점수를 주는 기준이 명확하지 않으면 (예: "이 글이 좋은 글이야?") 훈련이 어렵습니다.

지금까지의 문제점:
RL 이 더 똑똑하지만, 너무 비싸고 어렵습니다. 반면 SFT 는 빠르지만 똑똑하지 못합니다. 연구자들은 "RL 처럼 똑똑하면서, SFT 처럼 빠르고 효율적인 방법은 없을까?"라고 고민했습니다.


💡 해결책: "나에게 맞는 공부법" (On-Policy SFT)

이 논문은 **"모델이 스스로 만든 데이터 **(내 생각)라는 아이디어를 제시합니다.

1. 이론: "내 생각과 맞는지 측정하는 체온계" (Distribution Discriminant Theory)

모델이 학습할 때, 모든 데이터를 똑같이 받아들이면 안 됩니다. 모델의 원래 성격 (분포) 과 너무 동떨어진 데이터는 오히려 독이 됩니다.

  • 비유: 학생이 자신의 사고방식과 잘 맞는 문제는 쉽게 이해하지만, 완전히 다른 사고방식의 문제는 억지로 외우려다 머리가 아프고 기존 지식을 망가뜨립니다.
  • 이론의 역할: 이 논문은 'CLL(중심화된 로그 가능도)이라는 체온계를 개발했습니다. 이 체온계로 "이 데이터는 학생의 원래 사고방식과 잘 맞나요? 아니면 너무 낯선가요?"를 정량적으로 측정합니다.

2. 적용 기술 1: "똑똑한 학습 지도" (IDFT - In-Distribution Finetuning)

기존 SFT 는 교과서의 모든 문제를 똑같이 열심히 풀게 하지만, 이 방법은 모델이 잘 이해하는 문제에는 더 집중하고, 이해하지 못하는 난해한 문제에는 강제로 억지로 외우지 않게 조절합니다.

  • 비유: 선생님이 학생에게 "너는 이 문제는 잘 풀 수 있으니 더 깊이 파고들어. 하지만 이 문제는 너랑 안 맞으니 그냥 넘어가도 돼"라고 학습 강도를 조절해 주는 것입니다.
  • 효과: 억지로 무리하게 배우다가 생기는 '기억 상실 (Catastrophic Forgetting)'을 막아주면서, 중요한 부분만 깊이 있게 학습하게 됩니다.

3. 적용 기술 2: "생각의 방향을 잡아주는 나침반" (Hinted Decoding)

기존의 정답 (교과서) 이 모델의 말투나 사고방식과 달라서 문제가 생길 때, 모델이 정답을 유지하면서도 자신의 말투로 다시 표현하게 해줍니다.

  • 비유: 학생이 정답을 알고 있지만, 표현하는 방식이 교과서와 달라서 점수를 못 받는 경우입니다. 이 기술은 **"정답은 그대로 유지하되, 너가 평소 쓰는 말투로 다시 설명해 봐"**라고 도와줍니다.
  • 효과: 모델이 정답을 유지하면서도, 자신의 원래 스타일 (분포) 을 잃지 않게 되어 학습 효율이 극대화됩니다.

🏆 결과: "RL 의 성능을 SFT 의 비용으로!"

이론과 기술을 실험해 본 결과, 놀라운 성과가 나왔습니다.

  • **기존 RL **(강화 학습)보다 더 좋은 성능을 냈습니다. (수학 문제, 추론 능력 등에서)
  • 비용은 SFT 수준으로 매우 저렴했습니다. (RL 에 필요한 엄청난 계산 자원이 필요 없음)
  • 기존 지식을 잃지 않으면서 새로운 능력을 습득했습니다.

📝 한 줄 요약

"거대 AI 를 훈련시킬 때, 억지로 정답을 주입하는 대신, AI 가 '내 생각과 맞는 데이터'만 골라 학습하게 하고, 그 과정에서 AI 의 원래 성격을 해치지 않도록 도와주는 새로운 공부법을 개발했습니다. 이 방법은 비싼 강화 학습 (RL) 없이도, 빠르고 효율적으로 AI 를 더 똑똑하게 만듭니다.

이 연구는 RL 이 불가능한 분야 (예: 정답이 명확하지 않은 창의적 작업) 에서도 AI 를 발전시킬 수 있는 새로운 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →