← 최신 논문
💻 computer science

Post-Training is About States, Not Tokens: A State Distribution View of SFT, RL, and On-Policy Distillation

본 논문은 LLM 사후 훈련에 대한 상태 분포 관점을 제안하며, 통제된 실험을 통해 훈련 상태의 출처와 국소성이 감독 신호 자체만큼이나 중요함을 입증하는데, 이는 온-정책 방법이 스트레스를 받은 교사 모델을 능가하고 표준 감독 미세 조정보다 더 나은 유지 능력을 보인다는 사실로 뒷받침됩니다.

원저자: Dong Nie

게시일 2026-05-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dong Nie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 경험이 부족한 로봇에게 수학 문제를 풀도록 가르친다고 상상해 보세요. 로봇이 수학을 더 잘 풀도록 하되, 진실을 말하거나 일반 상식 질문에 답하는 능력을 잊지 않게 하고 싶을 것입니다.

오랫동안 연구자들은 수업의 유형(수학 문제 자체) 이 가장 중요한 요소라고 생각했습니다. 하지만 이 논문은 그것이 이야기의 절반에 불과하다고 주장합니다. 진정한 비밀은 로봇이 수업을 받을 때 어디에 서 있는지에 있습니다.

저자는 이를 "상태 분포 (State Distribution)" 관점이라고 부릅니다. 일상적인 비유를 사용한 간단한 설명은 다음과 같습니다:

1. 가르치는 세 가지 방법 ("어디"가 중요합니다)

로봇의 "상태"를 대화의 특정 순간으로 생각하세요. 그것은 질문과 로봇이 지금까지 말한 모든 내용을 포함합니다.

  • 방법 A: "교과서" 접근법 (SFT)

    • 작동 방식: 질문과 완벽한 답변이 담긴 완벽한 교과서를 로봇에게 보여줍니다. 로봇이 그 특정 질문들에 대한 답변을 암기하도록 강요합니다.
    • 문제점: 로봇은 교과서와 정확히 같은 질문이 나왔을 때만 답변하는 법을 배웁니다. 만약 로봇이 대화 중간에 아주 작은 실수를 저지르면, 자신의 실수에서 회복하는 법을 연습해 본 적이 없기 때문에 혼란에 빠집니다.
    • 논문의 발견: 부드럽게 접근하면 로봇은 수학을 잘 배우고 다른 모든 것을 기억합니다. 하지만 너무 강하게 밀어붙이면 (스트레스 SFT), 로봇은 교과서에 너무 집중하여 정상적으로 말하는 법을 잊고, 실제 세계의 복잡함을 처리하지 못해 수학 실력이 오히려 떨어집니다.
  • 방법 B: "시행착오" 접근법 (RL)

    • 작동 방식: 로봇이 자유롭게 대화하도록 합니다. 로봇이 수학 문제를 올바르게 풀면 하이파이브 (보상) 를 주고, 실패하면 주지 않습니다.
    • 문제점: 로봇은 자신이 실제로 작성한 특정 문장에만 피드백을 받습니다.
    • 논문의 발견: 이는 매우 안전합니다. 로봇은 자신이 걷고 있는 정확한 경로에 수업이 적용되기 때문에 자신의 실수를 수정하는 법을 배웁니다. 진실을 말하는 법을 잊지 않으면서 수학 실력이 향상됩니다.
  • 방법 C: "현장 멘토" 접근법 (OPD)

    • 작동 방식: 이는 이 논문의 큰 발견입니다. 로봇이 스스로 문장 (자신의 "상태") 을 생성하게 한 후, "선생님"(약간 고장 나거나 혼란스러운 로봇일 수도 있음) 이 로봇에게 다음 단계가 무엇인지 보여줍니다.
    • 마법: 비록 선생님이 수학이 서툴거나 기억력이 나빠도, 학생 로봇은 여전히 배울 수 있습니다. 왜냐하면 학생은 "지금 내 문장을 기준으로 다음에 무엇을 해야 하나요?"라고 선생님에게 묻기 때문입니다. 학생은 선생님의 전체 인생 이야기를 복사하는 것이 아니라, 학생이 실제로 걷고 있는 경로에 대한 지역적인 조언만 구하는 것입니다.
    • 논문의 발견: 이렇게 훈련된 학생 로봇은 심지어 선생님이 어려움을 겪고 있더라도 선생님보다 더 똑똑해질 수 있습니다. 학생은 자신이 실제로 걷고 있는 경로에 대한 조언만 듣기 때문에 선생님의 나쁜 습관을 피합니다.

2. 큰 놀라움: "드리프트 (Drift)"는 전체 이야기가 아닙니다

일반적으로 과학자들은 로봇이 얼마나 변했는지 측정하기 위해 단일 숫자를 봅니다: "로봇의 새로운 행동이 이전 행동과 얼마나 다른가?" (이를 "드리프트"라고 부릅니다).

  • 옛날 신념: 숫자가 높으면 로봇이 무언가를 잊어버린 것입니다.
  • 논문의 발견: 이 숫자는 오해의 소지가 있습니다.
    • 실험에서 "스트레스 교과서" 로봇과 "멘토" 로봇은 거의 동일한 양의 "드리프트"를 보였습니다 (원본과 비교했을 때 비슷하게 다르게 보였습니다).
    • 하지만: "스트레스 교과서" 로봇은 모든 것을 잊고 수학 실력이 떨어졌습니다. 반면 "멘토" 로봇은 기억력을 유지하면서 수학 실력이 향상되었습니다.
    • 왜? 그들이 얼마나 멀리 이동했느냐가 아니라 어디로 이동했느냐가 중요했습니다. 멘토 로봇은 자신이 통제할 수 있는 안전하고 국소적인 방향으로 이동했습니다. 교과서 로봇은 자신이 항해할 수 없는 위험한 지역으로 밀려났습니다.

3. 주요 교훈

이 논문은 AI 를 훈련시킬 때 단순히 수업(수학 문제나 보상) 만 보지 말아야 한다고 결론 내립니다. 우리는 맥락(AI 가 처한 특정 상태) 을 봐야 합니다.

  • SFT는 현실에서 결코 사용하지 않을 대본을 암시하도록 학생을 강요하는 것과 같습니다.
  • RL은 코치가 선수가 자신의 경기를 하는 모습을 지켜보며 즉석에서 팁을 주는 것과 같습니다.
  • OPD는 학생이 약간 혼란스러운 멘토에게 학생이 현재 걷고 있는 특정 단계에 대한 조언을 구하는 것과 같습니다.

가장 중요한 교훈은 무엇일까요? 훈련을 적용하는 위치는 훈련 자체만큼이나 중요합니다. 학생이 선생님의 전체 여정을 복사하려 하지 않고, 자신이 실제로 걷고 있는 경로에 대한 도움만 요청한다면, 결함이 있는 선생님으로부터 배울 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →