← 최신 논문
🤖 machine learning

RASFT: Rollout-Adaptive Supervised Fine-Tuning for Reasoning

이 논문은 문제 해결 가능성과 정책 신뢰도에 따라 전문가 모방과 자기 생성 추론 사이의 균형을 동적으로 조절하는 정책 인식 지도 미세 조정 프레임워크인 RASFT를 제안하며, 기존의 SFT 및 RL 방법들과 비교하여 수학 및 코드 추론 벤치마크에서 우수한 성능을 달성한다.

원저자: Yongliang Miao, Fengyuan Liu, Wei Shi, Yanguang Liu, Fei Sun, Na Zou, Mengnan Du

게시일 2026-06-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yongliang Miao, Fengyuan Liu, Wei Shi, Yanguang Liu, Fei Sun, Na Zou, Mengnan Du

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 천재적이지만 약간 고집스러운 학생에게 복잡한 퍼즐(고급 수학 문제나 컴퓨터 코드 작성과 같은)을 푸는 법을 가르치고 있다고 상상해 보세요.

과거의 방식: "스승을 그대로 복제하라"

전통적으로 우리는 이러한 AI 모델(대규모 언어 모델이라고 불립니다)을 훈련할 때 **지도 미세 조정(Supervised Fine-Tuning, SFT)**이라는 방법을 사용합니다. 이것은 마치 학생에게 스승이 쓴 완벽한 해설지를 건네주며 이렇게 말하는 것과 같습니다. "이 경로를 토씨 하나 틀리지 말고 그대로 외워라. 내가 한 것을 똑같이 따라 해라."

문제는 추론이 단순히 복제하는 것이 아니라는 점입니다. 하나의 퍼즐은 대개 여러 가지 유효한 방식으로 풀릴 수 있습니다. 만약 학생이 스승의 특정 경로만을 경직되게 복제한다면, 다음과 같은 문제가 발생할 수 있습니다:

  1. 자신의 직관을 잊어버림: 스승을 흉내 내는 데 너무 급급한 나머지 자신의 사고력을 사용하는 것을 멈추게 됩니다.
  2. 표면적인 부분에 과적합됨: 논리 그 자체보다는 정답의 '스타일'만을 학습하게 됩니다.
  3. 막혔을 때 실패함: 만약 스승의 경로가 학생의 현재 숙련도에 비해 너무 어렵다면, 학생은 그저 혼란스러워하며 포기해 버립니다.

새로운 방식: RASFT ("스마트 코치")

이 논문은 RASFT(Rollout-Adaptive Supervised Fine-Tuning)라는 새로운 방법을 소개합니다. 경직된 스승 대신, 학생이 연습하는 모습을 지켜보고 얼마나 개입할지 결정하는 스마트 코치를 상상해 보세요.

이 코치가 작동하는 단계별 과정은 다음과 같습니다:

1. "직접 해보기" 단계 (Rollouts)

레슨이 시작되기 전, 코치는 학생에게 문제를 스스로 몇 번 풀어보라고 요청합니다(이를 "rollouts"라고 부릅니다).

  • 학생이 정답을 맞혔을 경우: 코치는 말합니다. "잘했어! 너는 이미 이 문제를 이해하고 있구나. 내가 내 솔루션을 강요할 필요는 없겠어. 네가 낸 정답을 그대로 따르자."
  • 학생이 틀렸을 경우: 코치는 말합니다. "알겠어, 이 문제는 좀 어렵구나. 내가 개입해서 너를 이끌 수 있도록 스승의 솔루션을 보여줘야겠어."

이것이 바로 적응형(Adaptive) 방식입니다. "교사의 지도" 양은 학생이 현재 얼마나 잘하고 있는지에 따라 달라집니다.

2. "안전망" (Inverse Ratio)

코치가 너무 과하게 도움을 주면, 학생이 자신만의 독특한 사고 방식을 완전히 잊어버리고 스승의 방식만을 아는 로봇이 될 위험이 있습니다.

이를 방지하기 위해 RASFT는 안전망을 사용합니다. 안전망은 끊임없이 체크합니다. "학생이 원래의 자연스러운 사고 방식에서 너무 멀어지고 있지는 않은가?"

  • 만약 학생이 스승의 스타일을 맞추기 위해 자신의 스타일을 너무 급격하게 바꾸고 있다면, 안전망이 부드럽게 다시 끌어당깁니다.
  • 이를 통해 학생이 단순히 스승의 데이터를 뇌에 덮어쓰는 것이 아니라, 새로운 기술을 배우면서도 자신의 "추론 개성"을 유지할 수 있도록 보장합니다.

왜 더 효과적인가

논문에서는 이 "스마트 코치"를 수학 및 코딩 테스트를 통해 기존의 "경직된 스승" 및 다른 방법들과 비교 실험했습니다.

  • 결과: RASFT로 훈련된 학생들은 문제를 훨씬 더 잘 풀게 되었습니다. 그들은 단순히 복제하는 것이 아니라, 스승의 지혜와 자신의 성장하는 능력을 결합하는 법을 배웠습니다.
  • 비유: 음악가가 곡을 배우는 상황을 상상해 보세요.
    • 기존 SFT: 학생은 자신이 재즈 연주자임에도 불구하고 악보에 적힌 대로만 연주하도록 강요받습니다. 결국 즉흥 연주 능력을 잃게 됩니다.
    • RASFT: 선생님은 학생의 즉흥 연주를 듣습니다. 학생이 잘 연주하고 있다면, 선생님은 학생의 재즈 스타일을 유지하도록 둡니다. 만약 학생이 틀린 음을 낸다면, 선생님은 특정 실수를 교정하기 위해 악보를 보여줍니다. 결과적으로 학생은 더 뛰어나고 다재다능한 음악가가 됩니다.

한계점 (Catch)

논문은 이 방법이 공짜가 아니라는 점을 인정합니다.

  • 시간이 더 많이 걸립니다: "코치"는 학생이 연습하는 것을 지켜보고(rollouts 생성), 가르치기 전에 정답 여부를 확인해야 합니다. 이는 단순히 정답지를 건네주는 것보다 느린 과정입니다.
  • 명확한 정답지가 필요합니다: 이 방식은 수학(정답이 특정 숫자인 경우)이나 코딩(코드가 실행되거나 안 되거나 둘 중 하나인 경우)에는 매우 효과적입니다. 하지만 "시를 써달라"와 같은 개방형 질문에는 적용하기 어렵습니다. 왜냐-냐 시가 "정답"인지 자동으로 검증할 쉬운 방법이 없기 때문입니다.

요약

RASFT는 AI를 훈련시키는 더 스마트한 방법입니다. AI에게 단순히 전문가를 복제하도록 강요하는 대신, AI의 현재 능력을 확인합니다. AI가 어려움을 겪고 있다면 전문가에게 크게 의존하고, AI가 잘하고 있다면 자신의 추론을 믿도록 둡니다. 이를 통해 지식과 유연성을 모두 갖춘 모델을 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →