← 최신 논문
💬 NLP

Scale or Reason? A Compute-Equivalent Analysis of Reasoning Distillation

이 논문은 고정된 연산 예산 하에서, 표준 지시 미세 조정(instruction fine-tuning)이 대부분의 모델 규모와 작업에서 추론 증류(reasoning distillation)를 일반적으로 능가하거나 대등한 성능을 보이며, 후자는 25~50%의 추론 데이터를 비용 효율적인 커리큘럼 믹싱 방식으로 결합했을 때 대규모 모델의 개방형 문제 해결에서만 유리해진다는 점을 입증한다.

원저자: Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Kevin El Haddad, Céline Hudelot, Pierre Colombo

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Kevin El Haddad, Céline Hudelot, Pierre Colombo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 어린 도제(작은 AI 모델)에게 문제를 해결하는 법을 가르치려 한다고 상상해 보세요. 당신에게는 그들을 훈련시키는 데 쓸 수 있는 한정된 돈(연산 예산)이 있습니다. 당신은 두 가지 주요 방법으로 도제를 가르칠 수 있습니다.

  1. "직접 답변" 방식 (IFT): 스승이 질문과 함께 정답을 간결하게 제시합니다. "2 더하기 2는 무엇인가? 답은 4이다."
  2. "풀이 과정 보여주기" 방식 (추론 증류): 스승이 질문을 던진 후, 정답을 말하기 전에 자신의 사고 과정을 담은 길고 상세한 일기를 작성합니다. "자, 어디 보자. 2 더와 2를 더하면... 음, 내가 사과 두 개를 가지고 있고 여기에 두 개를 더한다면... 하나씩 세어보자... 그러면 4가 된다. 그러므로 답은 4이다."

이 논문이 던지는 핵심 질문은 이것입니다: 도제에게 긴 "풀이 과정 보여주기" 방식을 가르치기 위해 그 모든 추가 비용을 지불할 가치가 있을까요, 아니면 그냥 더 크고 똑똑한 도제를 사서 "직접 답변" 방식으로 가르치는 것이 나을까요?

연구진이 발견한 내용을 쉬운 비유로 나누어 설명하면 다음과 같습니다.

1. "긴 길을 돌아가는" 문제

"풀이 과정 보여주기" 방식은 엄청나게 비쌉니다. 논문에 따르면 추론 흔적(reasoning traces)은 직접 답변보다 5배에서 20배 더 깁니다.

  • 비유: 당신이 택시 기사에게 거리당 요금을 지불한다고 상상해 보세요.
    • 직접 답변: 기사가 지름길을 이용해 1마일 만에 당신을 내려줍니다.
    • 추론: 기사가 정답을 말하기 전에 모든 동네를 다 돌며 각 거리의 역사까지 설명하기로 결정합니다. 이 과정은 20마일이 걸립니다.
    • 비용: 만약 당신에게 고정된 기름 예산이 있다면, "추론" 택시를 선택하는 것은 아주 작고 느린 차밖에 살 수 없음을 의미합니다. 반면 "직접 답변" 택시를 선택한다면, 거대하고 강력한 리무진을 살 수 있습니다.

2. 놀라운 승자: 거대한 리무진

연구진이 "기름 예산"(연산량)을 동일하게 유지한 채 두 방식을 비교했을 때, 직접 답변(IFT) 방식이 거의 항상 승리했습니다.

  • 발견: 짧고 직접적인 답변을 사용하는 더 큰 모델을 훈련시키는 것이, 긴 상세한 추론을 사용하는 더 작은 모델을 훈련시키는 것보다 거의 항상 더 효율적이었습니다.
  • 예외: "풀이 과정 보여주기" 방식이 승자가 되는 경우는 딱 두 가지 상황뿐이었습니다:
    1. 과업: 질문이 개방형일 때 (예: 이야기를 쓰거나 정답이 하나가 아닌 복잡한 수학 문제를 풀 때).
    2. 크기: 도제가 이미 상당히 클 때 (최소 70억 개의 "뇌세포" 또는 파라미터 보유).
  • 작은 모델들: 작은 모델들에게 "풀이 과정 보여주기" 방식은 재앙이었습니다. 그들은 자신의 생각 속에 갇혀, 실수로 가득 찬 길고 횡설수설하는 일기를 쓰곤 했습니다. 그들은 정답에 도달하지 못한 채 제자리를 맴돌며 모든 돈을 낭비했습니다.

3. "골디락스(Goldilocks)" 솔루션: 혼합 식단

논문은 비용을 아끼면서도 이점을 유지할 수 있는 영리한 절충안을 발견했습니다.

  • 순차적 훈련: 도제에게 주로 "직접 답변"(75%의 시간)으로 가르치다가, 훈련 마지막 단계에서만 "풀이 과정 보여주기"(25%의 시간)로 전환할 수 있습니다.
    • 결과: 이는 값비싼 추론 방식의 이점을 거의 모두 포착하면서도 비용은 아주 적게 듭니다. 이는 마치 도제에게 표준 식단을 제공하다가 마지막에 기술을 날카롭게 만들기 위해 "추론 보충제"를 추가하는 것과 같습니다.
  • 혼합 훈련: 두 종류의 데이터를 함께 섞되, "추론" 부분의 비중을 낮게(50% 미만) 유지하면, 모델은 길고 비싼 답변을 내놓지 않으면서도 수학과 논리 능력이 더 똑똑해집니다.
    • 결과: 당신은 더 똑똑하면서도 간결하게 말하는 모델을 얻게 됩니다. 이는 누군가에게 깊이 생각하도록 가르치되, 짧고 강렬한 답변을 내놓도록 강제하는 것과 같습니다.

4. 작은 모델들이 추론에 실패하는 이유

연구진은 작은 모델들이 왜 "풀이 과정 보여주기" 방식에 어려움을 겪는지 자세히 살펴보았습니다.

  • 발견: 작은 모델은 정답을 틀렸을 때, 맞았을 때보다 더 설명을 쓰는 경ことも 있습니다. 이는 답을 몰라서 계속해서 문장을 늘려가며 운 좋게 정답을 맞히기를 바라는 학생과 같습니다.
  • 결과: 이로 인해 작은 추론 모델들은 매우 비효efficient해집니다. 그들은 정답이 담긴 긴 이야기를 쓰느라 "기름 예산"을 허비합니다. 모델이 커질수록, 그들은 언제 말을 멈춰야 할지 더 잘 알게 되며, 이로 인해 "풀이 과정 보여주기" 방식은 더 크고 유능한 학생들에게만 유효해집니다.

결론

만약 당신이 AI를 만들고 있고 예산이 한정되어 있다면:

  • "추론"(긴 사고 흔적)이 무조건 더 좋을 것이라고 섣불리 가정하지 마세요.
  • 먼저 직접 답변을 사용하는 더 큰 모델을 훈련시키는 것을 고려하세요.
  • 만약 정말로 추론 능력이 필요하다면, 하이브리드 접근 방식을 사용하세요: 주로 직접 답변으로 훈련하다가, 마지막에 소량의 추론 데이터를 추가하십시오. 이것이 비용을 낭비하지 않으면서 두 방식의 장점을 모두 취하는 방법입니다.

이 논문은 우리가 막연히 "긴 사고" 트렌드를 쫓아서는 안 된다고 주장합니다. 때로는 더 짧은 답변을 내놓는 더 큰 뇌가 더 똑똑하고 효율적인 선택이 될 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →