← 최신 논문
🤖 machine learning

Procedural-skill SFT across capacity tiers: A W-Shaped pre-SFT Trajectory and Regime-Asymmetric Mechanism on 0.8B-4B Qwen3.5 Models

본 논문은 절차적 기술 SFT 가 0.8B~4B Qwen3.5 모델 전반에 걸쳐 균일한 절대적 향상을 가져오지만, 그 결과 성능 추이는 regimes 비대칭적 기반 능력에 의해 주도되는 W 자형 패턴을 따르며, 여기서 SFT 는 초기에 해당 절차에 어려움을 겪는 모델에 가장 큰 절대적 개선을 제공한다는 것을 보여준다.

원저자: Igor Strozzi

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Igor Strozzi

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 일상적인 언어와 비유를 사용하여 설명한 것입니다.

큰 그림: 다른 요리사들에게 레시피 가르치기

경험 수준이 다른 세 명의 요리사를 상상해 보세요.

  1. 초보자 (0.8B): 열정은 넘치지만 쉽게 압도당하는 주방 도우미.
  2. 견습생 (2B): 기초는 알지만 때로는 게으르거나 단계를 건너뛰는 요리사.
  3. 수석 셰프 (4B): 거의 혼자서 모든 상황을 해결할 수 있는 매우 유능한 요리사.

연구자들은 이 세 명의 요리사에게 200 가지의 서로 다른 요리 과제를 수행할 때 따를 수 있는 구체적인 5 단계 레시피 (즉, "절차적 기술") 를 제공하면 어떤 일이 일어나는지 확인하고자 했습니다. 그들은 알고 싶었습니다: 레시피를 주는 것이 실제로 요리 실력을 향상시키는가, 아니면 그저 레시피를 따르는 척할 뿐인가?

주요 발견: "W"자 모양

연구자들은 레시피를 주기 전, 요리사들의 과제 수행 능력이 가장 작은 모델에서 가장 큰 모델로 갈 때 이상한 "W"자 모양을 보인다는 것을 발견했습니다.

  • 초보자 (0.8B): 훈련 전에 레시피를 제공받았을 때, 실제로는 더 나빠졌습니다. 5 단계는 너무 복잡했습니다. 그들은 1 단계에서 혼란을 겪고 전체 요리를 망쳤습니다. 레시피는 짐이 되었습니다.
  • 견습생 (2B): 레시피를 제공받았을 때, 더 좋아졌습니다. 그들은 "최적의 지점"에 있었습니다. 레시피는 보조 바퀴처럼 작용하여 작업을 확인하고 평소 저지르던 실수를 피하도록 도와주었습니다.
  • 수석 셰프 (4B): 훈련 전에 레시피를 제공받았을 때, 약간 더 나빠졌거나 (또는 그대로 유지되었습니다). 그들은 이미 요리 실력이 너무 뛰어났기 때문에 레시피를 읽는 것은 추가적인 서류 작업처럼 느껴졌습니다. 이는 가치를 더하지 않고 속도를 늦출 뿐이었습니다.

반전: 연구자들이 레시피를 사용하여 요리사들을 훈련 (SFT 라고 불리는 과정) 시킨 후, 마법 같은 일이 발생했습니다. 세 요리사 모두의 향상 정도는 거의 동일했습니다.

  • 초보자는 혼란 없이 단계를 따르는 법을 배웠습니다.
  • 견습생은 조금 더 날카로워졌습니다.
  • 수석 셰프는 레시피를 귀찮은 서류 작업으로 취급하는 것을 멈추고 유용한 도구로 사용하기 시작하는 법을 배웠습니다.

교훈: 훈련 (SFT) 은 요리사가 가장 힘들어하는 곳에서 가장 큰 효과를 발휘합니다. 이는 초보자의 혼란과 수석 셰프의 게으름을 해결하여, 비록 출발점이 매우 달랐더라도 모든 사람에게 유사한 "부스팅" 효과를 가져옵니다.

"형식" 함정 (그들이 수정한 중대한 실수)

이 논문은 그들이 거의 저지른 거대한 실수를 강조합니다.

특정 줄에 답을 작성해야만 수락하는 엄격한 심판관을 상상해 보세요: "ANSWER: [요리 이름]".

  • 초보자수석 셰프는 종종 *"이 요리는 피자라고 결론 내립니다"*와 같은 문장으로 답을 작성했습니다.
  • 엄격한 심판관 (컴퓨터 스크립트) 은 "ANSWER"라는 단어를 찾지 못해 정답을 냈음에도 불구하고 그들을 실패로 판정했습니다.
  • 견습생은 우연히 심판관이 원하는 정확한 형식으로 작성했으므로 승자처럼 보였습니다.

연구자들은 그들의 "심판관"이 편향되어 있음을 깨달았습니다. 이는 요리 실력을 측정하는 것이 아니라 타자 실력을 측정하고 있었습니다.

해결책: 그들은 전체 문장을 읽는 인간 같은 심판관 (AI) 으로 변경했습니다.

  • 결과: 초보자와 수석 셰프의 점수가 급등했습니다!
  • 편향: 엄격한 심판관은 "자유 형식" 문장으로 작성한 요리사들을 불공정하게 처벌했습니다. 연구자들은 "선별된" (레시피를 따르는) 그룹이 엄격한 심판관에게 더 많이 불이익을 받았음을 발견했는데, 이는 그들의 상세한 설명이 종종 최종 답을 텍스트 속에 숨겨버렸기 때문입니다.

"한계"와 "전선"

연구자들은 훈련된 수석 셰프 (4B)세계적인 유명 셰프 ("Haiku-4-5"라고 함) 와 비교했습니다.

  • 훈련 전, 수석 셰프는 좋았지만 유명 셰프의 수준에는 미치지 못했습니다.
  • 레시피로 훈련한 후, 수석 셰프는 유명 셰프와 무승부를 기록했습니다. 두 사람 모두 200 개의 요리 중 197 개를 완벽하게 만들었습니다.
  • 이는 훈련이 수석 셰프가 단순히 "단계를 따르는 것처럼 보이게" 한 것이 아니라, 실제로 이러한 특정 작업에서 세계 최고 수준과同等하게 만들었음을 증명합니다.

작동하지 않은 것 (부정적 결과)

연구자들은 훈련 레시피를 변경 (텍스트 변경, 단계 일부 제거 등) 하여 초보자 (0.8B) 를 더 잘 만들려고 시도했습니다.

  • 결과: 아무것도 작동하지 않았습니다. 초보자는 여전히 요리를 완벽하게 만들 수 없었습니다.
  • 이유: 초보자는 단순히 한 번에 모든 단계를 머릿속에 담을 수 있는 뇌 용량 (능력) 이 부족했습니다. 어떻게 가르치려고 시도하든 "한계"는 교수법이 아니라 초보자 자신의 한계였습니다.

주요 교훈 요약

  1. 훈련은 모두에게 도움이 되지만, 그 이유는 다릅니다: 혼란스러운 사람을 구하고, 유능한 사람을 날카롭게 하며, 지나치게 자신감 있는 사람을 다시 참여시킵니다. "부스팅" 효과는 전반적으로 놀라울 정도로 유사합니다.
  2. 경직된 심판관을 신뢰하지 마세요: "ANSWER: X"와 같은 특정 형식만 확인한다면, 모델이 실제로 문제를 올바르게 해결했다는 사실을 놓칠 수 있습니다.
  3. 크기는 중요하지만, 생각하는 방식과는 다릅니다: 작은 모델은 큰 모델만큼 절차를 사용하는 법을 배울 수 있지만, 작업이 뇌 크기에 비해 너무 어렵다면 전체 작업을 완벽하게 수행할 수는 없습니다.
  4. "W"자 곡선: 작은 모델은 절차에 혼란을 느끼고, 중간 모델은 이를 사랑하며, 큰 모델은 훈련을 통해 그 가치를 보게 될 때까지 이를 귀찮아합니다.

요약하자면: 이 논문은 단계별 프로세스를 가르치는 것이 강력한 도구임을 보여주지만, 이를 공정하게 측정해야 합니다 (경직된 형식 규칙을 무시하고). 또한 모델의 크기가 단계를 따르는 능력만큼은 큰 모델과 동일하게 배울 수 있더라도, 단계를 수행하는 정도를 결정한다는 점을 이해해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →