← 최신 논문
💻 computer science

On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning

이 논문은 긴 추론 과정 (CoT) 데이터의 소스에 따른 일반화 격차를 분석하여, 낮은 훈련 손실에도 불구하고 분기적 탐색 패턴을 가진 데이터로 학습한 모델이 일반화 성능이 떨어지는 현상을 발견하고, 불필요한 분기 경로를 필터링하는 방식으로 일반화 능력을 획기적으로 개선할 수 있음을 제시합니다.

원저자: Zhaoyi Li, Xiangyu Xi, Zhengyu Chen, Wei Wang, Gangwei Jiang, Ranran Shen, Linqi Song, Ying Wei, Defu Lian

게시일 2026-04-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhaoyi Li, Xiangyu Xi, Zhengyu Chen, Wei Wang, Gangwei Jiang, Ranran Shen, Linqi Song, Ying Wei, Defu Lian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🍎 핵심 비유: "미로 찾기 두 가지 스타일"

이 논문은 두 명의 훌륭한 미로 찾기 전문가 (DeepSeek-R1 과 gpt-oss) 가 같은 미로 (수학 문제) 를 풀고 그 과정을 기록한 것을 비교했습니다. 두 사람 모두 정답을 맞췄지만, 그 과정은 완전히 달랐습니다.

1. DeepSeek-R1 스타일: "미로 속 미로" (분산형 탐색)

  • 행동: 이 전문가는 미로에 들어서는 순간, "어? 저기 갈 수 있을까?", "아니면 저쪽?", "혹시 저기?"라며 **수백 개의 가지치기 (Branching)**를 합니다.
  • 특징: 한 방향으로 쭉 나가는 게 아니라, 여기저기서 막다른 골목 (Dead-end) 을 발견하면 다시 돌아와서 다른 길을 시도합니다.
  • 결과: 정답을 찾기는 했지만, 불필요하게 많은 시간과 에너지를 낭비했습니다. 마치 미로 지도를 그리다가 지워지고 다시 그리는 과정을 반복하는 것과 같습니다.

2. gpt-oss 스타일: "직진하는 탐험가" (수렴형 추론)

  • 행동: 이 전문가는 "이 길이 맞을 것 같다"고 판단하면, 한 방향으로 깊이 파고듭니다.
  • 특징: 불필요한 가지치기를 최소화하고, 논리적으로 밀고 나가는 직선적인 추론을 합니다.
  • 결과: 정답에 도달하는 과정이 훨씬 깔끔하고 효율적입니다.

🤔 놀라운 발견: "낮은 점수 = 좋은 학습?"이라는 착각

연구진은 이 두 전문가의 과정을 학생 AI (Base Model) 에게 가르쳤습니다. 여기서 놀라운 역설이 발생했습니다.

  • DeepSeek-R1 과정 학습: 학생 AI 는 이 과정을 배우는 동안 **학습 점수 (Loss)**가 매우 낮게 나왔습니다. "아, 이걸 배우면 내가 완벽하게 따라 할 수 있겠구나!"라고 생각한 것입니다.
    • 하지만 실제 시험 (일반화 능력): 시험을 치르자 성적이 매우 나빴습니다. 왜냐하면 학생 AI 도 "여기서 갈래?", "저기서 갈래?" 하며 불필요하게 헤매는 습관을 그대로 배웠기 때문입니다.
  • gpt-oss 과정 학습: 학생 AI 는 이 과정을 배우는 동안 학습 점수는 높게 나왔습니다. "이건 따라 하기가 좀 어렵네?"라고 느낀 것입니다.
    • 하지만 실제 시험: 시험 점수는 압도적으로 좋았습니다. 왜냐하면 학생 AI 는 효율적이고 논리적인 사고방식을 배웠기 때문입니다.

💡 핵심 교훈: "학습할 때 점수가 낮게 나온다고 해서 (쉽게 따라 했다고 해서) 실력이 좋은 건 아니다." 오히려 불필요한 헤매기 (Redundant Branching) 를 배워버리면, 실제 문제 해결 능력이 떨어집니다.


🛠️ 해결책: "불필요한 가지치기" 잘라내기

연구진은 이 문제를 해결하기 위해 한 가지 간단한 방법을 제안했습니다.

"DeepSeek-R1 의 학습 데이터 중에서, 너무 자주 갈래를 치는 (불필요하게 헤매는) 과정들을 잘라내어 학습시키자!"

  • 방법: "혹시 (Perhaps)", "다른 방법은? (Another way)" 같은 단어가 너무 많이 나오는 긴 추론 과정은 삭제했습니다.
  • 결과: 이렇게 불필요한 헤매기를 제거한 데이터로 다시 학습시킨 AI 는, 기존보다 수학 문제 해결 능력이 5% 이상 향상되었습니다.

📝 한 줄 요약

"AI 를 가르칠 때, 정답만 맞추는 '불필요한 헤매기' 과정은 버리고, 논리적으로 직진하는 '효율적인 사고' 과정만 골라 가르쳐야 진짜 똑똑한 AI 가 된다."

이 연구는 앞으로 AI 를 개발할 때, 단순히 "정답이 맞는 데이터"를 많이 모으는 것보다, **"어떻게 생각하는지 그 사고의 질 (패턴)"**을 잘 선별하는 것이 훨씬 중요하다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →