← 최신 논문
💬 NLP

Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning

이 논문은 일반적인 직관과는 반대로, 사고 사슬(chain-of-thought) 데이터에 대한 지도 미세 조정이 단일 에포크를 위해 데이터셋 크기를 키우기보다는 완전한 암기에 도달할 때까지 더 작은 데이터셋으로 반복 학습함으로써 더 우수한 추론 성능을 달성한다는 것을 입증한다.

원저자: Dawid J. Kopiczko, Sagar Vaze, Tijmen Blankevoort, Yuki M. Asano

게시일 2026-08-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dawid J. Kopiczko, Sagar Vaze, Tijmen Blankevoort, Yuki M. Asano

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 주의력이 산만한 학생에게 복잡한 수학 문제나 심오한 과학 질문 같은 매우 어려운 퍼즐을 푸는 법을 가르치려 한다고 상상해 보십시오. 인공지능의 세계에서 이 학생은 텍스트를 읽으며 학습하는 컴퓨터 프로그램인 '언어 모델'입니다. 모델이 추론을 잘할 수 있도록 만들기 위해, 과학자들은 '지도 미세 조정(Supervised Fine-Tuning, SFT)'이라는 과정을 사용합니다. 이것은 마치 학생에게 거장인 선생님이 작성한 예시 풀이들을 뭉치로 주는 것과 같습니다. 학생은 이 예시들을 읽고, 스스로 유사한 문제를 해결할 수 있을 때까지 단계별로 사고하는 과정을 모방하려고 노력합니다.

오랫동안 머신러닝의 황금률은 "많을수록 좋다"였습니다. 직관은 간단합니다. 학생이 잘 배우기를 원한다면, 방대한 양의 독특한 책들을 주어야 한다는 것입니다. 더 많은 다양한 예시를 볼수록 새로운 상황에 더 잘 일반화할 수 있다는 논리입니다. 이는 10,000권의 서로 다른 이야기를 읽는 것이 항상 100권의 같은 이야기를 반복해서 읽는 것보다 낫다고 믿는 것과 같습니다. 하지만 만약 이 규칙이 틀렸다면 어떨까요? 만약 이러한 특정 유형의 "추론" 학습을 위해서라면, 비밀은 더 큰 도서관이 아니라 더 작은 도서관에 대한 깊은 이해에 있다면 어떨까요? 이것이 COLM 2026 컨퍼런스에서 발표된 한 새로운 논문이 던지는 질문이며, AI가 생각하는 법을 배우는 방식에 대한 우리의 기본 가정을 뒤흔들고 있습니다.

이 연구의 연구자들은 "많을수록 좋다"는 규칙을 테스트하기 위해 일련의 통제된 실험을 수행하기로 했습니다. 그들은 표준 AI 모델을 가져와 '사고의 사슬(Chain-of-Thought)' 데이터, 즉 모델이 답을 내기 전에 문제를 단계별로 생각하는 과정을 배우는 길고 상세한 추론 흔적을 가지고 학습시켰습니다. 그들은 엄격한 예산을 설정했습니다: 고정된 "컴퓨팅 노력"(마치 학생에게 허용된 공부 시간과 같은 개념)입니다. 그런 다음 두 가지 전략을 비교했습니다. 전략 A는 학생에게 엄청난 양의 독특한 예시(51,200개 샘 샘플)를 주되, 전체 뭉치를 단 한 번만 읽게 하는 것이었습니다. 전략 B는 아주 적은 양의 예시(적게는 200개 또는 400개 샘플)를 주되, 그 작은 뭉치를 여러 번, 아주 많이—최대 128번까지—읽게 하는 것이었습니다.

결과는 놀랍고도 직관에 반했습니다. 연구 결과, 작은 뭉치를 반복해서 읽은 학생(전략 B)이 방대한 도서관을 단 한 번 훑어본 학생보다 새로운 어려운 문제를 해결하는 데 훨씬 더 뛰어난 능력을 보였습니다. AIME 수학 경시 대회나 GPQA 과학 퀴즈와 같은 어려운 벤치마크에서, 400개의 샘플을 128 에포크(반복 횟수) 동안 학습한 모델은 51,200개의 샘플을 단 1 에포크 동안 학습한 모델보다 압도적인 차이로 앞섰으며, 정확도를 12~26%포인트나 향기시켰습니다. 이는 마치 몇 가지 핵심 이야기를 완벽하게 암기한 학생이 수천 권의 책을 대충 훑어본 학생보다 새로운 미스터리를 더 잘 풀 수 있는 것과 같습니다.

논문은 또한 이런 현상이 발생하는지, 그리고 그 한계는 무엇인지 탐구했습니다. 연구진은 이 개선이 새로운 사실을 배웠기 때문이 아니라, 추론의 구조를 "암기"했기 때문에 발생했다는 것을 발견했습니다. 모델이 작은 데이터셋을 반복함에 따라, 모델은 훈련 예시의 다음 단어를 거의 완벽한 정확도(100%)로 예측할 수 있는 지점에 도달했습니다. 모델이 훈련 데이터에 대해 이 "완전한 암기" 상태에 도달했을 때, 새로운 테스트에 대한 성능 향상은 멈추고 정체되었습니다. 이는 이 특정 유형의 학습을 위해, 목표는 가능한 한 많은 서로 다른 예시를 보는 것이 아니라, 추론의 패턴이 체득될 때까지 그것을 내면화하는 것이라는 점을 시사합니다.

흥미롭게도, 연구진은 이 "반복"이 모델이 알고 있던 다른 모든 것을 잊게 만드는 현상(이를 '파괴적 망각'이라 부릅니다)을 일으키는지 확인했습니다. 그들은 작은 데이터셋을 반복하는 것이 방대한 데이터셋을 한 번 읽는 것보다 오히려 망각을 덜 일으킨다는 것을 발견했습니다. 추론 구조를 깊이 연습함으로써, 모델은 자신의 논리에 더 확신을 갖게 되었고, 일반적인 지식을 잃지 않으면서 과업을 수행하는 데 도움이 된 것으로 보입니다.

하지만 저자들은 이것이 모든 문제를 해결하는 마법의 탄환이라고 부르는 것에는 주의를 기울입니다. 예를 들어, 예시를 제공하는 교사가 약하거나 예시가 틀렸을 경우, 이 이점은 달라집니다. 또한 그들은 "반복의 이점"이 견고하긴 하지만, 왜 데이터를 암기하는 것이 일반화에 도움이 되는지에 대한 정확한 이유는 여전히 미스터리라는 점을 언급했습니다. 그들은 모델이 완전히 새로운 것을 배우기보다는 이미 가지고 있던 숨겨진 능력을 끌어내고 있는 것일 수도 있다고 제안합니다.

요약하자면, 이 논문은 AI에게 추론을 가르치는 데 있어 우리가 점점 더 큰 데이터셋을 찾는 데 시간을 낭비하고 있을지도 모른다는 점을 시사합니다. 대신, 작지만 고품질인 추론 예시 세트를 가져와서 모델이 그것을 속속들이 알 때까지 공부하게 함으로써 더 나은 결과를 얻을 수 있습니다. 저자들은 새로운 실질적인 규칙을 제안합니다: 모델이 훈련 텍스트를 완벽하게 예측할 수 있을 때까지 작은 데이터셋으로 계속 학습시키고, 그 후에 멈추라는 것입니다. 비록 그들은 왜 이런 현상이 일어나는지에 대해 완전히 설명하지는 못했지만, 때로는 AI의 세계에서 같은 페이지를 100번 읽는 것이 100개의 서로 다른 페이지를 훑어보는 것보다 훨씬 더 강력할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →