← 최신 논문
🤖 machine learning

Capacity-Dependent Effects of Data Selection for Reasoning

이 논문은 추론 미세 조정을 위한 가능도 기반 데이터 선택의 효과가 용량 의존적임을 입증하며, 고확률 데이터는 초기 이득이 빠른 소형 모델에 유리한 반면 저확률 데이터는 대형 모델의 장기적인 성능 향상에 더 우수하다는 것을 보여준다.

원저자: Cuong Dang, Hoang Anh Just, Ruoxi Jia

게시일 2026-08-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Cuong Dang, Hoang Anh Just, Ruoxi Jia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 까다로운 수학 문제를 푸는 법을 가르치려 한다고 상상해 보세요. 당신에게는 문제를 완벽하게 풀 수 있는 아주 똑똑한 선생님이 있고, 또한 이제 막 시작하는 단계인 학생도 있습니다. 인공지능의 세계에서 이것을 "증류(distillation)"라고 부릅니다. 목표는 거대하고 강력한 모델(선생님)로부터 지식을 추출하여, 일상적인 기기에서도 실행할 수 있는 더 작고 빠른 모델(학생)로 축소하는 것입니다. 하지만 여기에는 함정이 있습니다. 선생님은 같은 문제를 해결하기 위해 여러 가지 서로 다른 방식을 만들어낼 수 있습니다. 어떤 답안은 단순하며 학생이 스스로 추측했을 법한 것과 매우 비슷합니다. 또 다른 답안은 복잡하고 기괴하며, 학생의 현재 사고방식과는 매우 다릅니다.

오랫동안 연구자들은 학생에게 이해하기 가장 쉬운 답, 즉 익숙하게 느껴지는 답을 보여주는 것이 최선의 방법이라고 생각했습니다. 그것이 논리적으로 보였기 때문입니다. 만약 당신이 초보자에게 미적분을 가르치기 위해 고급 물리학을 사용한다면, 그들은 혼란스러워하며 포기할 수도 있습니다. 하지만 새로운 연구는 이 "쉬운 것이 최고"라는 규칙이 함정일 수 있다고 제안합니다. 진짜 비결은 수업의 난이도를 만드는 것이 아니라, 학생의 뇌 크기에 맞춰 난이도를 조절하는 것입니다. 학생이 아주 작다면 쉬운 수업이 효과적이겠지만, 학생이 거대하고 강력하다면 그들은 잠재력을 최대한 발휘하기 위해 어렵고 혼란스러운 수업이 실제로 필요합니다. 이 논문은 정확히 어떻게 적절한 로봇에게 적합한 수업을 선택할 것인지, 즉 우리가 시간이나 계산 능력을 낭비하지 않도록 하는 방법을 탐구합니다.

이 연구의 저자인 큐 댕(Cuong Dang), 호앙 안 저스트(Hoang Anh Just), 루오시 지아(Ruoxi Jia)는 "우도 기반 선택(likelihood-based selection)"이라는 대중적인 아이디어를 테스트하기 위해 나섰습니다. 간단히 말해, "우도(likelihood)"는 모델이 특정 문장을 말할 가능성이 얼마나 높은지를 알려주는 점수입니다. 만약 모델이 "나는 분명히 이렇게 말할 것이다"라고 생각한다면, 이는 높은 우도의 답변입니다. 만약 모델이 "나는 절대 이렇게 말하지 않을 것이다"라고 생각한다면, 이는 낮은 우도의 답변입니다. 이 논문은 구체적인 질문을 조사합니다. 우리는 항상 고우도 답변(익숙하게 느껴지는 것들)을 사용하여 AI 학생을 훈련시켜야 할까요, 아니면 때때로 저우도 답변(낯설고 어렵게 느껴지는 것들)으로부터 배우도록 강제해야 할까요?

답을 찾기 위해 팀은 수학 문제를 놀이터로 삼아 일련의 실험을 수행했습니다. 그들은 방대한 수학 문제 풀을 가져왔고, 강력한 "선생님" 모델들이 각 문제에 대해 다양한 솔루션을 생성하도록 했습니다. 그런 다음, 15억 개(1.5B)에서 80억 개(8B) 파라미터에 이르는 다양한 크기의 "학생" 모델들을 두 가지 다른 전략을 사용하여 훈련시켰습니다. 한 그룹의 학생들은 오직 "쉬운" 답변(고우도)만을 보았고, 다른 그룹은 오직 "어려운" 답변(저우도)만을 보았습니다. 그들은 AIME, AMC, MATH와 같은 다양한 수학 벤치마크 점수를 통해 시간이 흐름에 따라 이 학생들이 어떻게 수행하는지 관찰했습니다.

그들이 발견한 것은 전적으로 학생의 뇌 크기에 달려 있는 매혹적인 패턴이었습니다. 가장 작은 모델들의 경우, "쉬운" 전략이 명확한 승자였습니다. 이 작은 학생들은 이미 알고 있는 것과 유사한 답을 받았을 때 빠르고 꾸준하게 학습했습니다. 그들이 어려운 답변을 보도록 강요받았을 때, 그들은 길을 잃었습니다. 그들은 질문을 계속 반복하거나, 단계를 이해하지 못한 채 답만 그대로 베껴 쓰며 개선되지 못했습니다. 마치 산을 오르려고 하는데 첫 발을 내디딜 다리가 없어서, 그냥 미끄러져 내려오는 것과 같았습니다.

하지만 이야기는 훨씬 더 강력한 큰 모델들에서 완전히 바뀌었습니다. 이 큰 학생들도 처음에는 작은 모델들처럼 쉬운 답변으로 더 잘 시작했습니다. 하지만 훈련이 계속되면서 마법 같은 일이 일어났습니다. 어려운 답변으로 훈련된 학생들이 따라잡기 시작했고, 결국 다른 그룹을 추월했습니다. "쉬운" 그룹이 한계점에 도달하여 성장이 멈춘 반과 달리, "어려운" 그룹은 계속해서 올라갔습니다. 그들은 복잡하고 생소한 추론을 흡수하여 이전에는 손댈 수 없었던 문제들을 해결할 수 있게 되었습니다. 연구자들은 이를 "빠른 적응 / 느린 이득(Fast-Fit / Slow-Gain)" 패턴이라고 부릅니다. 작은 모델들은 쉬운 데이터에 "빠르게 적응(fast-fit)"하고 거기서 멈추는 반면, 큰 모델들은 어려운 데이터가 결국 훨씬 강력한 추론 능력을 이끌어내는 "느린 이득(slow-gain)"을 경험합니다.

이 논문은 단 하나의 "최선의" 데이터 선택 방법은 존재하지 않는다고 제안합니다. 그것은 전적으로 컴퓨팅 예산과 모델의 크기에 달려 있습니다. 만약 당신이 작은 모델을 가지고 있거나 시간이 제한되어 있다면, 고우도의 배우기 쉬운 데이터에 집중하십시오. 그것은 효율적이며 빠른 결과를 가져다줍니다. 하지만 당신이 큰 모델을 가지고 있고 오랫동안 훈련시킬 인내심이 있다면, 저우도의 어려운 데이터를 받아들여야 합니다. 그것은 마라톤 선수와 같습니다: 초보자는 자신감을 쌓기 위해 평탄하고 쉬운 경로가 필요하지만, 엘리트 선수는 자신의 최고 기록을 깨기 위해 가파르고 험난한 길을 필요로 합니다.

저자들은 실제 실험과 이론적 프레임워크를 통해 이를 뒷받침합니다. 그들은 작은 모델들이 자신의 현재 지식과 선생님의 복잡한 답변 사이의 간극을 이해할 수 있는 "용량(capacity)"이 단순히 부족하다는 것을 보여주었습니다. 어려운 데이터는 너무 멀리 떨어져 있으며, 작은 모델은 그 간극을 메울 수 없습니다. 하지만 큰 모델은 그 거리를 극복하고 배울 수 있는 충분한 "공간"을 뇌 속에 가지고 있습니다. 이 논문은 추론을 위한 데이터 선택이 단일한 규칙이 되어서는 안 된다고 결론짓습니다. 대신, 그것은 세심한 균형이 되어야 합니다: 수업의 난이도를 학습자의 역량에 맞추십시오. 그러면 최고의 결과를 얻을 수 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →