Scaling Laws for Classical Machine Learning on Tabular Data: A Benchmark Study
본 연구는 18개의 데이터셋과 6개의 모델 제품군에 걸친 11,536회의 훈련 실행을 대상으로 한 대규모 클래스-분산 벤치마크를 제시하며, 대부분의 정형 데이터 모델에 대해 멱법칙이 근사적으로 공유된 지수를 가진 학습 곡선을 효과적으로 설명하는 반면, 상당한 분산은 무작위 시드가 아닌 구현 세부 사항으로 인해 지속된다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 결정을 내리는 법을 가르치려 한다고 상상해 보세요. 예를 들어 고객이 제품을 구매할지, 혹은 대출금을 상환할지를 예측하는 법 말입니다. 오랫동안 과학자들은 거대한 신경망—챗봇이나 이미지 생성기를 구동하는 거대하고 뇌와 같은 컴퓨터들—에 대한 "스케일링 법칙(scaling laws)"에 집착해 왔습니다. 그들은 하나의 마법 같은 규칙을 발견했습니다. 만약 이 거인들에게 더 많은 데이터, 더 많은 뇌세포, 그리고 더 많은 컴퓨팅 파워를 제공한다면, 이들의 실수는 마치 언덕을 내려가는 미끄럼틀처럼 완벽하게 예측 가능한 방식으로 줄어든다는 것입니다. 이 규칙은 너무나 중요해져서, 기업들은 얼마나 많은 데이터를 사야 할지 계산하기 위해 수백만 달러를 들여 비용을 지불하기도 합니다.
하지만 여기 반전이 있습니다. 현실 세계의 대부분은 거대한 신경망으로 돌아가지 않습니다. 그것은 "표 형식의 데이터(tabular data)"로 돌아갑니다. 스프레드시트를 생각해 보세요. 고객의 연령, 소득, 구매 이력 등이 담긴 행과 열 말입니다. 이것은 보험 가격 책정부터 판매 예측에 이르기까지 비즈니스의 핵심입니다. 이러한 작업들을 위해서는 화려한 거물들보다 의사결정 나무(decision trees)나 선형 모델(linear models) 같은 더 단순하고 오래된 도구들이 종종 더 효과적입니다. 여기서 중요한 질문은, 이 단순한 도구들도 "데이터가 많아지면 실수가 줄어든다"는 동일한 마법의 규칙을 따르는가 하는 점입니다. 만약 그렇다면, 그 규칙은 모두에게 동일한가, 아니면 사용하는 특정 스프레드시트에 따라 달라지는가? 지금까지는 이 규칙이 유효한지 확인하기 위해 대규모로 테스트를 수행한 사람이 없었습니다.
이 논문은 바로 이 질문에 답하기 위해 설계된, 교실 규모의 거대한 실험입니다. 단일 연구팀이 몇 번의 테스트를 수행하는 대신, 저자는 대학원 머신러닝 과정의 학생 127명을 독립적인 과학자로 배치했습니다. 각 학생에게는 특정한 규칙이 주어졌고, 세 가지 서로 다른 실제 데이터셋(예: 신용카드 연체 또는 주택 가격)이 배정되었습니다. 학생들은 아주 적은 양의 데이터에서 시작하여 점진적으로 데이터를 늘려가며, 여섯 가지 유형의 "고전적" 머신러밀닝 모델을 훈련시켜 오류율이 어떻게 변하는지 관찰해야 했습니다. 총 11,000회 이상의 훈련 세션이 실행되었으며, 이를 통해 단순한 수학 공식이 모델의 학습 능력을 얼마나 잘 예측할 수 있는지 확인하기 위한 방대한 결과 라이브러리가 구축되었습니다.
결과는 놀라울 정도로 명확했지만, 몇 가지 중요한 주의 사항이 있었습니다. 첫째, "마법의 공식"(멱법칙, power law)은 대부분의 모델에서 매우 잘 작동했습니다. 저자들은 약 78%의 실험에서 이 공식이 데이터에 매우 잘 부합하여, 데이터가 추가됨에 따라 오류가 얼마나 감소할지를 정확하게 예측할 수 있다는 것을 발견했습니다. 그러나 모든 모델이 똑같은 것은 아니었습니다. "트리 기반(tree-based)" 모델(부스팅 및 랜덤 포레스트 등)이 챔피언이었으며, 지속적으로 다른 모델들보다 우수한 성능을 보이며 가장 낮은 오류율에 도달했습니다. 반면, 라쏘 회귀(Lasso regression)와 같은 일부 모델은 규칙을 전혀 따르지 못했고, 종종 평균값만을 예측하며 데이터 크기를 무시하는 모습을 보였습니다.
또한 이 연구는 흥고로운 질문을 다루었습니다. "모델의 종류와 상관없이, 모델 군(family) 전체에 적용되는 단 하나의 '학습 속도'가 존재하는가?" 이에 대한 답은 "어느 정도 그렇다"입니다. 다섯 가지 모델 군에 대해, 학생들은 하나의 평균적인 "학습 속도"(지수)가 각 데이터셋마다 고유한 속도를 계산하는 것만큼이나 모델의 행동을 잘 예측할 수 있다는 것을 발견했습니다. 이는 마치 특정 브랜드의 모든 자동차가 도로 상황이 변하더라도 대략 비슷한 가속도를 가진다고 말하는 것과 같습니다. 하지만 이것이 완벽한 보편 법칙은 아닙니다. 적합도가 완벽하지는 않으며, 릿지 회귀(Ridge regression)와 같은 일부 모델의 경우 "속도"가 너무 불안정하여 신뢰할 수 없었습니다.
아마도 가장 놀라운 발견은 데이터에 관한 것이 아니라, 작업을 수행한 인간에 관한 것이었을 것입니다. 모든 학생에게 동일한 지침과 동일한 랜덤 시드(디지털 시작점)가 주어져 결과가 동일해야 했음에도 불구하고, 그들의 최종 답변은 여전히 약간씩 차이가 있었습니다. 저자들은 결측치를 처리하거나 텍스트를 인코딩하는 방식에서 발생하는 미세하고 피할 수 없는 차이로 인한 "인간 구현 노이즈(human implementation noise)"를 계산했으며, 이로 인해 결과에 약 14%의 변동이 발생한다는 것을 찾아냈습니다. 이는 단일 연구팀이 특정 스케일링 법칙을 발견했다고 주장할 때, 데이터 자체가 아니라 실험 설정 방식 자체에서 오는 약 14%의 "모호함"이 내재되어 있음을 시사합니다.
결국, 이 논문은 표 형식 데이터의 세계를 위한 실질적인 지도를 제공합니다. 이 논문은 대부분의 비즈니스 문제에서 슈퍼컴퓨터가 필요하지 않으며, 잘 튜닝된 트리 모델이 승리할 가능성이 높다는 점을 확인해 줍니다. 또한 "데이터 쇼핑 리스트"를 제공하여, 몇몇 흔한 문제의 경우 높은 정확도에 도달하기 위해 수백 행의 데이터만 필요할 수도 있고, 어떤 경우에는 수만 행이 필요할 수도 있음을 추정해 줍니다. 하지만 우리에게 겸손할 것을 경고하기도 합니다. 규칙은 절대적인 것이 아니라 근사치이며, 데이터를 준비하는 방식이 데이터 자체만큼이나 불확실성을 초래할 수 있기 때문입니다. 이는 머신러닝의 세계에서 가장 단순한 스프레드시트조차도 자신만의 복잡하고, 약간은 무질서하지만, 궁극적으로는 예측 가능한 리듬을 가지고 있다는 사실을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.