Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model
이 논문은 트랜스포머를 독립적으로 훈련 가능한 레이어 블록으로 분할하고 이를 하나의 일관된 모델로 재구성할 수 있는 스캐폴딩된 모듈형 사전 훈련 프레임워크인 Mixture of Training (MoT)을 소개하며, 이러한 분해된 실행이 재사용 가능한 스캐폴드를 통해 잠재적인 컴퓨팅 이점을 제공하는 동시에 단일 구조(monolithic) 훈련과 대등한 품질을 달성할 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 레고 브릭으로 거대하고 정교한 성을 쌓으려고 한다고 상상해 보세요. 보통은 하나의 거대한 건설 팀이 성 전체를 동시에 작업하는 유일한 방법이 있습니다. 만약 한 사람이 브릭을 떨어뜨리면 팀 전체가 멈춰야 하고, 팀 규모가 너무 커지면 방이 너무 붐비게 되어 프로젝트를 수정하는 데 엄청난 비용과 시간이 들게 됩니다. 이것이 과학자들이 보통 '거대 언어 모델(LLM)'—이야기를 쓰고, 질문에 답하고, 우리와 대화할 수 있는 초지능형 컴퓨터 두뇌—을 만드는 방식입니다. 이들은 하나의 거대하고 깨지지 않는 블록으로서 훈련됩니다. 하지만 만약 성을 별도의 작은 방들로 나누어 짓고, 각 방에 대해 서로 다른 팀들이 독립적으로 작업하게 한 뒤, 나중에 그것들을 모두 결합할 수 있다면 어떨까요? 이것이 바로 이 논문이 던지는 핵심 질문입니다: 우리는 똑똑한 AI의 훈련을 더 작고 관리 가능한 조각들로 나눈 뒤, 그 마법 같은 능력을 잃지 않고도 나중에 다시 조립할 수 있을까요?
'혼합 훈련(Mixture of Training, 이하 MoT)'이라는 프로젝트를 진행 중인 이 연구진은 이 아이디어를 테스트해 보기로 했습니다. 그들은 단순히 추측만 한 것이 아니라, 13억 개의 파라미터를 가진 AI 모델('젬마 스타일' 모델)을 직접 구축하여 이를 조각내어 훈련시키는 실험을 했습니다. 모델 전체를 한 번에 훈련시키는 대신, 모델을 두 개의 큰 덩어리로 나누었습니다. 이 덩어리들이 나중에 잘 맞물리도록 하기 위해, 그들은 영리한 기술인 '스캐폴드(scaffold, 비계)'를 사용했습니다. 마치 조각들이 만들어지는 동안 위치를 잡아주는 보조 바퀴나 단단한 프레임 같은 것을 상상해 보세요. 그들은 이 프레임(이를 '얼라이너(aligner)'라고 부릅니다)을 고정하여 변하지 않게 했고, 그 후 이 프레임 안에서 AI의 각 덩어리를 훈련시켰습니다. 이렇게 함으로써, 각 덩어리는 비록 따로 훈련되었음에도 불구하고 데이터라는 동일한 '언어'를 말하는 법을 배울 수 있었습니다.
결과는 "성공이다!"와 "상황에 따라 다르다"가 섞여 있었습니다. 연구팀은 독립적으로 훈련된 이 덩어리들을 실제로 가져와서 서로 딱 맞게 끼워 넣었을 때 작동하는 AI를 얻을 수 있다는 것을 발견했습니다. 하지만 이들을 결합하는 순간, AI는 약간 혼란을 느껴 실수를 더 많이 했습니다(표준 방식의 퍼플렉시티(perplexity) 점수가 15.0인 것에 비해 19.3으로 높았습니다). 하지만 흥미로운 점은, 모델 전체가 스스로 대화하도록 잠시 시간을 주는 아주 짧은 '튜닝(tuning)' 세션을 거친 후에는, 이 AI가 전통적인 거대 블록 방식만큼이나 훌고 똑똑해졌다는 것입니다. 실제로 그들은 동일한 양의 컴퓨팅 자원을 사용하면서도 표준 방식과 정확히 같은 품질에 도달하는 방법을 찾아냈습니다.
하지만 주의할 점이 있습니다. 이 논문은 이 방법이 모든 사람에게 즉각적으로 돈을 아껴주는 마법 지팡이는 아니라고 시사합니다. '스캐폴드' 자체를 먼저 구축하는 데 많은 에너지가 들기 때문입니다. 만약 당신이 단 하나의 AI만 만든다면, 스캐폴드 때문에 전체 과정이 기존 방식보다 더 비싸집니다. 하지만 동일한 스캐폴드를 사용하여 여러 개의 서로 다른 AI를 만든다면(예를 들어, 동일한 보조 바퀴를 사용하여 세 개 이상의 성을 짓는 것처럼), 성 하나당 드는 비용은 낮아지며 이 방법은 승자가 됩니다. 연구진은 또한 AI를 너무 작은 조각들로 나누려고 하면 조립하기가 더 어려워지고 품질이 떨어진다는 사실도 발견했습니다. 따라서 이 방법이 아직 거대한 일체형 훈련 방식을 완전히 대체할 수는 없지만, AI 훈련을 더 작고 재사용 가능하며 병렬적인 작업으로 나누는 것이 가능하다는 것을 증명합니다. 이는 AI 실험을 위한 새로운 길을 열어주며, 오류를 수정하고, 작업의 일부를 재시작하며, 미래에 도시 크기의 슈퍼컴퓨터 없이도 더 똑똑한 모델을 훈련할 수 있게 해줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.