← 최신 논문
💻 computer science

Where to Begin: Efficient Pretraining via Subnetwork Selection and Distillation

이 논문은 구조적으로 희소한 서브 네트워크 초기화를 식별하기 위한 진화적 탐색을 대규모 모델로부터의 지식 증류와 결합하여, 표준 베이스라인과 대등한 성능을 달성하는 동시에 계산 비용을 크게 절감하는 소형 언어 모델(SLM) 사전 학습을 위한 효율적인 프레임워크를 제시한다.

원저자: Arjun Krishnakumar, Rhea Sanjay Sukthanker, Hannan Javed Mahadik, Gabriela Kadlecová, Vladyslav Moroshan, Timur Carstensen, Frank Hutter, Aaron Klein

게시일 2026-01-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Arjun Krishnakumar, Rhea Sanjay Sukthanker, Hannan Javed Mahadik, Gabriela Kadlecová, Vladyslav Moroshan, Timur Carstensen, Frank Hutter, Aaron Klein

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: 거대한 도서관을 짓는 것은 비용이 많이 듭니다

여러분이 세상의 모든 질문에 답할 수 있는 거대한 지식의 도서관(거대 언어 모델, 즉 LLM)을 짓고 싶다고 상상해 보세요. 전통적으로 이 도서관을 지으려면, 수백만 명의 사람(파라미터)을 고용하고, 그들에게 모두 빈 노트를 준 뒤, 인터넷 전체를 처음부터 읽게 해야 합니다. 이 과정에는 엄청난 양의 시간, 돈, 그리고 전기가 소모됩니다.

"소형 언어 모델(SLM)"은 크기가 작기 때문에 구축 비용이 더 저렴하지만, 일반적인 연구자나 중소기업이 밑바닥부터 직접 만들기에는 여전히 너무 비쌉니다. 그들에게는 지름길이 필요합니다.

해결책: "Whittle" 프레임워크

이 논문의 저자들은 이러한 작은 도서관을 만드는 새로운 방법을 제안합니다. 그들은 이 프레임워크를 Whittle이라고 부릅니다. 새로운 사람들을 고용하고 빈 노트를 들려주는 대신, 그들은 이미 방대하고 높은 지식을 가진 기존의 거대한 도서관(거대 "교사" 모델)을 가져와서, 그 안에서 그 일을 똑같이 잘 해낼 수 있는 완벽하고 작은 팀을 찾아내려고 시도합니다.

그들은 세 가지 주요 기술을 사용하여 이를 수행합니다.

1. "황금 소규모 팀" 찾기 (서브 네트워크 선택)

거대한 도서관이 수천 명의 음악가가 있는 거대한 오케스트라라고 상상해 보세요. 특정 곡을 연주하기 위해 오케스트라 전체가 필요하지는 않습니다. 단지 적절한 섹션만 있으면 됩니다.

  • 기존 방식: 보통 소형 모델을 만들고 싶다면, 단순히 몇 명의 음악가를 무작위로 뽑고 그들이 잘 연주하기를 바랄 뿐입니다.
  • 새로운 방식: 저자들은 스마트한 탐색 도구(진화적 탐색/Evolutionary Search)를 사용하여 거대한 오케스트라를 훑으며, 이미 그 곡을 완벽하게 연주하고 있는 특정 음악가 그룹을 찾아냅니다. 그들은 단순히 무작위로 사람을 뽑는 것이 아니라, 이미 핵심적인 역할을 수행하고 있는 뉴런들의 특정 "서브 네트워크"를 찾아냅니다.
  • 결과: 그들은 이렇게 미리 선택된 "소규모 팀"이 무작위로 뽑힌 동일 규모의 그룹보다 훨씬 더 학습 능력이 뛰어나다는 것을 발견했습니다.

2. "스마트 복제" 방법 (지식 증류)

일단 이 작은 소규모 팀을 확보하면, 그들이 인터넷으로부터 홀로 배우게 두지 않습니다. 대신, 원래의 거대한 도서관(교사)과 함께 있는 교실에 그들을 배치합니다.

  • 작동 원리: 교사는 단순히 "정답은 A입니다"라고 말하지 않습니다. 교사는 "정답은 A이지만, A일 확률이 매우 높고, B일 확률은 약간 있으며, C일 확률은 낮습니다"라고 말합니다. 이는 작은 팀에게 세상에 대한 훨씬 더 풍부한 이해를 제공합니다.
  • 비유: 이것은 마스터 셰프가 견습생을 가르치는 것과 같습니다. 마스터는 최종 요리만을 보여주는 것이 아니라, 미묘한 맛과 기술까지 설명해 줍니다. 견습생은 더 빠르게 배우고 실수를 줄이게 됩니다.

3. "탐색 공간" (다양한 조합 시도)

저자들은 모든 "소규모 팀"이 다 똑같지는 않다는 점을 깨달았습니다. 때로는 레이어 수를 줄여야 하고(건물의 층을 제거하는 것처럼), 때로는 너비를 줄여야 합니다(기둥을 제거하는 것처럼).

  • 그들은 모델을 자르는 네 가지 방법을 테스트했습니다:
    • Coarse (조대): 큰 덩어리로 자르기 (예: 층 전체를 제거함).
    • Fine-grained (미세): 아주 작은 조각으로 자르기 (예: 특정 벽돌을 제거함).
    • Uniform (균일): 모델 전체를 균일하게 작게 만들기.
    • Layer-wise (계층별): 각 부분마다 서로 다른 방식으로 작게 만들기.
  • 발견: 그들은 매우 작은 모델의 경우 "미세하게(fine-grained)" 자르는 것이 가장 효과적이라는 것을 발견했습니다. 하지만 더 큰 소형 모델의 경우에는 오히려 "조대하게(coarse)" 자르는 것이 더 좋았습니다.

결과: 적은 것으로 더 많은 것을 하기

이 논문은 이 방법을 사용함으로써, 밑바닥부터 학습된 모델만큼 성능이 뛰어나면서도 비용은 대폭 절감된 소형 모델을 구축할 수 있다고 주장합니다.

  • 속도: 그들의 최적 모델은 표준 소형 모델과 동일한 지능 수준에 도달하면서도, 특정 학습 크기에 대해 5.16배 적은 계산량(FLOPs)을 필요로 했습니다.
  • 효율성: 이것은 마치 맨션만큼 튼튼한 집을 짓는데, 벽돌과 노동력은 20%만 사용하는 것과 같습니다.
  • 오픈 소스: 빅테크 기업들이 사용하는 비밀스러운 다른 방법들과 달리, 저자들은 누구나 이 방법을 사용할 수 있도록 모든 코드와 도구("Whittle" 라이브러리)를 공개했습니다.

요약

이 논문을 거대하고 비싼 AI 모델을 더 작고 저렴하며 매우 효율적인 모델로 재활용하는 방법에 대한 가이드라고 생각하십시오. 새로운 자동차를 처음부터 만드는 대신, 고급 자동차를 가져와서 불필요한 부품을 신중하게 제거하고, 남은 엔진을 조정하여 원래의 고급 자동차로부터 배운 지식을 활용해 적은 연료로도 완벽하게 달리도록 만드는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →