← 최신 논문
🤖 machine learning

LegoLM: Structured Weight Sharing for Large Language Models

LegoLM은 스칼라 블록 인코딩, 백분위수 선택적 교체, 경계층 보호와 같은 데이터 프리 적응 기법을 통해 전역 가중치 공유의 분포 불일치 및 이상치 지배 실패를 극복하는 구조화된 가중치 공유 프레임워크로서, 대규모 언어 모델에 대해 거의 손실이 없는 압축을 달성하는 동시에 기존의 PTQ-8비트 방식들을 크게 능가합니다.

원저자: Joseph Bingham

게시일 2026-08-11
📖 5 분 읽기🧠 심층 분석

원저자: Joseph Bingham

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 지식의 도서관을 아주 작은 배낭 속에 집어넣으려 한다고 상상해 보세요. 이것이 바로 이야기를 쓰고, 수학 문제를 풀고, 우리와 대화를 나누는 똑똑한 컴퓨터 뇌인 '대규모 언어 모델(LLM)'이 매일 겪는 고충입니다. 이 뇌들은 '가중치(weights)'라고 불리는 수십억 개의 작은 숫자들로 구축되어 있으며, 이 숫자들은 인간의 뇌 속 시냅스처럼 아이디어들을 서로 연결하는 역할을 합니다. 이 모델들을 일반 노트북이나 휴대폰에서 실행할 수 있도록 만들기 위해, 과학자들은 지능을 잃지 않으면서도 모델의 크기를 줄여야 합니다. 모델을 축소하는 한 가지 인기 있는 방법은 '가중치 공유(weight sharing)'입니다. 이것은 마치 친구들이 각자 고유한 옷을 사는 대신, 카탈로그에 있는 똑같은 셔츠를 모두가 입기로 약속하는 것과 같습니다. 뇌의 모든 연결에 대해 고유한 숫자를 저장하는 대신, '표준 셔츠(centroids)'라고 불리는 작은 목록을 저장하고 "이 연결은 5번 셔츠를 입는다"라고 적어두는 식입니다. 이는 공간을 절약하는 영리한 방법이지만, 지금까지 이 방법을 거대한 AI 뇌에 적용했을 때는 재앙에 가까운 결과가 나타났습니다.

문제는 AI의 뇌가 매우 복잡하다는 점입니다. 모든 부분이 똑같이 보이는 단순한 이미지 필터와 달리, AI 뇌의 각 층(layer)은 가중치의 크기가 매우 다릅니다. 이 모든 가중치에게 똑같은 '표준 셔츠'를 입히려고 강요하는 것은, 거대한 코끼리와 작은 생쥐를 똑같은 신발 한 켤레에 억지로 구겨 넣으려는 것과 같습니다. 코끼리는 찌그러지고 생쥐는 둥둥 떠다니게 될 것입니다. 이 논문은 이 고장 난 아이디어를 해결하는 LegoLM이라는 새로운 방법을 소개합니다. LegoLM은 '원 사이즈(one-size-fits-all)' 방식을 강요하는 대신, 똑똑한 재단사처럼 행동합니다. 대부분의 경우 표준 셔츠가 잘 작동하지만, 가끔은 표준 셔츠를 입혔을 때 전체 의상을 망쳐버릴 정도로 너무 크거나 이상한 숫자들인 '아웃라이어(outlier, 이상치)' 가중치가 존재한다는 것을 깨닫는 것입니다. LegoLM의 비결은 이 몇몇 특이한 가중치들을 그대로의 상태로 내버려 두어 손대지 않으면서, 나머지 부분만 압축하는 것입니다. 그 결과, 모델을 원래 크기의 아주 작은 비율로 압축하면서도 거의 모든 지능을 유지하며, 이를 수정하기 위해 값비싼 데이터가 필요한 다른 방법들보다 더 뛰어난 성능을 보여줍니다.

가중치 공유가 실패하는 두 가지 방식

이 논문의 저자인 조셉 빙햄(Joseph Bingham)은 전역적 가중치 공유(global weight sharing)가 두 가지 매우 구체적이고 뚜렷한 이유로 실패한다는 것을 발견했습니다. 저자들은 이를 '실패 모드(failure modes)'라고 부르며, 이를 이해하는 것이 왜 LegoLM이 작동하는지를 파악하는 핵심입니다.

실패 모드 1: 규모 불일치 (The "Wrong Shoe Size" Problem)
AI의 서로 다른 층에서 가져온 가중치 집합을 상상해 보세요. 어떤 층은 '시끄럽고'(숫자가 큼), 어떤 층은 '조용합니다'(숫자가 작음). 만약 이들을 모두 한데 모아 하나의 평균적인 '셔츠'를 찾으려 한다면, 수학적인 문제가 발생합니다. 논문은 서로 다른 크기를 가진 가중치 블록을 압축하려고 하면 오차가 블록의 크기에 따라 선형적으로 증가한다고 증명합니다. 이것은 마라톤 선수의 보폭과 유아의 발걸음을 평균 내어 하나의 신발을 만드는 것과 같습니다. 카탈로그에 아무리 다양한 신발을 추가하더라도, 강제로 같은 크기로 맞추려 한다면 두 종류의 발에 완벽하게 맞는 신발을 만들 수 없습니다. 논문은 이러한 불일치가 너무 심각한 혼란을 일으켜, 모델의 텍text 예측 능력(perplexity로 측정됨)이 수백만 단위로 폭발하며 AI가 횡설수설하게 만든다고 보여줍니다.

실패 모드 2: 아웃라이어의 지배 (The "Giant" Problem)
이것은 훨씬 더 극적인 실패입니다. 설령 블록 단위가 아닌 단일 숫자(스칼라 블록)를 사용하더라도, AI에는 다른 것들에 비해 압도적으로 큰 몇 개의 가중치가 존재합니다. 이것들이 바로 '아웃라이어(outliers)'입니다. 만약 코드북에 8개의 표준 셔츠가 있다면, 카탈로그에서 가장 큰 셔츠는 XL 사이즈일 것입니다. 그런데 만약 어떤 가중치가 10XL 사이즈라면 어떻게 될까요? 만약 그 10XL 가중치에게 XL 셔츠를 입히도록 강제한다면, 그 왜곡은 재앙적일 것입니다. 논문은 모델이 커질수록(1억 2,400만 파라미터에서 72억 파라미터로) 이러한 아웃라이어들이 더욱 위험해진다는 것을 보여줍니다. 작은 모델에서는 이러한 아웃라이어를 교체하는 것이 AI를 약간 혼란스럽게 할 뿐이지만, Mistral-7B와 같은 거대 모델에서는 이 몇몇 거대한 가중치를 교체하는 순간 모델이 완전히 붕괴됩니다. 품질 저하가 무려 **1,134,279%**에 달합니다. 이는 마치 거대한 대성당에서 단 하나의 키스톤(keystone)을 제거하여 전체 구조물을 먼지로 만들어 버리는 것과 같습니다.

LegoLM의 솔루션: 스마트 테일러링(Smart Tailoring)

LegoLM은 세 가지 간단하고 데이터가 필요 없는 기술로 이 문제들을 해결합니다. 이 방법은 학습 데이터를 보거나 모델을 다시 학습시킬 필요 없이, 오직 가중치를 재배열할 뿐입니다.

  1. 스칼라 인코딩 (Scalar Encoding): 가중치를 블록으로 그룹화하는 대신(이는 규모 불일치를 유발함), LegoLM은 모든 가중치를 개별적으로 취급합니다. 이를 통해 각 가중치가 주변의 다른 가중치에 의해 끌려가지 않고 자신에게 가장 가까운 표준 셔츠를 자유롭게 선택할 수 있게 함으로써 "잘못된 신발 사이즈" 문제를 제거합니다.
  2. 백분위수 선택적 교체 (Percentile-Selective Replacement): 이것이 마법 같은 기술입니다. 알고리즘은 모든 가중치를 살펴보고 표준 셔츠로부터 가장 멀리 떨어져 있는 것들, 즉 '아웃라이어'를 찾아냅니다. 이들은 '아웃라이어'입니다. 이들을 표준 셔츠에 입히는 대신, LegoLM은 "당신은 너무 특별하니, 있는 그대로의 모습으로 남으세요"라고 말합니다. 이 특이한 가중치 중 상위 1%를 원래의 고정밀 형태로 보존합니다. 나머지 99%는 작은 코드북으로 압축됩니다.
  3. 경계 층 보호 (Boundary-Layer Protection): AI의 맨 첫 번째 층과 마지막 층은 특히 민감합니다. LegoLM은 이 층들에 조금 더 세심한 주의를 기울입니다. 다만, 논문에서는 가장 큰 모델들의 경우 아웃라이어 보호가 더 중요하며, 이 단계는 상대적으로 덜 결정적이라고 언급합니다.

결과: 작은 크기, 거대한 뇌

저자는 LegoLM을 GPT-2 Small(1억 2,400만 파라미터)과 Mistral-7B(72억 파라미터)라는 두 모델에 대해 테스트했습니다. 결과는 놀랍고 인상적이었습니다.

  • Mistral-7B의 경우: 128개의 표준 값을 가진 코드북을 사용하고 단 **1%**의 아웃라이어 가중치를 보존했을 때, LegoLM은 모델을 4.41배 압축했습니다. 결과는 어땠을까요? 모델의 품질 저하는 단 **0.03%**에 불과했습니다. 이는 사실상 "무손실(lossless)" 압축입니다. 심지어 모델을 4배 압축하면서 오차가 약간 더 발생했던 인기 있는 방식인 PTQ-8bit보다 더 나은 성능을 보여주었습니다.
  • 아웃라이어 구조 (The Outlier Rescue): 가장 극적인 발견은 아웃라이어에 관한 것이었습니다. 모든 가중치(거대한 가중치 포함)를 표준 값으로 교체하여 Mistral-7B를 압축하려고 했을 때, 모델의 품질은 1,134,279% 폭락했습니다. 하지만 이 작은 1%의 아웃라이어들을 구함으로써, 그들은 모델을 구조해냈고, 무려 9.74배라는 엄청난 압축률에서도 오차를 감당 가능한 수준인 **14.24%**로 낮추었습니다.
  • 규모의 중요성: 논문은 "아웃라이어 문제"가 모델이 커질수록 더 악화된다는 것을 발견했습니다. 작은 GPT-2에서는 아웃라이어를 교체했을 때 **23%**의 하락이 있었지만, 거대한 Mistral-7B에서는 **1,134,279%**의 하락이 있었습니다. 이는 큰 모델일수록 기능을 수행하기 위해 이 몇몇 특이한 숫자들에 더 크게 의존한다는 것을 시사합니다.

이것이 왜 중요한가

LegoLM이 특별한 이유는 **데이터가 필요 없다(data-free)**는 점 때문입니다. 다른 대부분의 압축 방식은 모델을 어떻게 줄일지 알아내기 위해 수천 개의 예시 문장을 모델에 입력해야 합니다. 하지만 LegoLM은 단지 가중치 자체를 보고 수학적 계산을 수행합니다. 이 방식은 단일 그래픽 카드에서 70억 파라미터 모델을 30분 이내에 압축할 수 있습니다.

논문은 가중치 공유를 성공시키는 열쇠는 단순히 더 좋은 셔츠 카탈로그를 갖는 것이 아니라, 언제 카탈로그를 사용하지 않을지를 아는 것이라고 결론짓습니다. 모델을 지탱하는 몇몇 "거대한" 가중치들을 식별하고 보호함으로써, LegoLM은 우리가 이 거대한 AI 뇌를 지능을 잃지 않은 채 배낭 속에 담을 수 있게 해줍니다. 이는 이전에 대규모 모델에는 부적합하다고 여겨졌던 방식을 경쟁력 있고 효율적인 미래의 AI 도구로 탈바꿈시켰습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →