F-WANDA: Fisher-Reweighted Post-Training Pruning for Sustainable Deployment of Large Language Models
F-WANDA는 경험적 피셔 정보량(empirical Fisher information)을 기반으로 뉴런 유지 예산을 재할당함으로써 WANDA를 개선하고, SPARSEGPT보다 현저히 낮은 계산 비용으로 언어 모델 성능을 높이는 에너지 효율적인 원샷 사후 학습 프루닝(one-shot post-training pruning) 방법입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 글을 쓰고, 수학 문제를 풀고, 인간처럼 대화할 수 있는 거대하고 믿기지 않을 정도로 똑똑한 로봇이 있다고 상상해 보세요. 이 로봇은 '거대 언어 모델(LLM)'입니다. 하지만 여기 함정이 있습니다. 이 로봇은 너무 거대합니다. 이 로봇을 실행하려면 도시 하나를 하나의 배터리로 가동하려는 것처럼 엄청난 컴퓨터와 많은 전력이 필요합니다. 과학자들은 로봇의 지능을 잃지 않으면서도 더 작은 기기에서 실행할 수 있도록 이 로봇을 축소하는 방법을 끊임없이 연구하고 있습니다.
로봇을 축소하는 한 가지 인기 있는 방법은 '가지치기(pruning)'라고 불립니다. 로봇의 뇌를 뉴런 사이의 연결로 이루어진 거대한 도서관이라고 생각해 보세요. 가지치기는 이 도서관을 훑으며 덜 중요한 책들을 버리는 것과 같습니다. 목표는 도서관을 배낭에 들어갈 정도로 작게 만들면서도, 질문에 답할 수 있을 만큼 여전히 똑똑하게 유지하는 것입니다. 하지만 까다로운 균형이 존재합니다. 실수로 '중요한' 책을 너무 많이 버리면 로봇은 실수를 하거나 로봇처럼 딱딱하게 변하기 시작합니다. 반대로 어떤 책을 남길지 너무 신중하게 결정하려고 하면, 책을 분류하는 과정이 영원히 끝나지 않고 모든 에너지를 다 써버리게 됩니다. 이 논문은 바로 이 문제, 즉 어떻게 하면 로봇의 천재성을 잃지 않으면서 빠르고 저렴하게 책을 분류할 것인가를 다룹니다.
문제점: "일률적인 방식"의 실수
연구진은 먼저 WANDA라고 불리는 인기 있는 방법을 살펴보았습니다. WANDA가 어떤 도서관 사서라고 상상해 보세요. WANDA는 어떤 책을 버릴지 결정하기 위해 두 가지를 확인합니다. 책이 얼마나 '시끄러운지'(가중치)와 사람들이 얼마나 자주 읽는지(입력 활성화)입니다. 만약 어떤 책이 조용하고 거의 읽히지 않는다면, WANDA는 그 책을 던져버립니다.
문제는 WANDA가 일률적인 접근 방식을 적용한다는 점입니다. Wンダ는 도서관의 모든 선반을 똑같이 취급합니다. Wanda는 "좋아, 모든 선반에서 책의 50%를 버리겠어"라고 결정합니다. 하지만 문제는 여기에 있습니다. 어떤 선반은 로봇의 가장 중요한 사실들(예: "파리는 프랑스의 수도이다")로 가득 차 있는 반면, 다른 선반은 지루하고 반복적인 내용들로 가득 차 있습니다. WANDA는 단지 선반이라는 이유만으로 "파리" 선반의 책을 50% 버림으로써 로봇의 지식을 실수로 삭제하게 됩니다.
SPARSEGPT라는 또 다른 방법은 매우 신중하게 행동하려고 노력합니다. 이 방법은 모든 책을 하나하나 살펴보고, 특정 책이 제거되었을 때 로봇의 뇌가 얼마나 아플지 정확히 계산한 다음, 남은 책들을 정교하게 수정하여 손상을 복구합니다. 이 방식은 로봇의 지능을 유지하는 데는 훌륭하지만, 도서관을 정리하기 위해 박사급 인력 팀을 고용하는 것과 같습니다. 이는 엄청난 시간과 에너지를 소모하며, 종종 그럴 만한 가치가 없을 정도입니다.
해결책: F-WANDA (스마트한 사서)
이 논문의 저자는 기존 방식의 영리한 업그레이드 버전인 F-WANDA를 소개했습니다. 저자는 단순히 책이 얼마나 시끄러운지만 볼 것이 아니라, 다음과 같이 물어야 한다는 점을 깨달았습니다. "이 특정 선반에 대해 로봇의 뇌가 얼마나 신경을 쓰고 있는가?"
이를 알아내기 위해, F-WANDA는 한 번의 빠른 추가 점검을 수행합니다. 로봇의 뇌를 작은 테스트(역전파, backward pass)에 통과시켜 어떤 선반이 실제로 로봇의 답변을 이끌어내는지 확인합니다. 만약 어떤 선반이 정답을 얻는 데 결정적이라면, 로봇의 뇌는 강한 신호(피셔 정보량, Fisher information)를 보여줄 것입니다. 만약 선반이 단순한 노이즈라면 신호는 약할 것입니다.
여기 마법 같은 트릭이 있습니다. F-WANDA는 이 신호를 사용하여 규칙을 변경합니다.
- "파리" 선반 (높은 신호): 로봇이 이 선반에 많이 신경을 씁니다. F-WANDA는 말합니다. "이 책들을 50%나 버리지 마세요! 20%만 버리세요. 우리는 대부분을 유지해야 합니다."
- "지루한" 선반 (낮은 신호): 로봇이 신경 쓰지 않습니다. F-WANDA는 말합니다. "가서 이 책들의 80%를 버리세요. 우리는 이것들이 필요 없습니다."
이런 방식으로, 로봇은 가장 중요한 사실들을 안전하게 지키면서도 훨씬 작아질 수 있습니다. 그리고 가장 좋은 점은? F-WANDA는 로봇을 다시 훈련시키거나 가중치를 업데이트할 필요가 없습니다. 단 한 번의 빠른 점검만 수행한 뒤 바로 가지치기를 시작합니다.
연구 결과
연구팀은 이를 유명한 거대 언어 모델 제품군인 LLAMA-2(특히 70억 및 130억 파라미터 버전)에 대해 테스트했습니다. 그들은 F-WANDA가 경쟁 상대를 이길 수 있는지 확인하고자 했습니다.
- 지능: 모델을 50% 비구조적 희소성(unstructured sparsity, 즉 연결의 절반이 제거됨) 수준으로 줄였을 때, F-WDA는 기존 WANDA보다 로봇을 훨씬 더 똑똑하게 유지했습니다. 일반 지식을 측정하는 MMLU 테스트에서, F-WANDA는 7B 모델에서 WANDA보다 1.6 퍼센트 포인트, 13B 모델에서 1.4 퍼센트 포인트 높은 점수를 기록했습니다. 심지어 매우 신중한 방식인 SPARSEGPT보다도 뛰어난 성적을 보였습니다.
- 유창성: 로봇은 여전히 자연스럽게 들렸습니다. WikiText-2 테스트에서 F-WANDA는 7B 모델에 대해 6.85의 퍼플렉시티(perplexity) 점수를 얻었으며, 이는 원래의 WANDA와 거의 동일합니다. 이는 로봇이 로봇처럼 들리거나 혼란스러워지지 않았음을 의미합니다.
- 에너지와 속도: 이 부분이 F-WANDA가 진정으로 빛나는 지점입니다. 매우 신중한 SPARSEGPT 방식은 모델을 가지치기하는 데 오랜 시간과 많은 에너지를 사용했습니다. F-WANDA는 훨씬 빠르고 저렴했습니다. 실제로 F-WANDA는 SPARSEGPT가 사용한 에너지와 시간의 3분의 1만을 사용했습니다. 강력한 H100 GPU에서 7B 모델을 가지치기하는 데 약 12분과 4.3 kJ의 에너지를 사용한 반면, SPARSEGPT는 35분과 12.6 kJ가 걸렸습니다.
트레이드오프와 한계
저자는 F-WANDA가 모든 상황에 쓰이는 마법 지팡이는 아니라는 점을 분명히 밝히고 있습니다.
- 하드웨어 규칙: 만약 컴퓨터 칩이 엄격한 패턴(예: 블록 내 4개 중 정확히 2개의 연결을 유지하는 방식)으로 연결을 유지하고 제거하도록 요구한다면, F-WANDA는 스마트한 예산 배정을 할 수 없습니다. 그런 특수한 경우에는 원래의 WANDA처럼 작동합니다.
- 메모리: F-WANDA는 그 한 번의 추가 점검을 수행하기 때문에, 작업하는 동안 WANDA보다 약 두 배 더 많은 컴퓨터 메모리를 필요로 합니다. 매우 거대한 모델(예: 700억 파라미터)의 경우, 메모리에 맞추기 위한 특별한 기술이 필요할 수 있습니다.
- 일반화: 이 연구는 LLAMA-2 제품군에 대해서만 테스트되었습니다. 이 방식이 다른 종류의 로봇 뇌(예: LLaMA-3 또는 Mistral)에서도 똑같이 작동할지는 아직 확실하지 않지만, 저자들은 그럴 것이라고 추측하고 있습니다.
이것이 왜 중요한가
핵론적인 결론은 F-WANDA가 **'파레토 프런티어(Pareto frontier)'**에 위치한다는 것입니다. 이는 아주 멋진 표현으로, 당신이 얻을 수 있는 최고의 거래를 의미합니다. 즉, 가장 낮은 비용(최소한의 에너지와 시간)으로 최고의 품질(가장 똑똑한 로봇)을 얻는 것입니다.
단순히 어떤 부분이 실제로 열심히 일하고 있는지 확인하는 한 번의 빠른 점검을 추가함으로써, 연구진은 막대한 양의 에너지를 절약하면서도 로봇을 더 똑똑하게 만들었습니다. 이는 때때로 도서관을 더 좋게 만들기 위해 전체를 다시 지을 필요는 없으며, 단지 어떤 책을 버릴지에 대해 더 똑똑해지면 된다는 것을 상기시켜 줍니다. 이는 이러한 강력한 AI 모델을 현실 세계에서 더 쉽고 저렴하게 실행할 수 있게 하여, AI를 모두를 위해 더 지속 가능하게 만드는 데 도움을 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.