← 최신 논문
🤖 machine learning

Compressing LLMs with MoP: Mixture of Pruners

이 논문은 LLaMA 및 LLaVA 모델 전반에서 정확도와 지연 시간 감소 측면에서 기존의 단일 차원 방식들을 능가하는, 깊이(depth)와 너비(width) 프루닝을 통합한 반복적 프레임워크인 MoP(Mixture of Pruners)를 소개한다.

원저자: Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jorda
게시일 2026-07-28
📖 2 분 읽기☕ 가벼운 읽기

원저자: Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jordao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 무거운 도서관을 배낭에 담아 옮기려 한다고 상상해 보세요. 이 도서관에는 인류 지식의 총합이 담겨 있으며, 오직 가장 똑똑한 컴퓨터들만이 읽을 수 있는 매우 복잡한 언어로 쓰여 있습니다. 이러한 '도서관'들을 거대 언어 모델(LLM)이라고 부릅니다. 이들은 이야기를 쓰고, 수학 문제를 풀고, 심지어 친구처럼 대화를 나누는 데에도 매우 뛰어납니다. 하지만 한 가지 문제가 있습니다. 이들은 너무나 거대하고 무거워서, 단 한 문장을 읽기 위해서도 엄청난 양의 전기와 초고속 컴퓨터가 필요합니다. 만약 여러분이 일반적인 노트북이나 스마트폰에서 이들을 사용하고 싶다면, 너무 느리고 무거워서 들고 다니기 어려울 것입니다.

이를 해결하기 위해 과학자들은 중요한 책들을 버리지 않으면서도 이 도서관들을 더 작게 만드는 방법을 연구해 왔습니다. 그 방법 중 하나가 바로 '가지치기(pruning)'입니다. 가지치기를 정원 가꾸기에 비유해 보세요. 여러분에게 거대하고 무성하게 자란 덤불(거대한 컴퓨터 모델)이 있고, 이를 깔끔하고 작은 모양으로 다듬고 싶다고 가정해 봅시다. 여러분은 덤불 전체를 잘라낼 수도 있고(덤불을 짧게 만들기), 혹은 가지에서 잎사귀만 솎아낼 수도 있습니다(덤불을 가늘게 만들기). 오랫동안 정원사들은 둘 중 하나를 선택해야만 했습니다. 가지 전체를 잘라내거나, 아니면 가지에서 잎사귀만 솎아내거나 말이죠. 둘 다 동시에 할 수는 없었습니다. 문제는, 어떤 방식이 덤불을 건강하게 유지하면서도 열매를 맺을 수 있게 하면서 크기를 줄일 수 있느냐는 것이었습니다.

이 논문은 MoP라고 불리는 새로운 정원 도구를 소개합니다. MoP는 **혼합 가지치기(Mixture of Pruner)**의 약자입니다. 단 하나의 방법만을 선택하는 대신, MoP는 매 단계마다 두 가지 방법을 모두 시도하는 똑똑하고 반복적인 정원사입니다. 여러분이 덤불을 다듬고 있다고 상상해 보세요. 매번 자를 때마다 MoP는 두 가지 질문을 던집니다. "만약 이 가지 전체를 잘라낸다면 덤불이 어떻게 보일까?", 그리고 "만약 이 가지에서 잎사귀만 솎아낸다면 어떻게 보일까?" 그러고 나서 원래의 건강한 식물과 가장 비슷하게 유지되는 버전을 선택합니다. MoP는 덤불이 여러분의 배낭에 들어갈 만큼 작아질 때까지 가지를 치는 것과 잎을 솎아내는 것을 번갈아 가며 이 과정을 반복합니다.

연구진은 이 방법을 LLaMA-2 및 LLaMA-3와 같은 세계에서 가장 똑똑한 컴퓨터 뇌들에 테스트했습니다. 그 결과, MoP는 단일 방법만을 사용하는 것보다 이 모델들을 축소하는 데 훨씬 더 뛰어나다는 것을 발견했습니다. 모델을 40% 축소했을 때(모델 크기를 40% 줄였을 때), MoP는 경쟁 모델들과 대등한 지능을 유지하면서도 훨씬 더 빠르게 작동하게 만들었습니다. 실제로 모델이 질문에 답하는 속도가 39% 더 빨라졌습니다. 더욱 놀라운 점은, 사진을 보고 텍스트를 읽을 수 있는 모델(LLaVA-1.5라고 불림)에도 이 방법을 적용했다는 것입니다. 연구진은 텍스트로만 축소된 모델을 학습시켰음에도 불구하고(사진 없이), 해당 모델이 이전만큼이나 사진을 잘 이해할 수 있다는 것을 발견했습니다. 이는 두 가지 가지치기 전략을 혼합하는 것이, 모델이 매우 작아지더라도 길을 잃지 않고 더 작고, 빠르며, 똑똑한 컴퓨터 뇌를 만들어낸다는 것을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →