← 최신 논문
💬 NLP

WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

이 논문은 어텐션 헤드와 FFN 채널의 미세한 선택을 허용하는 토큰 레벨의 동적 너비 프루닝을 대규모 언어 모델(LLM)에 가능하게 하는 최초의 엔드 투 엔드 미분 가능한 프레임워크인 WIDE를 소개하며, 이와 결합된 특화된 커널 공동 설계를 통해 높은 정확도를 유지하면서도 상당한 엔드 투 엔드 추론 가속화를 달성합니다.

원저자: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

게시일 2026-07-31
📖 5 분 읽기🧠 심층 분석

원저자: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 작고 배터리로 작동하는 기기 위에서 거대하고 믿을 수 없을 정도로 똑똑한 로봇의 뇌를 실행하려고 한다고 상상해 보세요. 이 로봇의 뇌는 거대 언어 모델(LLM)이라는 일종의 인공지능입니다. 이 모델은 이야기를 쓰고, 수학 문제를 풀고, 인간처럼 대화할 수 있습니다. 하지만 문제는 이 뇌들이 너무나 거대하다는 점입니다. 이들은 너무 크고 전력을 많이 잡아먹어서, 보통 이를 실행하기 위해 슈퍼컴퓨터를 필요로 합니다. 그래서 당신의 스마트폰이나 노트북에서 사용하기에는 느리고 비용이 많이 듭니다.

이를 해결하기 위해 과학자들은 이 뇌를 "가지치기(pruning)" 하려고 노력해 왔습니다. 가지치기는 거대한 울타리를 다듬는 것과 같습니다. 식물이 더 작고 빠르게 자랄 수 있도록 별로 도움이 되지 않는 가지들을 잘라내는 것이죠. 오랫동안 이 작업을 수행하는 가장 좋은 방법은 식물이 그날 무엇을 하려 하든 상관없이 울타리의 전체 구역을 영구적으로 잘라내는 것이었습니다. 하지만 이는 다소 서투른 방식입니다. 때로는 특정 작업에 꼭 필요한 가지를 잘라버려 로봇을 건망증 있게 만들기도 하기 때문입니다. 최근에는 로봇이 생각하는 동안 어떤 부분을 사용할지 스스로 결정할 수 있게 하는 더 똑똑한 방법들이 발명되었습니다. 그러나 이러한 똑똑한 방법들도 여전히 조금 투박했습니다. 그들은 특정 구역 전체를 사용하거나 아예 통째로 건너뛰는 방식을 택했는데, 이는 마치 집 전체를 비워두거나 아니면 방 하나를 통째로 사용하는 것처럼, 몇 개의 전등만 켜는 식의 세밀함은 없었습니다.

이 논문은 WIDE(Width-based Inference with Dynamic Execution)라고 불리는 새로운 시스템을 소개합니다. 이것은 로봇에게 뇌의 모든 전등 하나하나에 대한 초정밀 디머 스위치(밝기 조절 스위치)를 주는 것과 같습니다. WIDE는 구역 전체를 켜거나 끄는 대신, 로봇이 매 단어를 처리할 때마다 정확히 어떤 작은 뉴런 그룹(뇌의 세포들)을 활성화하고 어떤 것을 꺼둘지 동적으로 결정할 수 있게 해줍니다. 연구진은 이 결정을 내리는 법을 배우는 특별한 "교통 관제사"(라우터)를 구축했습니다. 또한 컴퓨터 하드웨어가 혼란을 겪거나 속도가 느려지지 않고 이러한 결정을 처리할 수 있는 새로운 방법을 설계했습니다. 그 결과, 로봇은 이전만큼 똑똑함을 유지하면서도, 뇌 용량의 절반을 잘라냈음에도 불구하고 훨씬 더 빠르게 실행되며 에너지를 적게 사용하게 되었습니다.

문제점: "전부 아니면 전무(All-or-Nothing)"의 함정

당신이 거대한 주방을 운영하는 요리사라고 상상해 보세요. 당신에게는 함께 요리하는 수백 명의 요리사(뉴런)가 있습니다. 예전에는 시간을 아끼고 싶다면 주방 인력의 절반을 영구적으로 해고했습니다. 만약 당신이 항상 똑같은 간단한 요리만 만든다면 이 방법은 괜찮겠지만, 갑자기 복잡한 케이크를 구워야 한다면 당신은 딱 필요한 유일한 제빵사를 해고했을지도 모릅니다. 이것이 바로 **정적 가지치기(static pruning)**에서 일어나는 현상입니다. 모델은 질문에 답하는 내용과 상관없이 한 번 정해지면 그대로 잘려 나갑니다.

그다음 **동적 가지치기(dynamic pruning)**가 등장했습니다. 이는 마치 요리사들에게 "이 특정 주문을 위해서는 그릴 스테이션만 필요하니, 베이커리는 쉬어도 좋습니다"라고 말할 수 있는 매니저를 고용하는 것과 같았습니다. 이는 더 나은 방식이었지만, 매니저는 여전히 다소 서툴렀습니다. 그들은 베이커리에 텐 개의 오븐 중 두 개만 필요하더라도 "베이커리 전체를 건너뛰세요"라고 말하곤 했습니다. 이는 주방의 큰 덩어리들에 대한 "전부 아니면 전무" 식의 결정이었습니다.

현대적인 AI 모델들은 매우 복잡하기 때문에, 전체 덩어리를 건너뛰는 것은 종종 유용한 정보를 버리게 되어 답변의 질을 떨어뜨립니다. 게 furthermore, 만약 매니저가 매 초마다 스케줄을 계속 바꾼다면, 주방 직원들은 혼란에 빠질 것이고, 전환 과정에서의 오버헤드 때문에 실제 요리 속도는 별로 빨라지지 않을 것입니다.

해결책: WIDE의 "디머 스위치"

이 논문의 저자들(닝보 디지털 트윈 연구소와 LMU 뮌헨 소속)은 WIDE를 고안해 냈습니다 부서 전체를 해고하거나 방 전체를 건너뛰는 대신, WIDE는 모델이 매 단어(토큰)를 처리할 때마다 정확히 어떤 작은 뉴로 그룹을 활성화할지 결정하게 합니다.

모델의 뇌를 거대한 조명 스위치 격자라고 생각해 보세요.

  • 기존의 동적 방법들: "집의 왼쪽 날개 전체를 꺼라."
  • WIDE: "이 특정 단어를 위해 주방의 불을 켜되, 가스레인지와 냉장고 위의 전등만 켜라. 나머지 주방은 어둡게 두어라."

WIDE는 모델의 각 레이어에 부착된 가벼운 "라우터"(작은 의사 결정자)를 사용하여 이를 수행합니다. 이 라우터는 현재 단어를 보고 다음과 같이 묻습니다. "내가 이 어텐션 헤드(다른 단어들을 살펴보는 부분) 그룹이 필요한가?" 그리고 "내가 이 FFN 채널(의미를 처리하는 부분) 그룹이 필요한가?" 그 후 이 그룹을 사용할지 아니면 건너뛸지를 이진 선택(binary choice)으로 결정합니다.

결정적으로, WIDE는 단순히 결정만 내리는 데 그치지 않고 하드웨어의 골칫거리를 해결합니다. 보통 컴퓨터에 계산의 무작위 부분을 건너뛰라고 지시하면, 컴퓨터는 데이터가 어디 있는지 찾느라 속도가 느려집니다. WIDE는 **마스크 재정렬(mask reordering)**이라는 영리한 기술을 사용합니다. 당신에게 배달할 편지와 버릴 쓰레기가 섞인 지저키한 우편물 더미가 있다고 상상해 보세요. W도 쓰레기를 버린 뒤 다시 우편물을 분류하려고 애쓰는 대신, WIDE는 먼저 더미를 섞어서 모든 "유지할" 편지는 깔끔한 블록 형태로 맨 위에, 모든 "쓰레기" 편지는 맨 아래에 오도록 배치합니다. 이를 통해 컴퓨터는 모든 편지를 일일이 확인하며 멈출 필요 없이 "유지할" 블록을 매우 효율적으로 처리할 수 있습니다.

연구 결과: 속도와 지능

연구진은 Llama 3.1 (80억 파라미터) 및 Llama 3.2 (30억 파라미터)와 같은 인기 있는 AI 모델로 WIDE를 테스트했습니다. 그들은 기존의 최선인 정적 및 동적 가지치기 방법들과 비교했습니다.

수치가 시사하는 바는 다음과 같습니다:

  • 더 똑똑한 가지치기: 모델 용량의 50%를 잘라냈을 때(매우 공격적인 트리밍), WIDE는 다른 어떤 방법보다 모델의 지능을 훨씬 더 잘 유지했습니다. 예를 들어, Llama 3.1 모델에서 WIDE는 원래 정확도의 **86.42%**를 유지한 반면, 그다음으로 좋은 동적 방법인 SkipGPT는 **59.42%**만을 유지했습니다. 추가적인 미세 조정(fine-tuning) 없이도 WIDE는 이미 최고의 정적 방법들을 앞질렀습니다.
  • 실제 세계의 속도: 연구진은 모델이 실제로 얼마나 빨리 실행되는지 측정했습니다. 긴 프롬프트를 읽는 단계(prefill)에서 WIDE는 원본 모델보다 1.68배 더 빨랐습니다. 답변을 단어별로 생성하는 단계(decode)에서는 1.55배 더 빨랐습니다.
  • 커널 수준의 마법: 순수하게 수학적 계산만 따졌을 때(다른 오버헤드를 제외하고), 속도 향상은 더욱 극적이어서 prefill 단계에서는 최대 1.98배, decoding 단계에서는 최대 4.95배에 달했습니다. 이는 이전 방식들이 "건너뛰기"를 처리하는 비효율적인 방식이 병목 현상이었음을 보여주며, WIDE의 새로운 하드웨어 설계가 이를 해결했음을 시사합니다.

저자들은 또한 모델이 매우 전략적으로 학습한다는 것을 발견했습니다. 모델은 단순히 무작위로 건너뛰는 것이 아니라, "the"나 "a"와 같은 "지루한" 단어들은 건너뛰고 "running"이나 "track"과 같은 "중요한" 단어들은 유지하는 법을 배웠습니다. 한 테스트에서 모델은 어텐션 작업의 66%를 건너뛰었지만, 프로세싱 작업은 28%만 건너뛰었습니다. 이는 모델이 어디에서 에너지를 아껴야 할지 정확히 알고 있었음을 보여줍니다.

결론

WIDE는 효율적인 AI의 미래가 단순히 모델을 더 작게 만드는 것이 아니라, 남은 부분을 어떻게 사용하는지에 대해 모델을 더 똑똑하게 만드는 것에 있다는 점을 시사합니다. "방 전체를 건너뛰기"에서 "특정 전등의 밝기를 조절하기"로 이동하고, 이러한 디머를 효율적으로 처리하도록 주방을 재설계함으로써, 저자들은 강력한 AI 모델을 기억력을 잃지 않으면서도 훨씬 더 빠르고 효율적으로 만들 수 있는 프레임워크를 만들어냈습니다.

결과는 유망하지만, 논문은 이것이 GPU 하드웨어(컴퓨터의 칩)를 위한 특정 솔루션이며, 모델이 먼저 결정을 내리는 법을 배우고 나서 잃어버린 정확도를 회복하기 위해 빠른 튜닝을 거치는 2단계 훈련 과정에 의존한다는 점을 언급합니다. 이는 강력한 AI를 일상적인 기기에서 사용할 수 있게 만드는 중요한 진전이며, 똑똑해지기 위해서 반드시 거대한 뇌가 필요한 것이 아니라, 적절한 시기에 뇌의 어느 부분을 사용해야 하는지를 아는 것이 중요하다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →