SelectInfer: Selective Neuron Loading and Computation for On-Device LLMs
SelectInfer는 오프라인 프로파일러를 사용하여 가장 중요한 뉴런만을 식별하여 선택적으로 로드하고 계산함으로써, 작업 성능을 저하시키지 않으면서도 메모리와 계산 비용을 크게 줄여 온디바이스 거대 언어 모델 추론을 효율적으로 가능하게 하는 뉴런 수준의 최적화 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거의 모든 질문에 답할 수 있는 방대한 지식의 도서관을 가지고 있다고 상상해 보세요. 이것이 과학자들이 '거대 언어 모델(LLM)'이라고 부르는 것입니다. 이것은 인터넷에 있는 거의 모든 책을 읽은 매우 똑똑한 로봇 뇌와 같습니다. 하지만 여기에는 함정이 있습니다. 이 뇌는 너무 거대하고 무거워서, 보통 강력한 슈퍼컴퓨터를 갖춘 거대하고 비싼 데이터 센터가 있어야만 실행할 수 있습니다. 마치 커다란 도서관 전체를 배낭에 넣으려고 하는 것과 같아서, 도저히 들어가지 않는 것이죠.
최 최근, 사람들은 이 "도서관"을 당신의 주머니 속에 있는 스마트 기기나 자율주행 자동차의 컴퓨터와 같은 더 작은 기기에 넣고 싶어 했습니다. 이것들을 "엣지 디바이스(edge devices)"라고 부릅니다. 문제는 이러한 기기들은 공간과 배터리 전력이 매우 제한적이라는 점입니다. 만약 도서관 전체를 억지로 밀어 넣으려 한다면, 기기는 충돌하거나 너무 느리게 작동하여 쓸모없게 됩니다. 과학자들은 책을 찌그러뜨려(더 작게 만들되 읽기는 더 어렵게 만드는 방식) 도서관을 줄이거나, 선반 전체를 버리는 방식(이로 인해 로봇이 무언가를 잊어버리게 만드는 방식)으로 이 문제를 해결하려 노력해 왔습니다. 하지만 이러한 오래된 기술들은 로봇의 사고 능력을 손상시키는 경우가 많았습니다. 큰 질문은 이것입니다: 과연 우리는 이 거대한 뇌의 천재성을 잃지 않으면서, 어떻게 이 거대한 도서관을 작은 배낭 안에 담을 수 있을까요?
여기에 파더본 대학교(Paderborn University)의 연구진이 제안하는 새로운 아이디어인 SelectInfer가 이 퍼즐을 풀 수 있는 영리한 방법을 제시합니다. 전체 도서관을 줄이거나 무작위로 책을 버리는 대신, SelectInfer는 당신에게 지금 당장 필요한 책이 무엇인지 정확히 알고 있는 매우 똑똑한 사서처럼 행동합니다.
이것이 어떻게 작동하는지 간단한 이야기로 설명해 보겠습니다. 당신의 로봇 뇌는 수천 명의 노동자(이를 "뉴런"이라고 부릅니다)가 있는 거대한 공장과 같습니다. 일반적인 공장에서는 모든 노동자가 매일 출근하며, 심지어 할 일이 없을 때도 출근합니다. 이는 공간과 에너지를 낭비합니다. 연구진은 이 노동자들이 실제로 두 그룹으로 나뉜다는 것을 발견했습니다. 어떤 이들은 항상 출근하는 "제너럴리스트(Generalists)"입니다. 마치 불을 켜두거나 커피 머신을 돌리는 사람들처럼 어떤 작업이든 상관없이 항상 자리를 지킵니다. 다른 이들은 "스페셜리스트(Specialists)"로, 배관을 고치거나 벽을 칠하는 팀처럼 특정 작업에만 나타납니다.
이 논문은 어떤 작업을 수행하든 모든 스페셜리스트가 필요하지 않으며, 오늘 일하지 않는 이들은 확실히 필요하지 않다는 것을 보여줍니다. SelectInfer는 작은 기기에서 이 공장을 가동하기 위해 두 단계의 마법 같은 기술을 사용합니다:
선택적 로딩 (배낭 트릭): 로봇이 일을 시작하기도 전에, 연구진은 "오프라인 프로파일러"(일종의 정찰병)를 사용하여 어떤 제너럴리스트와 스페셜리스트가 가장 중요한지 파악합니다. 그런 다음 로봇이 준비되었을 때, 오직 그 특정 작업자들만을 배낭(메모리)에 담습니다. 나머지 사람들은 남겨둡니다. 이것은 캠핑을 갈 때 하드웨어 상점 전체를 가져가는 대신, 필요한 도구들만 챙기는 것과 같습니다. 이를 통해 로봇은 이전에 너무 작아서 담을 수 없었던 기기에도 들어갈 수 있게 됩니다. 예를 들어, 8GB의 메모리(NVIDIA Jetson Orin Nano와 같은)를 가진 기기에서, 원래 9GB의 공간이 필요했던 모델이 필수적인 인원의 70%만을 운반함으로써 간신히 들어갈 수 있게 된 것입니다.
선택적 연산 (온디맨드 트릭): 배낭이 가벼워졌더라도, 로봇은 여로 모든 노동자에게 일을 시켜야 하며 이는 시간이 걸립니다. SelectInfer는 두 번째 규칙을 추가합니다. 일단 로봇이 일을 시작하면, 그 특정 순간에 가장 관련 있는 노동자들에게만 실제로 수학 계산을 수행하도록 요청합니다. 만약 로봇이 시를 쓰고 있다면, 배관 팀이 운율을 계산할 필요는 없습니다. 오직 시인들만 깨우면 됩니다. 이 방식은 로봇이 훨씬 더 빠르게 생각하게 만듭니다.
연구진은 이 세 가지 로봇 뇌(Llama3.2-3B, Llama3.2-1B, Qwen2.5-3B)를 아주 작은 컴퓨터 칩에서 테스트했습니다. 그 결과, 이 방법을 사용함으로써 이전에는 불가능했던 기기에서도 이 거대 모델들을 실행할 수 있음을 발견했습니다. 30억 개의 파라미터를 가진 모델의 경우, SelectInfer는 데이터를 찌그러뜨리는 현재의 최선책(4-bit 양자화)보다 약 1.53배 더 빠르게 실행되었으며, 느린 디스크에서 데이터를 가져오는 것보다 13배 이상 빠르게 작동했습니다.
결정적으로, 이 논문은 이 방법이 로봇을 "멍청하게" 만들지 않는다고 주장합니다. 사실 번역이나 이야기 요약과 같은 많은 작업에서 SelectInfer는 공간을 절약하려고 시도했던 다른 방법들보다 실제로 더 정확했습니다. 연구진은 다른 방법들이 메모리는 아꼈지만 속도가 느렸거나, 혹은 속도는 빨랐지만 무언가를 잊어버렸던 반면, SelectInfer는 메모리 절약, 사고 속도 향상, 그리고 정확도 유지라는 세 가지를 모두 균형 있게 잡아냈다는 것을 발견했습니다.
이 논문은 모델 전체를 버리거나 처음부터 다시 학습시켜야 한다는 생각을 명시적으로 부정합니다. 또한, 단순히 무작위로 노동자를 남겨두는 방식(무작위 로딩)은 로봇을 완전히 실패하게 만든다는 것을 보여줌으로써, 누가 남아야 할지 알기 위해서는 스마트한 지도가 필요하다는 것을 증명했습니다. 이 방법은 어떤 노동자가 중요한지 알아내기 위한 일회성 "정찰" 단계를 필요로 하지만, 결과는 이 방식이 클라우드의 슈퍼컴퓨터 없이도 우리 주머니 속의 작은 기기들에 초지능 AI를 가져올 수 있는 실용적이고 강력한 방법임을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.