BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal
이 논문은 칩 특화 최적화를 활용하여 대규모 언어 모델에 대해 llama.cpp 및 MLX와 같은 기존 프레임워크보다 최대 1.56배 높은 기록적인 처리량을 달성하는 Apple Silicon용 네이티브 Metal 추론 런타임인 BaseRT를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: 커스텀 레이스카 제작하기
당신이 아주 특정한 트랙(Apple Silicon 칩인 M3 또는 M4)에서 레이스카(대규모 언어 모델, 즉 LLM)를 운전하고 싶다고 상상해 보세요.
현재 대부분의 사람들은 "범용 어댑터"나 "렌탈 카 키트"(llama.cpp 또는 MLX와 같은 기존 소프트웨어)를 사용하여 이 차를 운전합니다. 이러한 키트들은 다양한 트랙에서 잘 작동한다는 장점이 있지만, 바로 '이 특정' Apple 트랙에 완벽하게 튜닝되어 있지는 않습니다. 불필요한 무게가 실려 있고, 단계가 더 많으며, 지름길을 모르는 운전자가 타고 있는 것과 같습니다.
BaseRT는 오직 Apple 트랙만을 위해 설계된 새로운 커스텀 레이스카입니다. Base Compute 팀은 무거운 어댑터들을 모두 제거하고, 트랙의 독특한 곡선과 규칙에 딱 맞도록 바닥부터 차량을 새로 구축했습니다. 그 결과는? 훨씬 더 빠르게 달립니다.
문제점: 왜 기존 소프트웨어는 "느린가"?
이 논문은 Apple 기기에서 AI를 실행하는 기존 소프트웨어가 마치 너무 많은 곳에 들러야 하는 배달 트럭과 같다고 주장합니다.
- "중간 관리자" 문제: 대부분의 소프트웨어는 컴퓨터의 그래픽 칩(GPU)과 대화하기 위해 "프레임워크"(중간 관리자 역할)를 사용합니다. 이 중간 관리자는 매 작업마다 클립보드를 확인하는 매니저처럼 추가적인 단계를 더합니다.
- "메모리" 문제: Apple 컴퓨터에는 CPU와 GPU가 동일한 거대한 RAM 풀을 공유하는 "통합 메모리(Unified Memory)"라는 특별한 기능이 있습니다. 기존 소프트웨어는 종종 이 둘을 서로 다른 방에 있는 것처럼 취급하여, 데이터가 불필요하게 왔다 갔다 하게 만듭니다.
해결책: BaseRT는 어떻게 작동하는가?
BaseRT는 중간 관리자를 없애고 뇌(CPU/GPU)와 근육 사이의 직통 고속도로를 건설합니다. 이들이 사용한 네 가지 주요 기술은 다음과 같습니다.
"데이터 기반" 청사진:
매번 새로운 AI 모델(Qwen, Llama, Gemma 등)마다 새로운 지침 세트를 작성하는 대신, BaseRT는 하나의 유연한 청사진을 사용합니다. 이것은 마치 모든 TV 브랜드마다 다른 리모컨을 가질 필요 없이, 가리키는 TV를 자동으로 감지하여 버튼을 즉시 바꾸는 만능 리모컨과 같습니다. 덕 การ 엔진이 재설정하느라 멈추지 않고 매끄럽게 계속 돌아갑니다."무정차" 루프:
AI에게 문장을 쓰라고 요청하면, AI는 한 번에 한 단어씩 생성합니다. 기존 소프트웨어에서는 컴퓨터가 생성되는 매 단어마다 주차 공간(메모리 할당)을 찾아야 합니다. BaseRT는 경주가 시작되기 전에 모든 주차 공간을 미리 확보해 둡니다. 일단 AI가 말을 시작하면, 주차 공간을 찾느라 멈추지 않고 계속 달려 나갑니다. 이는 메모리 관리로 인한 "교통 체증"을 제거합니다."퓨전" 주방:
보통 AI는 재료를 각각의 냄비(행렬 곱셈, 어텐션, 정규화)에서 따로 요리한 뒤 재료를 옮겨야 합니다. BaseRT는 이 단계들을 하나의 거대한 냄비로 합칩니다. 재료를 한 번의 동작으로 함께 요리하여, 음식을 옮기는 데 드는 시간을 절약합니다."커스텀 드라이버":
이 소프트웨어는 자신이 어떤 Apple 칩(M1, M2, M3 등)에서 실행되고 있는지 정확히 알고 있습니다. 엔진 크기에 따라 운전 스타일을 조정하여, 연료 한 방울에서도 최대한의 출력을 뽑아냅니다.
결과: 누가 경주에서 승리했는가?
팀은 BaseRT를 두 명의 가장 강력한 경쟁자인 llama.cpp(가장 인기 있는 오픈 소스 실행기) 및 MLX(Apple의 공식 프레임워크)와 테스트했습니다.
- 속도: BaseRT는 거의 모든 테스트에서 가장 빨랐습니다.
- 작은 모델의 경우,
llama.cpp보다 최대 1.56배 더 빨랐습니다. - 복잡한 AI 브레인인 대규모 "전문가 혼합(Mixture-of-Experts)" 모델의 경우, 초기 프롬프트 처리 속도가 최대 1.78배 더 빨랐습니다.
- 작은 모델의 경우,
- "작은 모델"의 스윗 스팟: 가장 큰 승리는 작은 모델에서 나타났습니다. 이는 작은 모델의 경우, "오버헤드"(행정 업무에 낭비되는 시간)가 전체 시간에서 차지하는 비중이 매우 크기 때문입니다. 이 낭비를 제거함으로써 BaseRT는 엄청난 차이를 만들어냈습니다.
- "큰 모델"의 현실: 매우 큰 모델의 경우, 속도는 주로 데이터를 메모리로 이동시키는 속도(대역폭)에 의해 제한됩니다. 완벽한 엔진을 갖추더라도 도로의 제한 속도보다 빨리 갈 수는 없습니다. 하지만 BaseRT는 여기서도 추가적인 속도를 짜내는 데 성공했으며, 이는 이전 소프트웨어들이 도로를 효율적으로 사용하지 못했음을 증명합니다.
이것이 왜 중요한가? ("엣지"로의 전환)
이 논문은 우리가 AI가 먼 클라우드 서버가 아닌, 여러분의 개인 기기(노트북이나 스마트폰)에서 실행되는 시대로 이동하고 있다고 제안합니다.
- 개인정보 보호: 당신의 데이터는 컴퓨터를 떠나지 않습니다.
- 속도: 인터넷을 통해 요청을 주고받기 위해 기다릴 필요가 없습니다.
- 비용: 단어당 월간 비용을 지불하는 대신, 하드웨어를 한 번 구매하는 것으로 충분합니다.
BaseRT는 Apple 실리콘이 만약 전용 소프트웨어를 사용한다면, 우리가 생각했던 것보다 훨씬 더 강력하게 로컬 AI를 실행할 수 있다는 것을 증명합니다.
BaseRT가 하지 못하는 것 (한계점)
이 논문은 이 도구가 아직 무엇이 아닌지에 대해서도 솔직하게 밝히고 있습니다.
- 단일 사용자 전용: 한 번에 한 명의 사용자가 AI를 사용하는 데 최적화되어 있습니다. 수백 명의 사람이 동시에 질문을 던지는 상황(서버 부하)은 처리하지 않습니다.
- Apple 전용: Mac과 iPad에서만 작동합니다. 아직 Windows, Android 또는 NVIDIA 그래픽 카드에서는 작동하지 않습니다.
- 아직 "시각" 기능 없음: 현재는 텍스트 모델을 다루며, 이미지를 "볼 수 있는" 모델은 다루지 않습니다.
결론
저자들은 Apple 컴퓨터에서 AI를 실행할 때 발생하는 모든 불필요한 짐을 제거한 커스텀 엔진(BaseRT)을 만들었습니다. 이를 통해 하드웨어의 전체 잠재력을 끌어올려, 로컬 AI를 그 어느 때보다 빠르고, 프라이빗하며, 효율적으로 만들었습니다. GitHub에서 직접 체험해 볼 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.