NeuroPrefetcher: Storage-Aware Sparse LLM Inference via Delta Prefetching
NeuroPrefetcher는 반응적인 수요 페이징에 의존하는 대신 MLP 뉴런 활성도의 시간적 지역성을 활용하여 필요한 가중치 델타만을 스토리지로부터 예측적으로 프리페치함으로써 메모리 제약이 있는 엣지 디바이스에서 상당한 속도 향상을 달성하는 스토리지 인식형 LLM 추론 시스템입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대 언어 모델은 현대 인공지능의 엔진으로서, 한때 불가능해 보였던 유창함으로 글을 쓰고, 추론하며, 번역할 수 있는 능력을 갖추고 있습니다. 이러한 시스템은 텍스트를 한 번에 한 단어씩 처리하며, 훈련 과정에서 학습한 방대한 패턴을 바탕으로 시퀀스 내의 다음 단어를 예측함으로써 작동합니다. 이를 위해 이들은 컴퓨터 메모리에 저장된 '가중치'라고 불리는 거대한 디지털 숫자 라이브러리에 의존합니다. 모델이 더 크고 유능할수록 더 많은 메모리를 필요로 합니다. 그러나 하나의 중대한 격차가 발생했습니다. 모델의 크기는 기하급수적으로 성장한 반면, 노트북, 태블릿, 특수 엣지 컴퓨터와 같은 휴대용 기기에서 사용 가능한 메모리는 그 속도를 따라잡지 못했다는 점입니다. 이는 발전된 지능을 거대한 데이터 센터 밖에서 실행하는 데 근본적인 문제를 야기합니다. 모델이 기기의 메모리에 담기기에 너무 크면, 시스템은 빠른 메모리와 더 느리고 큰 저장 장치 사이에서 데이터를 끊임없이 교체해야 하며, 이 과정은 보통 성능을 멈춰 세우게 됩니다.
케네소 주립 대학교(Kensaw State University)와 삼성의 연구진은 이 문제에 대한 새로운 접근 방식을 개발하여, 메모리가 매우 제한적인 기기에서도 이러한 거대 모델을 효율적으로 실행할 수 있게 해주는 '뉴로프리페처(NeuroPrefetcher)'라는 시스템을 만들었습니다. 모델을 축소하거나 억지로 끼워 맞추려 하는 대신, 이들의 시스템은 모델이 가용 메모리보다 크다는 사실을 인정하고 저장 장치를 계산 과정의 능동적인 부분으로 취급합니다. 이들의 성공 비결은 이 모델들이 생각하는 방식에 대한 단순한 관찰에 있습니다. 모델이 한 단어를 생성할 때 특정 내부 경로를 활성화합니다. 그다음 단어를 생성할 때, 모델은 거의 동일한 경로를 다시 사용합니다. 연구진은 단어와 단어 사이에 활성화되는 경로의 82에서 85%가 동일하게 유지된다는 것을 발견했습니다. 이는 작업의 대다수에 있어 필요한 데이터가 이미 기기의 메모리에 머물며 사용되기를 기다리고 있다는 것을 의미합니다.
뉴로프리페처의 혁신은 변화하는 아주 적은 양의 데이터를 관리하는 방식에 있습니다. 전통적인 시스템은 모델이 데이터 조각을 필요로 할 때까지 기다렸다가 저장 장치에서 데이터를 가져오는 반응적인 프로세스를 따르며, 이 과정에서 컴퓨터는 일시 정지되어 대기하게 됩니다. 뉴로프피리페처는 다르게 작동하며, 앞을 내다봅니다. 이 시스템은 현재의 단어를 분석하여 다음 단어를 위해 정확히 어떤 새로운 경로가 필요할지 추측하는 작고 특화된 예측기를 사용합니다. 다음에 올 것을 알고 있기 때문에, 컴퓨터가 현재의 단어를 계산하는 동안 저장 장치로부터 오직 구체적인 누락 데이터만을 가져올 수 있습니다. 이는 혼란스럽고 멈춤이 반복되는 과정을 매끄럽고 연속적인 흐름으로 바꿉니다. 이 시스템은 본질적으로 메모리에 이미 상주하고 있는 거대한 데이터 덩어리는 무시하고, 필요한 아주 작은 비율의 새로운 정보만을 미리 불러옵니다.
이 아이디어를 테스트하기 위해 연구팀은 완전한 시스템을 구축하고, 프로세서와 그래픽 유닛 간에 공유되는 통합 메모리 아키텍처를 가진 강력한 엣지 장치인 Jetson AGX Orin에서 실행했습니다. 그들은 Mistral-7B 및 Llama-3-8B와 같은 거대 언어 모델을 사용하여, 모델이 가용 메모리보다 현저히 큰 상황을 시뮬레이션하는 엄격한 메모리 제한 조건 하에서 테스트했습니다. 이러한 도전적인 조건에서, 운영 체제가 데이터 스와핑을 관리하는 데 의존하는 표준 방식은 성능이 저하되어 종종 장치를 멈추게 했습니다. 반면, 뉴로프리페처는 장치를 계속 움직이게 하여 표준 방식보다 거의 8배에서 12배 더 빠른 속도를 달ach했습니다. 표준 방식은 초당 1단어조차 생성하기 힘들어했던 반과 달리, 이 시스템은 초당 3단어 이상의 속도로 단어를 생성할 수 있었습니다.
연구진은 또한 가용 메모리가 변함에 따라 시스템이 어떻게 작동하는지 조사했습니다. 그들은 메모리가 부족할 때는 모델의 작업 중 더 많은 부분을 저장 장치로 옮기고, 공간이 확보되면 더 많은 작업을 빠른 메모리로 다시 가져오는 방식으로 적응할 수 있음을 발견했습니다. 가장 타이트한 메모리 조건에서도, 이 시스템은 일반적으로 이러한 작업을 느리게 만드는 대규모 데이터 전송을 피함으로써 높은 성능을 유지했습니다. 모델의 뇌 전체를 앞뒤로 옮기는 대신, 변화하는 작은 데이터 조각들만을 이동시켰습니다. 이 접근 방식은 매우 효과적이어서, 특정 제약 조건 하에서 실행조차 되지 않았던 많은 고급 도구들과 비교했을 때도 여전히 가장 빠른 옵션으로 남았습니다.
이 연구의 핵심적인 부분은 속도 향상이 지능의 희생을 수반하지 않도록 보장하는 것이었습니다. 연구진은 시스템이 생성하는 텍스트의 품질을 측정했으며, 압축되지 않은 전체 모델의 품질과 매우 유사하다는 것을 발견했습니다. 이 시스템은 가장 공격적인 메모리 절약 설정을 사용할 때도 원래 성능의 90% 이상을 유지하며 모델의 예측 정확도를 보존했습니다. 이는 필요한 데이터만을 이동시키는 전략이 언어를 이해하고 생성하는 모델의 능력을 저하시키지 않는다는 것을 확인시켜 주었습니다. 시스템은 즉각적인 다음 단계에 필요하지 않은 데이터는 무시하고, 중요한 것에만 자원을 집중하도록 효과적으로 학습되었습니다.
이 연구는 우리가 일상적인 기기에서 인공지능을 실행하는 방식에 대한 사고의 전환을 강조합니다. 수년간 거대 모델을 작은 하드웨어에서 실행하기 위한 해결책은 모델을 더 작게 만들거나 압축하는 것이었으며, 이는 때때로 모델의 역량을 감소시킬 수 있습니다. 뉴로프리페처는 다른 경로를 제시합니다. 전체 모델을 온전하게 유지하면서 데이터의 이동을 극도로 정밀하게 관리하는 것입니다. 다음에 필요한 것을 예측하고 그 특정 변화만을 가져냄으로써, 이 시스템은 저장 장치를 병목 현상이 아닌 유용한 파트너로 바꿉니다. 이 접근 방식은 강력한 지능이 이전에는 그것을 담기에 너무 작았던 기기에서도 작동할 수 있게 하여, 원격 서버와의 연결 없이도 고급 AI가 로컬에서 실행될 수 있는 문을 열어줍니다. 결과는 적절한 데이터 흐름 관리가 뒷받침된다면, 모델 자체의 힘을 희생하지 않고도 메모리의 물리적 한계를 극복할 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.