Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models
이 논문은 이기종 기기 전반에서 사용자 프라이버시를 보호하면서 지연 시간과 대역폭 사용량을 크게 줄이기 위해 엔드포인트 인증 KV 캐시와 암호화된 데이터 전송을 활용하는, 대규모 언어 모델 추론을 위한 프라이버시 중심의 에지-클라우드 협업 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 이야기를 쓰고, 수학 문제를 풀고, 인간처럼 대화할 수 있는 초지능 로봇 뇌를 가지고 있다고 상상해 보세요. 이것을 우리는 거대 언어 모델(LLM)이라고 부릅니다. 하지만 여기 함정이 있습니다. 이 뇌들은 너무나 거대하고 전력을 갈구하기 때문에, 보통 당신의 스마트폰이나 노트북 안에 들어갈 수 없습니다. 그것들은 클라우드에 있는 거대하고 강력한 컴퓨터들에 살고 있습니다. 그래서 당신이 휴대폰으로 질문을 하면, 휴대폰은 질문을 클라우드로 외쳐서 보내고, 거대한 뇌가 생각할 때까지 기다렸다가, 그 답을 듣기 위해 귀를 기울여야 합니다. 이것은 잘 작동하지만, 두 가지 큰 문제가 있습니다. 첫째, 주고받는 데 시간이 걸리기 때문에 느립니다. 둘둘째, 위험합니다. 왜냐하면 당신의 비밀스러운 생각, 개인적인 기록, 그리고 정확한 단어들을 클라우드에 알려줘야 하기 때문입니다. 이것은 마치 답장을 받기 위해 낯선 사람에게 일기장 내용을 보내는 것과 같습니다.
이를 해결하기 위해 과학자들은 작업을 나누는 방법을 시도했습니다. 당신의 휴대폰이 쉬운 부분을 맡고, 어려운 부분은 클로에 보내는 방식입니다. 하지만 이조차도 까다롭습니다. 데이터를 너무 많이 보내면 느려지고, 너무 적게 보내면 클라우드가 혼란에 빠집니다. 또한, 당신의 가공되지 않은 생각을 그대로 보내면 여전히 프라이버시가 위험에 처합니다. 이 논문은 데이터와 함께 "숨바꼭질"을 하는 새로운 방법을 탐구합니다. 이 논문은 당신의 기기와 클라우드가 마치 형사와 사서처럼 협력하는 영리한 파트너십을 제안합니다. 기기는 가장 민감한 단서들(예: 당신의 개인적인 기록과 특정 어휘)을 숨기고, 클라우드는 책을 읽는 무거운 일을 수행합니다. 목표는 로봇 뇌가 당신과 즉각적으로 대화할 수 있을 만큼 빠르게 만들면서도, 클라우드가 당신의 생생한 비밀을 절대 볼 수 없을 만큼 프라이버시를 보호하는 것입니다.
형사와 사서: AI와 대화하는 새로운 방법
그렇다면 이 새로운 시스템은 실제로 어떻게 작동할까요? 이 논문의 저자인 KunlunMeta의 Yi Li, Chen Li, Jiexiong Liu는 "에지-클라우드 협업 추론(edge–cloud collaborative inference)"이라고 부르는 프레임워크를 구축했습니다. 이것은 당신이 붐비는 방 너머로 메시지를 전달하고 싶지만, 중간에 있는 사람(클라우드)이 메시지가 무엇에 관한 것인지 알기를 원하지 않고, 그 사람이 전달하는 데 너무 오래 걸리는 것도 원치 않는 고도의 "전화 놀이(Telephone)"라고 생각하면 됩니다.
이 새로운 설정에서, 당신의 기기(에지)는 똑똑한 형사 역할을 하고, 클라우드는 거대하고 강력한 사서 역할을 합니다. 여기에는 마법 같은 기술이 있습니다:
1. 형사가 숙제를 먼저 합니다 (프라이버시 우선)
당신의 가공되지 않은 질문을 클라우드에 외치는 대신, 당신의 기기는 먼저 숙제를 합니다. 기기는 당신의 단어들을 비밀 코드(임베딩이라고 불림)로 변환하고, 클라우드가 당신의 과거 대화 기록 중 정확히 어느 정도까지 볼 수 있는지 결정합니다. 이것은 형사가 자신의 실제 사건 기록을 드러내지 않으면서, 사서에게 사서가 확인해도 되는 책들의 목록만을 건네주는 것과 같습니다. 또한 기기는 자신이 생각하는 답변이 무엇일지에 대한 특별한 "초안"을 보관합니다. 이것은 "추측적 디코딩(speculative decoding)"이라고 불립니다. 이것은 사서가 현재 페이지를 다 읽기도 전에 형사가 이야기의 다음 문장을 미리 추측하는 것과 같습니다.
2. 사서가 무거운 짐을 집니다 (필요한 부분만)
클라우드는 이 비밀 코드와 "허가증(캐시 권한)"을 받습니다. 클라우드는 당신의 가공되지 않은 단어를 보지 못하며, 오직 수학적 데이터만을 봅니다. 클라우드는 자신의 초강력 뇌를 사용하여 허가된 기록을 읽고 어려운 부분들을 처리합니다. 결정적으로, 클라우드는 답변 전체를 한 번에 계산하지 않습니다. 클라우드는 형사가 이미 추측한 부분 이외의 부분만을 계산합니다. 이것은 "분할 어휘 투영(split vocabulary projection)"이라고 불립니다. 상상해 보세요. 클라우드는 문장의 마지막 몇 단어만을 써 내려가야 하고, 당신의 기기는 자신의 로컬 지식을 바탕으로 나머지 부분을 채웁니다.
3. 악수 (빠르고 안전하게)
클라우드가 자신의 부분을 마치면, 아주 작은 암호화된 답변 조각을 당신의 기기로 보냅니다. 그러면 당신의 기기는 자신의 추측과 클라우드의 조각을 결합하여 최종 답변을 만듭니다. 그들이 협력하고 있기 때문에, 문장 전체가 쓰여질 때까지 기다릴 필요가 없습니다. 그들은 병렬적으로 "추측"하고 검토할 수 있습니다. 안전을 유지하기 위해, 그들 사이를 오가는 모든 데이터는 특별한 자물쇠(AES-GCM 암호화)로 암호화됩니다. 따라서 해커가 엿듣더라도 그저 의미 없는 글자들로만 보이게 됩니다.
결과: 더 빠르고, 더 작고, 더 안전하게
연구진은 이 시스템의 프로토타입을 제작하여 다양한 유형의 기기에서 테스트했습니다: 단순한 CPU만 있는 표준 컴퓨터(기본 사무용 PC), 그래픽 카드가 있는 강력한 컴퓨터(GPU), 그리고 작은 임베디드 장치(스마트 온도 조절기나 자동차 컴퓨터 같은 것)입니다.
그들은 이 형사와 사서 팀이 기존의 방식보다 훨씬 빠르다는 것을 발견했습니다.
- 속도: 단순히 모델을 절반으로 나누기만 한 "나이브(naive)"한 분할 시스템과 비교했을 때, 이 새로운 방법은 GPU 장치에서 각 단어를 생성하는 데 걸리는 시간을 최대 46.1% 줄였습니다. 표준 CPU에서도 여전히 29.4% 더 빨랐습니다.
- 데이터 절약: 꼭 필요한 답변 부분만을 전송하기 때문에, 클라우드로부터 돌아오는 데이터의 양이 영어(더 작은 단어 집합을 사용하는)를 사용할 때 최대 67.6% 감소했습니다.
- 품질: 가장 중요한 점은 답변의 품질이 여전히 우수하다는 것입니다. 이 시스템은 전체 클라우드 모델이 단독으로 했을 때와 98.6% 동일한 답변을 생성했습니다. 미세한 차이는 주로 작은 기기에 맞추기 위해 수학적 계산을 약간 단순화했기 때문입니다.
이 시스템이 아닌 것
이 논문이 주장하는 바가 아닌 것을 이해하는 것이 중요합니다. 저자들은 이것이 클라우드를 완전히 눈멀게 만드는 마법의 방패가 아니라는 점을 매우 명확히 하고 있습니다. 클라우드는 여전히 "특징 텐서(feature tensors, 비밀 코드)"와 "드래프트 토큰(draft tokens, 추측값)"을 봅니다. 만약 아주 영리한 해커가 많은 추가 지식을 가지고 역설계(reverse-engineer)를 시도한다면, 입력값에 대해 무언가를 알아낼 수도 있습니다. 이 논문은 이것이 "차분 프라이버시(differential privacy, 엄격한 수학적 정의의 프라이버시)"에 대한 공식적인 보장이 아님을 명시하고 있습니다. 대신, 이것은 실용적인 시스템 수준의 보호 계층을 제공합니다. 이것은 클라우드가 당신의 가공되지 않은 일기장을 보는 것을 훨씬 어렵게 만들지만, 적절한 도구를 갖춘 초정밀 탐정으로부터 일기장을 완전히 보이지 않게 만드는 것은 아닙니다.
또한, 이 논문은 당신의 휴대폰에서 이 거대한 뇌 전체를 그냥 실행할 수 있다는 아이디어를 배제합니다. 대부분의 소비자용 기기에게 수학적 계산은 여전히 너무 무겁습니다. "엔드포인트 전용(endpoint-only)" 솔루션(휴대폰이 모든 것을 수행하는 방식)은 협업 방식에 비해 훨씬 느리고 품질이 낮은 답변을 생성했습니다.
이것이 왜 중요한가
이 논문은 우리가 빠르고 똑똑한 AI와 프라이버시가 보장되는 AI 사이에서 하나를 선택할 필요가 없음을 시사합니다. 기기와 클라우드를 팀으로 취급하여, 기기가 대화의 가장 민감한 부분에 대한 열쇠를 보유하게 함으로써, 우리는 두 가지 장점을 모두 얻을 수 있습니다. 이 시스템은 당신이 가진 기기가 강력한 게이밍 PC이든 작은 자동차 칩이든 상관없이 그에 맞춰 적응하며, 이를 통해 프라이버시가 보호되고 빠른 AI 채팅을 현실적인 가능성으로 만듭니다. 저자들은 통제된 실험실 환경에서 이러한 결과를 측정했으며, 수치가 유망해 보이지만, 실제 세상의 복잡하고 예측 불가능한 환경에서도 이 기능이 얼마나 잘 유지될지는 앞으로의 과제입니다. 하지만 현재로서는, 이것은 당신의 비밀을 존중하는 똑똑한 비서를 향한 큰 진전입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.