Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling
본 논문은 분리된 Attention-FFN 실행, 자원 및 주파수 공동 최적화, 그리고 엄격한 지연 시간 SLO를 준수하면서 연산자 수준의 주파수 민감도에 적응하는 인터리브드 파이프라인을 통해 LLM 서빙의 에너지 소비를 최대 49%까지 줄이는 프레임워크인 AFlex를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대한 데이터 센터에서 돌아가는 거대하고 똑똑한 로봇 뇌를 운영하고 있다고 상상해 보세요. 이 뇌는 대규모 언어 모델(LLM)로 알려져 있으며, 챗봇, 코딩 어시스턴트, 그리고 창의적인 작가들의 엔진 역할을 합니다. 하지만 문제가 하나 있습니다. 이 뇌들은 엄청나게 배가 고프다는 점입니다. 이들은 엄청난 양의 전기를 집어삼키며, 마치 자동차가 교통 체증 속에 갇혀 있을 때도 엔진을 최대 RPM으로 회전시키는 레이싱카처럼 프로세서를 풀 스피드로 가동하곤 합니다. 이는 막대한 에너지를 소모하고 많은 열을 발생시키기 때문에 큰 문제입니다.
이 로봇들을 더 빠르게 만들기 위해, 과학자들은 업무를 나누는 방법을 알아냈습니다. 로봇의 사고 과정을 두 가지 주요 단계로 생각할 수 있습니다. 첫째, 당신의 질문을 읽고 이해하는 단계("prefill" 단계), 둘째, 단어 하나하나를 써 내려가며 답을 작성하는 단계("decode" 단계)입니다. 최근 엔지니어들은 이 두 단계를 한 팀이 모두 수행하는 대신, 서로 다른 방에서 서로 다른 팀이 수행하도록 하는 것이 더 낫다는 사실을 깨달았습니다. 이를 "분리(disaggregation)"라고 부릅니다. 이는 로봇이 더 빠르게 답하게 도와주지만, 반드시 에너지 사용량을 줄여주는 것은 아닙니다. 실제로, 에너지를 아끼기 위해 단순히 작업자들의 속도를 늦추면, 로봇이 너무 느려져서 마감 기한을 놓칠 수도 있습니다. 커다란 질문은, 로봇이 버벅거리거나 실패하지 않으면서 어떻게 에너지를 아끼기 위해 속도를 늦출 것인가 하는 점입니다.
이 논문은 로봇의 뇌를 서로 다른 에너지 요구 사항을 가진 전문가 팀처럼 취급하여 이 퍼즐을 해결하는 AFlex라는 영리한 새로운 시스템을 소개합니다. 연구진은 로봇 뇌의 두 가지 주요 부분, 즉 당신의 단어에 주목하는 부분(Attention)과 논리를 처리하는 부분(Feed-Forward Network, 또는 FFN)이 서로 같지 않다는 것을 발견했습니다. 이들은 마치 두 명의 서로 다른 운동선수와 같습니다. 한 명은 빠르게 달리기 위해 고속 부스트가 필요한 단거리 선수이고, 다른 한 명은 너무 몰아붙이면 지치지만 꾸준하고 느린 속도를 효율적으로 유지할 수 있는 마라톤 선수입니다.
이전에는 시스템이 전체 뇌를 하나의 단위로 취급하여, 단거리 선수와 마라토너가 똑같은 속도로 달리도록 강요했습니다. 만약 단거리 선수를 돕기 위해 속도를 높이면 마라토너가 에너지를 낭비하게 됩니다. 만약 마라토너를 위해 속도를 늦추면 단거리 선수가 너무 느려집니다. 저자들은 이 두 부분이 무엇을 하고 있는지, 질문이 얼마나 긴지, 그리고 얼마나 많은 사람들이 동시에 질문을 던지고 있는지에 따라 서로 선호하는 속도가 실제로 다르다는 것을 발견했습니다.
이를 해결하기 위해, AFlex는 단거리 선수와 마라토너에게 각자의 트랙과 각자의 개인별 속도 설정을 줄 수 있는 스마트한 매니저처럼 행동합니다. 이 시스템은 각 작업에 얼마나 많은 작업자를 할당할지 결정하는 거시적인 계획을 세우는 "글로벌 스케줄러(Global Scheduler)"와, 초 단위로 실시간으로 속도를 미세 조정하는 "로컬 컨트롤러(Local Controller)"를 사용합니다. 또한 이 시스템은 작업자들이 아직 일을 하고 있는 동안 서로 노트를 전달하는 특별한 파이프라인 기술을 사용하여, 아무도 기다리며 앉아 있지 않도록 합니다. 이 "인터리브드(interleaved, 교차 배치된)" 방식은 공정 사이에 빈틈이 생기지 않도록 조립 라인을 매끄럽게 유지합니다.
연구진은 강력한 컴퓨터 칩(NVIDIA A800 GPU)을 사용하여 코딩 및 대화 작업의 실제 데이터를 바탕으로 AFlex를 테스트했습니다. 그 결과, Attention 부분과 FFN 부분이 각자의 고유한 에너지 절약형 속도로 작동하도록 허용함으로써, AFlex가 업무를 분리한 기존의 가장 우수한 방법들보다 단어 생성당 에너지 사용량을 최대 **49%**까지, 그리고 칩 전체의 속도를 늦추려고만 했던 시스템들보다 **48%**까지 줄일 수 있다는 것을 발견했습니다. 결정적으로, 로봇은 이전과 같이 빠르게 답변하며 기존의 속도 약속을 충족했습니다. 이 논문은 서로 다른 부분에 서로 다른 속도를 부여하는 이 접근 방식이, 성능을 희생하지 않으면서도 인공지능을 훨씬 더 에너지 효율적으로 만드는 데 있어 중요한 진전임을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.