From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs
본 논문은 워크로드를 연산 및 메모리 트래픽 구성 요소로 분해함으로써, 직접적인 하드웨어 측정 없이도 투명하고 재현 가능한 에너지 평가를 가능하게 하는, NVIDIA H100 GPU 상의 LLM 추론 에너지 소비량을 추정하기 위한 경험적으로 보정된 분석적 방법론을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 거대한, 북적이는 도서관이라고 상상해 보세요. 그곳에서는 수백만 명의 사람들이 마법 같은 사서(인공지능)에게 이야기를 써달라거나, 수학 문제를 풀어달라거나, 뉴스를 요약해 달라고 끊임없이 요청하고 있습니다. 오랫동안 우리는 이 사서가 기술을 익히는 데 얼마나 많은 "두뇌 능력(학습)"이 필요한지에 대해서만 걱정해 왔습니다. 하지만 이제 사서는 매일 수백만 개의 질문에 답하며 쉬지 않고 일하고 있습니다. 이 지속적인 작업은 엄청난 양의 전기를 사용하며, 이는 지구에 해롭습니다. 과학자와 엔지니어들의 큰 고민은 바로 이것입니다. "질문 하나에 실제로 얼마나 많은 에너지가 드는가?" 문제는 직접적으로 에너지를 측정하는 것이 마치 허리케인 속에서 날아다니는 모래 한 알의 무게를 재는 것과 같다는 점입니다. 이를 위해서는 대부분의 사람들이 갖추지 못한 특수하고 비싼 센서와 완벽한 조건이 필요합니다. 에너지 비용을 추측할 방법이 없다면, 어떤 AI가 더 "친환경적"인지, 혹은 특정 방식으로 질문하는 것이 전력을 낭비하고 있는지 알기 어렵습니다.
"토큰에서 와트시까지(From Tokens to Watt-hours)"라는 제목의 이 논문은 전력계를 꽂지 않고도 이 퍼즐을 풀 수 있는 영리한 방법을 제시합니다. 저자들인 대학과 기술 기업의 연구진은 AI가 사용하는 에너지를 단지 AI의 크기와 대화의 길이를 보고 추정할 수 있는 수학적 "계산기"를 만들었습니다. 이것은 AI의 영양 성분표와 같습니다. 칼로리를 세는 대신 "와트시(에너지 단위)"를 세는 것입니다. 그들은 이 계산기를 오늘날 가장 똑똑한 AI들을 구동하는 엔진인 NVIDIA H100이라는 강력한 컴퓨터 칩으로 테스트했습니다.
이 계산기가 어떻게 작동하는지 간단한 비유를 통해 설명해 보겠습니다. AI를 주방의 요리사라고 상상해 보세요. 요리(답변 생성)를 하기 위해 요리사는 두 가지 일을 합니다. 레시피를 읽고 재료를 모으는 것(이것이 "연산" 부분입니다), 그리고 향신료와 도구를 챙기기 위해 식료품 저장실을 왔다 갔다 하는 것(이것이 "메모리" 부분입니다)입니다. 연구진은 짧은 주문의 경우 요리사가 주로 요리에 집중하기 때문에 에너지 비용이 주로 요리에 달려 있다는 것을 발견했습니다. 하지만 길고 복잡한 주문의 경우, 요리사가 식료품 저장실을 너무 자주 왔다 갔다 해야 해서 돌아다니는 데 드는 에너지가 비용의 대부분을 차지하게 됩니다.
논문은 에너지 비용을 두 단계로 나눕니다:
- "프리필(Prefill)" 단계: 요리사가 고객의 주문(입력 프롬프트)을 읽는 단계입니다. 여기서의 에너지 비용은 주문이 얼마나 긴지에 따라 달라집니다.
- "디코드(Decode)" 단계: 요리사가 답변을 한 단어씩 써 내려가는 단계입니다. 여기서의 에너지 비용은 답변이 얼마나 긴지에 따라 달라집니다.
연구진은 에너지 비용이 단순히 AI의 크기(재료 또는 파라미터의 개수)에 의해서만 결정되는 것이 아님을 발견했습니다. 그것은 대화가 얼마나 길어지는지에 따라서도 크게 달라집니다. 그들은 답변이 길어질수록 에너지가 단순히 직선적으로 증가하는 것이 아니라, 급격하게 곡선을 그리며 상승한다는 것을 발견했습니다. 왜 그럴까요? AI가 새로운 단어를 쓸 때마다 문맥을 파악하기 위해 이전의 모든 단어들을 다시 살펴봐야 하기 때문입니다. 마치 요리사가 소금을 한 꼬집 넣을 때마다 전체 레시피를 다시 읽어야 하는 것과 같습니다. 레시피가 길어질수록 더 많이 왔다 갔다 해야 하며, 더 많은 에너지가 낭비됩니다.
이 팀은 자신들의 공식을 사용하여, 작은 AI(약 0.3 tỷ 파라미터)는 요청당 약 0.001 와트시의 매우 적은 에너지를 사용하는 반면, 거대한 AI(120 tỷ 파라미터)는 동일한 작업에 약 0.15 와트시의 훨씬 많은 에너지를 사용한다는 것을 계산했습니다. 또한 그들은 700억 파라미터 모델에 대해 자신들의 추정치가 다른 과학자들이 측정한 실제 측정값과 매우 근접(5% 이내 오차)하다는 것을 보여줌으로써, 직접 전력을 측정할 수 없을 때도 이 "계산기"가 충분히 신뢰할 만하다는 것을 입증했습니다.
논문은 이 도구가 전력계로 전기를 측정하는 것을 완벽하게 대체할 수는 없다고 명시적으로 밝히고 있습니다. 이 도구는 에어컨, 인터넷 케이블 또는 데이터 센터의 다른 컴퓨터들이 사용하는 에너지를 계산하지 않습니다. 오직 생각을 수행하는 특정 칩이 사용하는 에너지만을 계산합니다. 그러나 저자들은 이 칩의 에너지가 엔지니어들이 제어할 수 있는 가장 큰 부분이라고 주장합니다.
그렇다면 이것이 미래에 무엇을 의미할까요? 논문은 우리가 에너지를 아끼고 싶다면 단순히 더 큰 AI를 만드는 데 그쳐서는 안 된다고 제안합니다. 대신, "레시피"를 더 짧게 만들거나(입력 압축), 더 짧은 답변을 요구하거나, 간단한 작업을 위해 더 작고 전문화된 요리사를 사용해야 합니다. 저자들은 이 계산기가 개발자들이 서로 다른 AI 모델을 비교하고 더 에너지 효율적인 모델을 선택할 수 있도록 도와, 모든 컴퓨터에 전력계를 설치하지 않고도 더 "푸른" 디지털 세상을 만드는 데 기여하기를 희망합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.