Energy Efficiency of Locally Deployed LLMs: A Preliminary Quantitative GPU Power Benchmark on Consumer Hardware
이 논문은 소비자용 RTX 4060Ti GPU에서 9개의 오픈 소스 LLM을 대상으로 한 정량적 벤치마크를 제시하며, 에너지 효율성이 파라미터 수보다는 모델 아키텍처와 양자화에 의해 더 크게 좌우된다는 점을 밝히고, gemma3 및 llama3.2와 같은 1B 모델이 가장 낮은 토큰당 에너지 비용을 달착하는 반면 7B-Mistral과 같은 더 큰 모델은 현저히 더 많은 에너지를 소비한다는 것을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 방금 당신의 컴퓨터 안에 살면서 질문에 답하고, 이야기를 쓰고, 당신의 비밀을 거대한 클라우드 서버로 보내지 않고도 코딩을 도와줄 수 있는 아주 똑똑한 로봇 친구를 만들었다고 상상해 보세요. 이것이 바로 사람들이 프라이버시와 속도를 원함에 따라 폭발적으로 증가하고 있는 '로컬(local)' 인공지능의 세계입니다. 하지만 여기에는 함정이 있습니다. 이 똑똑한 로봇들은 에너지를 갈구한다는 점입니다. 우리는 거대한 슈퍼컴퓨터에서 이 거대한 AI 두뇌를 훈련시키는 데 엄청난 양의 전기가 사용된다는 것(마치 작은 도시 하나를 하루 동안 가동하는 것과 같은 수준)을 이미 알고 있었지만, 일반적인 가정용 컴퓨터에서 이들과 단순히 '대화'하는 데 얼마나 많은 에너지가 드는지에 대해서는 잘 알지 못했습니다. 이는 자동차가 고속도로를 달릴 때 연비가 나쁘다는 것은 알지만, 운전자와 대화를 나누는 동안 주차장에서 공회전할 때 연료를 얼마나 태우는지에 대해서는 전혀 모르는 것과 같습니다. 더 많은 사람들이 자신의 노트북이나 게이밍 PC에서 AI 비서를 실행하기 시작함에 따라, 이 '활성(active)' 에너지 청구량을 이해하는 것은 당신의 지갑과 지구 모두에게 실질적인 관심사가 되고 있습니다.
이 지점에서 독일 FH 아헨 응용과학대학교의 연구팀이 나섰습니다. 그들은 인기 있는 무료 오픈 소스 AI 모델 중 어떤 것이 표준 소비자용 그래픽 카드, 구체적으로는 하이엔드 게이밍 PC에서 흔히 볼 수 있는 NVIDIA RTX 4060 Ti에서 실행될 때 가장 '에너지 효율적'인지 알아보고 싶었습니다. 그들은 단순히 "어떤 모델이 가장 좋은 답변을 주는가?"라고 묻는 대신, "어떤 모델이 전기를 가장 적게 마시면서 가장 좋은 답변을 주는가?"라고 물었습니다. 그들은 10억 개의 파라미터를 가진 아주 작은 모델부터 70억 개의 파라미터를 가진 더 큰 모델에 이르기까지 9가지의 서로 다른 오픈 소스 AI 모델에 "프랑스의 수도는 어디인가요?"와 같은 간단한 사실부터 코드를 작성하거나 깊은 개념을 설명하는 복잡한 작업에 이르기까지 고정된 15개의 질문 세트를 입력하는 통제된 실험을 설정했습니다.
연구원들은 nvidia-smi라는 도구를 사용하여 그래픽 카드가 작동하는 동안 초당 두 번씩 전력 소비량을 확인하며 에너지 탐정이 되었습니다. 결정적으로, 그들은 단순히 총 전력을 측정한 것이 아니라, AI의 사고 과정에 드는 정확한 에너지를 분리하기 위해 그래픽 카드의 기본 '유휴(idle)' 전력을 신중하게 뺐습니다. 그들의 주요 목표는 단 하나의 단어(또는 '토큰')를 생성하는 데 총 얼마만큼의 에너지(줄, Joules)가 드는지 계산하는 것이었습니다. 그들의 연구 결과는 규모가 크다고 해서 항상 좋은 것은 아니라는 점을 시사합니다. 실제로, 아주 작은 모델들인 gemma3:1b와 llama3.2:1b가 효율성의 챔피언으로 나타났습니다. 이 작은 강자들은 단 하나의 단어를 생성하는 데 불과 0.56 줄의 에너지를 사용했으며, 초당 170단어 이상의 텍스트를 쏟아낼 수 있었습니다.
반면, 70억 개의 파라미터를 가진 더 큰 모델인 Mistral은 훨씬 덜 효율적이었으며, 가장 효율적인 작은 모델보다 단어당 최대 4.4배 더 많은 에너지를 소비했습니다. 또한 연구는 기묘한 놀라움을 발견했는데, qwen3.5:2b 모델 중 하나가 프롬프트당 놀라울 정도로 높은 에너지를 사용했다는 점입니다. 연구진은 이것이 모델이 느려서가 아니라, 말을 하기 전에 답변을 계획하기 위해 '확장된 추론(extended reasoning)'이라는 기술을 사용하는 등 내부적으로 '생각'하고 있었기 때문이라고 설명했습니다. 이는 최종 출력이 짧더라도 추가적인 에너지를 태운다는 것을 보여줍니다. 이는 단순히 전체 질문에 대한 총 에너지를 살펴보는 것이 오해를 불러일일 수 있음을 강조하며, 진정한 효율성 지표는 각 토큰을 생성하는 데 드는 에너지라는 것을 보여줍니다. 궁극적으로, 이 논문은 자신의 하드웨어에서 AI를 실행하려는 사람들에게 가장 에너지 효율적인 선택은 반드시 가장 강력하거나 가장 큰 모델이 아니라, 주어진 작업에 적합한 구조와 크기를 가진 모델이라는 점을 시사하며, 때로는 가장 작은 두뇌가 가장 친환경적이라는 것을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.