← 최신 논문
🤖 machine learning

Energy Scaling Laws for Diffusion Models: Quantifying Compute in Image Generation

본 논문은 추론을 텍스트 인코딩, 노이즈 제거, 디코딩 구성 요소로 분해하여 확산 모델의 GPU 에너지 소비를 정확하게 예측하는 적응형 카플란 스케일링 법칙을 제안하며, 노이즈 제거가 에너지 사용량을 지배함을 입증하고 지속 가능한 AI 계획을 위한 신뢰할 수 있는 아키텍처 간 추정을 가능하게 합니다.

원저자: Aniketh Iyengar, Jiaqi Han, Boris Ruf, Vincent Grari, Marcin Detyniecki, Stefano Ermon

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aniketh Iyengar, Jiaqi Han, Boris Ruf, Vincent Grari, Marcin Detyniecki, Stefano Ermon

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 여러분은 매우 비싸고 고성능인 주방 로봇 (GPU) 을 가지고 있으며, 이 로봇은 지저분한 재료 더미를 완벽한 사진처럼 사실적인 케이크 (이미지) 로 변신시킬 수 있습니다. 이 로봇은 케이크를 한 번에 굽는 것이 아니라, 식감이 딱 맞게 하기 위해 수십 번씩 반죽을 하고, 맛을 보고, 조절하고, 다시 반죽하는 과정을 반복해야 합니다. 이것이 **확산 모델 (Diffusion Models)**이 이미지를 생성하는 방식입니다.

문제는 이 로봇이 전기를 많이 소비한다는 것입니다. 케이크가 더 복잡할수록 (해상도가 높을수록) 그리고 반죽을 반복하는 횟수가 더 많을수록 (단계가 더 많을수록) 전기 요금이 더 비싸집니다.

이 논문은 이러한 이미지 생성 로봇을 위한 스마트 에너지 계산기와 같습니다. 저자들은 다음과 같은 간단한 질문을 던지고자 했습니다. "케이크의 크기, 로봇의 종류, 또는 반죽 횟수를 변경하면, 로봇을 실제로 가동하지 않고도 정확히 얼마나 전기를 사용할지 예측할 수 있을까?"

다음은 일상적인 비유를 통해 정리한 그들의 연구 결과입니다:

1. 에너지의 "레시피" (스케일링 법칙)

저자들은 언어 모델 세계에서 유명한 규칙 ( 카플란 스케일링 법칙, Kaplan Scaling Laws라고 함) 을 가져와 이미지 생성에 맞게 적용했습니다. 이 규칙은 다음과 같은 보편적인 레시피와 같습니다: "로봇이 하는 일이 많을수록, 소비하는 에너지도 많아진다."

그들은 이미지 생성 로봇들에게 있어 이 관계가 거의 완벽하게 직선적임을 발견했습니다. 로봇이 수행해야 하는 수학 연산량 ( FLOPs라고 함) 을 두 배로 늘리면, 사용하는 에너지도 대략 두 배가 됩니다. 이는 자동차를 운전하는 것과 같습니다: 두 배 더 멀리 운전하면 두 배 더 많은 가스를 소비하는 것과 마찬가지입니다.

2. "반죽"이 가장 많은 에너지를 소모합니다

로봇이 케이크를 만들 때 세 가지 단계가 있습니다:

  1. 주문 읽기 (텍스트 인코딩): 어떤 케이크를 원하는지 읽는 과정.
  2. 반죽하기 (반복적 노이즈 제거): 실제 베이킹 과정으로, 노이즈를 제거하는 작업.
  3. 케이크 장식하기 (디코딩): 최종 이미지를 완성하는 과정.

이 논문은 **2 단계 (반죽하기)**가 가장 많은 에너지를 소모한다는 사실을 발견했습니다. 전체 사용 에너지의 90% 이상을 차지합니다. 로봇은 주문을 읽거나 케이크를 장식하는 데 시간을 보내는 것이 아니라, 반복적인 반죽 과정에 거의 모든 시간과 전력을 쏟습니다. 이것이 에너지 요금이 매우 높은 이유입니다. 로봇은 단일 이미지를 생성하기 위해 반죽을 10 회에서 50 회까지 반복해야 하기 때문입니다.

3. "로봇 모델"은 생각만큼 중요하지 않습니다

연구자들은 네 가지 다른 유형의 로봇 (Stable Diffusion 2, Stable Diffusion 3.5, Flux, Qwen) 과 세 가지 다른 유형의 주방 (NVIDIA A100, A4000, A6000 GPU) 에서 이 규칙을 테스트했습니다.

여기가 놀라운 부분입니다: 이 규칙은 모두에게 적용됩니다.

  • "Flux" 로봇이 사용하는 에너지 양을 안다면, "Qwen" 로봇이 사용할 에너지 양도 같은 수학을 통해 예측할 수 있습니다. 비록 두 로봇의 구조가 다르더라도 말입니다.
  • 전문 데이터 센터용 로봇 (A100) 을 사용하든 고급 워크스테이션용 로봇 (A6000) 을 사용하든 상관없습니다. "수행된 작업"과 "사용된 에너지" 사이의 관계는 일관되게 유지됩니다.

이는 토요타를 운전하든 포드를 운전하든, 같은 거리를 같은 속도로 운전한다면 대략 같은 양의 연료를 소비한다는 사실을 발견한 것과 같습니다. 연료 비용을 알기 위해 도로 위의 모든 차를 테스트할 필요는 없습니다. 거리와 속도만 알면 됩니다.

4. 요금을 변화시키는 "조절 나사"들

이 논문은 로봇의 조절 나사를 돌렸을 때 어떤 일이 일어나는지도 살펴보았습니다:

  • 해상도 (크기): 이미지를 256x256 에서 1024x1024 로 크게 만드는 것은 로봇에게 컵케이크 대신 거대한 웨딩 케이크를 굽도록 요청하는 것과 같습니다. 에너지 비용이 급격히 증가합니다.
  • 정밀도 (정확도): "float32"(초정밀) 를 사용하는 것과 "float16"(표준 정밀도) 을 사용하는 것은 로봇에게 주방 저울 대신 미세한 저울로 재료를 측정하도록 요청하는 것과 같습니다. 초정밀 모드는 훨씬 더 많은 에너지를 소비합니다 (경우에 따라 약 7 배까지).
  • 단계 (반죽 횟수): 로봇에게 10 회 대신 50 회 반죽하도록 요청하는 것은 10 분 대신 1 시간 동안 반죽을 저어달라고 요청하는 것과 같습니다. 에너지 비용은 선형적으로 증가합니다.

5. 이것이 중요한 이유 ("그래서 뭐?"라는 질문)

이 논문이 나오기 전까지, 한 회사가 백만 명의 사용자를 위한 이미지 생성기를 가동하는 데 얼마나 비용이 들지 알고 싶다면, 실제로 시스템을 가동하고 전력계를 측정해야 했습니다. 이는 동전을 던져 전기 요금을 추측하는 것과 같았습니다.

이제 그들은 예측 도구를 갖게 되었습니다.

  • 기획자를 위해: 회사는 "우리가 이 새로운 로봇으로 전환하고 4K 이미지를 요청한다면, 로봇을 먼저 구매하지 않고도 정확히 얼마만큼의 전기가 필요한지"를 알 수 있습니다.
  • 환경을 위해: 이는 AI 의 "탄소 발자국"을 이해하는 데 도움이 됩니다. 논문은 고품질 이미지 하나를 생성하는 데 드는 에너지가 일반적인 텍스트 기반 AI 채팅 (예: 챗봇에 질문하기) 10 회분과 같을 수 있다고 지적합니다.

요약

이 논문은 이미지 생성에서의 에너지 소비가 예측 가능하다는 것을 증명합니다. 이는 간단한 수학 규칙을 따릅니다: 더 많은 수학 연산 = 더 많은 에너지. 이 규칙을 이해함으로써 우리는 더 잘 계획하고, 적절한 장비를 선택하며, 디지털 아트를 생성하는 환경적 비용을 파악할 수 있습니다. 이를 위해 단 하나의 테스트도 실행할 필요가 없습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →