The Hidden Cost of Thinking: Energy Use and Environmental Impact of LMs Beyond Pretraining
본 논문은 현대 언어 모델 개발의 환경적 영향이 사후 훈련 실험과 복잡한 추론 파이프라인에 의해 지배받으며, 이는 전체 연산량의 82.2% 를 차지하고 추론 모델을 지시 조정 모델보다 사후 훈련 비용이 17 배 더 들게 만들어 현재 환경 보고 표준에서 보고되지 않은 중요한 격차를 드러낸다고 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
"생각의 숨은 비용"이라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 정리합니다.
큰 그림: AI 비용의 빙산
완벽한 케이크 (지능형 AI 모델) 를 굽기 위해 거대하고 첨단 기술이 집약된 공장을 짓는다고 상상해 보세요. 오랫동안 사람들은 최종 케이크를 굽는 데 사용된 전기량만 계산하여 라벨에 표시해 왔습니다.
이 논문은 이것이 물 위에 드러난 빙산의 꼭대기 부분만 세는 것과 같다고 주장합니다. 저자들은 물속으로 들어가 빙산 전체를 측정했습니다. 그 결과, 최종 모델을 "굽는" 과정은 사실 이야기의 아주 작은 부분에 불과하다는 것을 발견했습니다. 진정한 에너지, 탄소 배출량, 그리고 물 사용량은 처음에 케이크를 굽는 방법을 찾아내는 거칠고 실험적인 과정에서 발생합니다.
1. "생각"하는 모델은 에너지를 많이 소비합니다
연구자들은 Olmo 3라는 새로운 AI 모델 계열을 연구했습니다. 그들은 두 가지 유형의 모델을 구축했습니다.
- "지시 (Instruct)"모델: 명령을 잘 따릅니다 (도움이 되는 비서처럼).
- "생각 (Think)"모델: 단계를 거쳐 "생각"함으로써 복잡한 문제를 해결합니다 (증명을 풀어가는 수학자처럼).
비유:
"지시"모델은 단거리 주자라고 상상해 보세요. 짧은 경주를 뛰고 결승점에 도달합니다. 반면 "생각"모델은 길고 중간중간 퍼즐을 풀며 멈추는 마라토너입니다.
- 결과: "생각"모델을 훈련시키는 데는 "지시"모델보다 17 배 더 많은 에너지가 필요했습니다.
- 이유: "생각"모델은 추론하는 법을 배우기 위해 방대한 양의 "연습 주행" (롤아웃이라고 함) 을 생성해야 합니다. 마치 좋은 에세이 한 편을 쓰기 위해 100 편의 연습 에세이를 써야 하는 학생과 같습니다. 논문은 이를 "생각의 비용"이라고 부릅니다.
2. "숨겨진" 비용: 시행착오
이 논문에서 가장 큰 놀라움은 개발 비용에 관한 것입니다.
- 옛 믿음: 대부분의 에너지는 최종 훈련 실행 (최종 시험) 에 사용된다고 생각했습니다.
- 새로운 현실: 총 에너지의 **82%**가 실험에 사용되었습니다. 여기에는 최종 모델이 구축되기 전의 실패한 시도, 다양한 설정 테스트, 그리고 다양한 데이터 혼합물을 시도해 보는 과정이 포함됩니다.
비유:
새로운 시그니처 요리를 개발하려는 셰프를 생각해 보세요.
- 최종 요리: 고객에게 서빙되는 요리 (최종 모델).
- 개발 과정: 셰프가 100 개의 냄비에 수프를 태우고, 50 개의 쿠키 배치를 버리며, 20 가지의 다른 향신료 혼합물을 맛보아 마침내 제대로 만드는 과정.
- 논문의 주장: 고객에게 서빙된 한 가지 최종 요리를 만드는 데 사용된 전기량만 계산한다면, 주방에서 태워진 100 개의 냄비 수프를 무시하는 것입니다. 논문은 현대 AI 의 경우 "태워진 수프" (실패한 실험) 가 최종 요리보다 5 배 더 많은 비용을 들인다고 밝혔습니다.
3. 물 문제: 데이터 센터의 잘못이 아닙니다
이 논문은 물 사용량도 조사했습니다. 연구 결과, 이 과정은 한 사람이 140 년 동안 마실 수 있는 양에 해당하는 막대한 물을 사용했습니다.
비유:
많은 사람들이 AI 가 물을 사용하는 이유는 컴퓨터가 뜨거워져서 자동차 라디에이터처럼 물로 냉각해야 하기 때문이라고 생각합니다.
- 현실: 데이터 센터는 물을 냉각 과정에서 잃지 않는 "폐쇄 순환 (closed-loop)" 시스템을 사용했습니다.
- 진짜 범인: 물은 컴퓨터를 구동하는 전기를 생산하는 데 사용되었습니다. 발전소 (석탄, 가스, 원자력) 는 AI 를 구동하는 데 필요한 전력을 생산하기 위해 막대한 양의 물을 사용합니다.
- 교훈: 물을 절약하려면 더 나은 컴퓨터를 만드는 것만으로는 부족하며, 그 컴퓨터에 전력을 공급하는 전기 생산 방식을 바꿔야 합니다.
4. 총 청구서
연구자들이 최종 훈련, 실패한 실험, 데이터 생성, 그리고 하드웨어 제조를 모두 합산했을 때, Olmo 3 모델을 구축하는 데 든 총비용은 다음과 같습니다.
- 에너지: 약 1,230 만 킬로와트시 (미국 가정 847 가구에 1 년 동안 전력을 공급할 수 있는 양).
- 탄소: 약 4,251 톤의 이산화탄소.
- 물: 약 1,588 만 7,000 리터.
왜 이것이 중요한가
이 논문은 현재 AI 의 환경적 영향을 보고하는 방식이 잘못되었다고 결론 내립니다. 우리는 단지 "최종 실행" 비용만 보고하고 있어, 문제가 실제보다 훨씬 작게 보이게 만듭니다.
AI 모델이 더 지능화되어 더 많은 "생각" (추론) 을 필요로 하고, 개발 과정이 더 복잡해짐에 따라 이러한 숨겨진 비용은 급증할 것입니다. 저자들은 개발자들에게 "태워진 수프"를 숨기는 것을 멈추고, 마지막 한 끼 식사뿐만 아니라 전체 부엌의 전체 비용을 보고하기 시작하라고 요구하고 있습니다.
간단히 말해: 지능형 AI 를 구축하는 것은 비용이 많이 들지만, 그것을 어떻게 구축할지 찾아내는 과정이 그보다 더 비용이 많이 들며, "생각"하는 모델이 그중에서도 가장 에너지를 많이 소비합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.