← 최신 논문
🤖 machine learning

DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs

이 논문은 퇴역한 중고 하드웨어로 구축된 128-GPU 클러스터가 LLaMA-70B와 같은 대규모 언어 모델을 경제적으로 서비스할 수 있음을 입증하는 동시에, 그 환경적 지속 가능성은 구형 GPU의 더 높은 에너지 소비를 상쇄하기 위해 저탄소 전력을 사용하는 지역에 배치되는 것에 엄격히 부속된다는 점을 보여준다.

원저자: Zeyu Cao, Xuan Guo, Cheng Zhang, Cheuk Hang Lau, Ilia Shumailov, Yiren Zhao

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zeyu Cao, Xuan Guo, Cheng Zhang, Cheuk Hang Lau, Ilia Shumailov, Yiren Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현재 인공지능의 세계는 복잡한 언어 모델을 학습시키고 실행하는 엔진 역할을 하는 GPU라고 불리는 거대한 컴퓨터 칩에 의해 추진력을 얻으며 빠르게 전진하고 있습니다. 이러한 모델들은 이야기를 쓰고, 문제를 해결하며, 대화를 나눌 수 있지만, 엄청난 양의 컴퓨팅 파워를 요구합니다. 이를 따라잡기 위해 데이터 센터는 하드웨어를 끊임없이 업그레이드하며, 더 빠르고 새로운 칩을 위한 공간을 만들기 위해 기능적으로는 여전히 작동하는 칩들을 퇴역시킵니다. 이 순환 과정은 성능은 괜찮지만 '오래된' 가속기들이 쌓여가는 결과물을 남기며, 이 폐기된 부품들이 원래 가격의 아주 적은 부분으로 판매되는 2차 시장을 형성합니다. 연구자들과 엔지니어들이 직면한 과제는 이 퇴역한 기계들이 현대적인 AI 작업을 수행하기 위해 생산적인 제2의 삶을 부여받을 수 있는지, 아니면 그 노후화로 인해 너무 비효율적이고 낭비적이어서 쓸모가 없는지를 판단하는 것입니다.

한 연구팀은 오직 중고 부품만을 사용하여 처음부터 거대한 컴퓨팅 클러스터를 구축함으로써 이 질문에 답하고자 했습니다. 그들은 단순히 중고 그래픽 카드를 구매한 것이 아니라, 사용된 프로세서, 메모리, 메인보드, 그리고 네트워킹 장비를 조달하여 128개의 퇴역한 NVIDIA V100 GPU로 구성된 시스템을 구축했습니다. "덤스터클러스터(DumpsterCluster)"라고 명명된 이 컬렉션은 오래된 하드웨어가 대규모 언어 모델, 특히 LLaMA-70B로 알려진 700억 개의 파라미터를 가진 모델을 실행하는 무거운 작업량을 처리할 수 있는지 테스트하기 위해 설계되었습니다. 연구팀은 이 클러스터를 실제 사용자 요청을 처리하는 실제 환경에서 1년 동안 운영하며, 이 접근 방식이 경제적으로 실용적이고 환경적으로 지속 가능한지를 확인했습니다. 그들의 연구 결과는 놀라운 잠재력을 보여주었으나, 여기에는 엄격한 조건이 따랐습니다. 즉, 하드웨어는 작동할 수 있지만, 그 성공 여부는 전적으로 그것이 어디에 배치되고 어떻게 관리되느냐에 달려 있다는 것입니다.

이 접근 방식의 경제적 사례는 매우 인상적입니다. 연구진은 128개의 GPU 시스템 전체를 약 22,000달러에 조립했는데, 이는 연구 기간 동안 시장 가치 하락으로 인해 32,000달러에서 낮아진 가격입니다. 이와 대조적으로, 최신 세대 GPU 8개만 탑재된 현대적인 시스템은 약 600,000달러의 비용이 듭니다. 이러한 막대한 초기 비용의 차이 덕분에, 개별 칩은 비록 덜 강력할지라도 그 압도적인 숫자가 클러스터가 상당한 양의 데이터를 처리할 수 있게 해줍니다. 팀은 1년 동안 시스템을 운영함으로써 대규모 언어 모델을 효과적으로 서비스할 수 있음을 입증했으며, 텍스트 생성 속도는 최신형 슈퍼 칩보다는 느렸지만 많은 실용적인 응용 분야에 충분한 수준임을 보여주었습니다. 이 작업을 성공시키는 핵심은 단순히 부품을 사는 것이 아니라, 그것을 구동하는 소프트웨어를 다시 쓰는 데 있었습니다.

이 모델들을 실행하기 위한 표준 소프트웨어는 칩 사이의 연결이 매우 빠른 최신 하드웨어에 맞춰 설계되어 있습니다. 덤스터클러스터의 오래된 V100 칩들은 연결 속도가 느리고 메모리가 적어, 평소라면 대규모 모델을 처리하다가 병목 현상이 발생할 것입니다. 이를 해결하기 위해 연구진은 작업이 분할되는 방식을 변경하는 맞춤형 엔진을 개발했습니다. 칩들이 서로 끊임없이 통신하도록 강요하는 대신, 각 칩이 계산의 특정 섹션을 담당하여 결과를 줄줄이 전달하는 긴 체인 형태로 모델을 배치했습니다. 또한, 그래픽 칩이 계속 작동하는 동안 컴퓨터의 중앙 프로세서가 백그라운드에서 데이터 전송을 처리하도록 최적화하여 시스템이 유휴 상태로 머무는 것을 방지했습니다. 이 전략을 통해 128개의 오래된 칩은 단일 칩에는 아예 담을 수 없는 규모의 모델을 실행할 수 있는 하나의 응집된 단위로서 기능할 수 있었습니다.

그러나 이 연구는 이 솔루션이 AI 산업의 에너지 및 환경 문제에 대한 보편적인 해결책은 아님을 밝혀냈습니다. 연구진은 초기 비용은 낮지만, 기계를 운영하는 데 드는 시간당 비용은 전기 가격과 전력원에 크게 좌우된다는 것을 발견했습니다. 오래된 칩은 최신 칩보다 에너지 효율이 낮아 동일한 양의 텍스트를 생성하는 데 더 많은 전력을 소비합니다. 만약 이 클러스터가 화석 연료를 사용하는 지역에서 가동된다면, 생성된 단어당 발생하는 총 탄소 배출량은 새로운 효율적인 시스템을 사용할 때보다 수십 배 더 높을 수 있습니다. 하드웨어를 재사용함으로써 얻는 환경적 이점은 사용하는 전기가 더러울 경우 완전히 상쇄됩니다. 이 시스템은 풍력이나 수력 발전에 의존하는 지역처럼 풍부하고 저렴하며 깨끗한 에너지가 있는 곳에 위치할 때만 진정으로 지속 가능해집니다. 그러한 특정 지역에서는 저렴한 전기 요금이 낡은 칩의 비효율성을 상쇄하여, 총 소유 비용을 낮추고 탄소 발자국을 관리 가능한 수준으로 유지해 줍니다.

하드웨어의 신뢰성 또한 팀이 관리해야 했던 과제였습니다. 1년 동안 클러스터는 수많은 기술적 결함을 겪었지만, 그 대다수는 물리적 수리가 아닌 간단한 재시작으로 해결할 수 있는 소프트웨어 오류였습니다. 칩이나 부품이 실제로 고장 나는 진정한 하드웨어 장애는 드물었으며, 발생 빈도는 14% 미만이었습니다. 이는 세심한 테스트와 실패를 대비한 약간의 추가 용량을 갖춘다면, 중고 하드웨어도 생산용으로 사용하기에 충분히 신뢰할 수 있음을 시사합니다. 연구진은 이 시스템이 새로운 모델을 처음부터 학습시키기보다는 질문에 답하고 텍스트를 생성하는 데 가장 적합하다고 언급했습니다. 모델 학습에는 다른 종류의 컴퓨팅 파워와 안정성이 필요하기 때문입니다.

궁극적으로, 이 논문은 퇴역한 기술에 제2의 삶을 부여하는 것이 가능하다는 것을 보여주지만, 이것이 단순히 오래된 부품을 꽂기만 하면 되는 문제는 아님을 보여줍니다. 이러한 "덤스터클러스터"의 성공은 공학, 경제학, 그리고 지리학의 섬세한 균형에 달려 있습니다. 이는 노후화된 하드웨어의 한계를 극복하기 위한 특화된 소프트웨어, 운영 비용과 배출량을 낮게 유지하기 위한 저렴하고 깨끗한 전력을 갖춘 위치, 그리고 최신 시스템에 비해 다소 높은 유지보수율을 감수하는 태도를 요구합니다. 이러한 조건들이 충족될 때, 이 접근 방식은 끊임없이 새로운 칩을 제조하는 막대한 재정적, 환경적 비용 없이 AI 역량을 확장할 수 있는 실행 가능한 경로를 제공합니다. 이는 우리가 적절한 도구를 적절한 에너지원과 결합할 의지만 있다면, 컴퓨팅 하드웨어의 수명을 연장할 수 있는 미래를 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →