Maia 200: A Software Defined Dataflow System for Large-scale AI Acceleration
이 논문은 스레드 중심에서 데이터 이동 중심으로 컴퓨팅 방식을 전환하기 위해 새로운 소프트웨어 정의 로컬 액세스 데이터플로우 아키텍처(SDLA)를 활용함으로써, 대규모 AI 추론 워크로드에 대해 막대한 병렬성과 상당한 비용 절감을 제공하는 고성능, 에너지 효율적 AI 가속기인 Maia 200을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨팅의 세계는 현재 시를 쓰고, 복잡한 수학 문제를 풀며, 간단한 설명으로부터 이미지를 생성할 수 있는 새로운 종류의 소프트웨어에 의해 거대한 변화를 겪고 있습니다. 대규모 언어 모델(LLM)로 알려진 이러한 시스템은 이를 실행하기 위해 엄청난 양의 컴퓨팅 파워를 필요로 합니다. 수년 동안 업계는 데이터를 중앙의 '두뇌'가 처리하기를 기다리는 명령의 흐름처럼 취급하는 특정 방식의 칩 구조에 의존해 왔습니다. 그러나 이러한 모델이 점점 더 커지고 복고적으로 변함에 따라, 이 전통적인 방식은 한계에 부딪히고 있습니다. 칩은 실제로 수학 연산을 수행하기보다 데이터가 도착하기를 기다리는 데 너무 많은 시간을 소비하고 있으며, 이는 시스템을 구축하고 운영하는 데 믿기 힘들 정도로 막대한 비용을 들게 하고 엄청난 양의 전력을 소비하게 만듭니다. 핵심 과제는 더 이상 수학을 더 빠르게 만드는 것만이 아니라, 데이터 자체를 얼마나 더 효율적으로 이동시키느냐 하는 것입니다.
마이크로소프트의 연구진은 Maia 200이라 불리는 칩을 통해 이 문제를 해결하기 위한 새로운 접근 방식을 도입했습니다. 그들은 기존의 사고방식을 억지로 작동시키려 노력하는 대신, 컴퓨터 칩이 정보를 처리하는 근본적인 규칙을 바꾸는 설계를 고안했습니다. 그들은 이 새로운 설계를 "소프트웨어 정의 로컬 액세스 데이터플로(Software Defined Locally Accessed Dataflow)" 아키텍처라고 부릅니다. 쉽게 말해, 이 칩은 중앙의 명령이 다음 동작을 지시하기를 기다리지 않고, 데이터가 필요한 곳에 정확히, 필요한 시점에 정확히 전달되도록 설계되었습니다. 연구진은 이 방식이 이전 설계들보다 훨씬 더 빠른 속도와 에너지 효율로 계산을 수행할 수 있음을 입증했으며, 이는 현재 업계의 발목을 잡고 있는 막대한 비용과 에너지 페널티 없이 차세대 인공지능을 구동할 수 있는 해결책을 제시합니다.
이것이 왜 중요한지 이해하려면 현대 컴퓨터가 보통 어떻게 작동하는지를 살펴봐야 합니다. 수십 년 동안 표준 설계는 중앙 프로세서가 대형 공유 메모리 뱅크에서 데이터를 가져와 작업을 수행한 뒤 다시 보내는 방식이었습니다. 이 방식은 많은 작업에 유용하지만, 인공지능에 필요한 거대하고 반복적인 계산에는 병목 현상을 일으킵니다. 프로세서는 데이터가 칩을 가로질러 이동하기를 기다리며 유휴 상태로 머물게 됩니다. 마이크로소프트 팀은 이러한 특정 유형의 워크로드의 경우, 가장 효율적인 경로는 단일 중앙 통제관을 두는 것이 아니라 데이터 자체에 명령을 부여하는 것이라는 점을 깨달았습니다. 그들은 데이터의 이동이 명시적으로 프로그래밍되는 시스템을 만들었으며, 이를 통해 칩의 각 부분이 독립적이고 병렬적으로 작동할 수 있게 했습니다. 이는 실행 스레드를 관리하는 것에서 정보의 흐름 자체를 관리하는 것으로 초점을 전환한 것입니다.
Maia 200 칩은 이러한 아이디어를 물리적으로 구현한 결과물입니다. 이 칩은 1,400억 개 이상의 트랜지스터를 포함하는 거대한 실리콘 조각으로, 인공지능 추론(학습된 모델을 사용하여 답을 생성하는 과정)의 중책을 맡도록 설계되었습니다. 칩은 메모리를 수학 연산을 수행하는 부분 바로 옆에 위치한 작고 특화된 포켓들로 나누는 독특한 내부 구조를 가지고 있습니다. 이는 하나의 거대한 메모리 풀을 갖는 전통적인 설계로부터 의도적으로 벗어난 것입니다. 데이터를 사용되는 곳 가까이에 둠으로써, 칩은 실리콘을 가로지르는 장거리 이동과 관련된 에너지 낭비와 시간 지연을 피합니다. 연구진은 이 설계가 전력 제한 범위 내에서 이전에는 불가능하다고 여겨졌던 성능 수준을 달고할 수 있으며, 750와트의 에너지 예산 내에서 막대한 양의 컴퓨팅 파워를 제공한다는 것을 발견했습니다.
Maia 200을 진정으로 차별화하는 것은 데이터의 이동을 처리하는 방식입니다. 기존 시스템에서 컴퓨터는 종-종 프로세서가 다음에 필요할 것이라고 예상되는 데이터를 자동으로 저장하는 작은 고속 메모리인 '캐시(cache)'에 의존합니다. 이는 범용 컴퓨팅에는 잘 작동하지만, 마이크로소프트 팀은 인공지능의 예측 가능하고 반복적인 패턴에는 자동 캐싱이 오히려 비효율적이라는 것을 발견했습니다. 자동 캐싱은 속도를 늦추는 복잡성과 오버헤드를 추가합니다. 대신, Maia 200은 프로그래머가 칩에 데이터의 이동 위치와 시점을 명시적으로 알려주는 시스템을 사용합니다. 이것이 프로그래밍을 더 어렵게 만들 것처럼 들릴 수도 있지만, 연구진은 전문가들이 최대 속도가 필요할 때 데이터 이동을 완전히 제어할 수 있으면서도 일반적인 작업에는 더 단순한 도구를 제공할 수 있는 새로운 소프트웨어 계층을 설계했습니다. 이 접근 방식은 자동화된 시스템이 따라올 수 없는 정밀함을 칩에 부여하여, 프로세서의 모든 부분이 풀 가동되어 일할 수 있도록 유지합니다.
또한 이 칩은 대규모 클러스터 내의 다른 칩들과 원활하게 작동하도록 설계되었습니다. 인공지능 모델은 종종 너무 커서 단일 칩에 담을 수 없으며, 수천 개의 칩이 함께 작동해야 합니다. Maia 200은 칩 내에서 데이터를 이동시키는 것만큼이나 쉽게 다른 칩들과 데이터를 주고받을 수 있도록 칩 내부에 직접 구축된 정교한 네트워크를 포함하고 있습니다. 연구진은 이 시스템이 수천 개의 칩을 연결하여 초당 퀸틸리언(quintillion) 번의 계산을 수행할 수 있는 슈퍼컴퓨터를 구축할 수 있음을 입증했습니다. 그들은 수십억 개의 파라미터를 가진 대규모 언어 모델을 포함한 실제 인공지능 모델로 이 시스템을 테스트했으며, 하드웨어의 이론적 최대치의 70% 이상 속도로 텍스트를 생성할 수 있음을 확인했습니다. 이는 새로운 아키텍처가 이론에서만 작동하는 것이 아니라 실제의 복잡한 시나리오에서도 효과적으로 작동한다는 것을 보여주는 중요한 성과입니다.
연구의 가장 중요한 발견 중 하나는 비용과 에너지에 미치는 영향입니다. 연구팀은 이 새로운 설계를 사용함으로써 다른 가용 가속기들과 비교했을 때 대규모 인공지능 시스템의 총 소유 비용(TCO)을 30% 줄이고 에너지 소비를 15% 절감할 수 있다고 계산했습니다. 에너지 요금이 주요 관심사가 되고 컴퓨팅 파워에 대한 수요가 기하급수적으로 증가하는 산업 환경에서 이러한 절감은 매우 상당한 수치입니다. 연구진은 칩을 더 작게 만들거나 제조 비용을 낮춤으로써가 아니라, 시스템 전체가 본연의 업무를 더 효율적으로 수행하게 함으로써 이를 달성했습니다. 불필요한 데이터 이동에 소모되는 시간과 에너지를 제거함으로써, 칩은 더 적은 전력으로 더 많은 일을 수행합니다.
Maia 200은 우리가 미래를 위한 컴퓨터를 어떻게 구축해야 하는지에 대한 중요한 진전을 나타냅니다. 이 칩은 모든 것을 관리하는 단일 중앙 브레인이라는 오래된 개념에서 벗어나, 데이터가 전문화된 작업자들의 네트워크를 통해 자유롭고 효율적으로 흐르는 모델을 수용합니다. 연구진은 데이터 이동을 제어하고 필요한 곳에 메모리를 배치함으로써, 더 빠르고 저렴하며 에너지 효율적인 시스템을 구축할 수 있음을 보여주었습니다. 인공지능이 계속 진화하고 더 많은 전력을 요구함에 따라, Maia 200과 같은 설계는 지속 가능하고 확장 가능한 길을 제시합니다. 이 연구는 고성능 컴퓨팅의 미래가 단순히 수학을 더 빠르게 만드는 것이 아니라, 데이터 자체가 어떻게 관리되고 이동되는지를 재고하는 데 있다는 것을 입증합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.