HYDRA: A Heterogeneous Chiplet DSE Framework for Serving Dynamic Hybrid LLM Workloads
본 논문은 하이브리드 트랜스포머-맘바(Transformer-Mamba) 대규모 언어 모델 서빙을 위한 처리량과 지연 시간을 대폭 개선하기 위해 이종 칩렛 아키텍처와 동적 런타임 정책을 공동으로 최적화하는 포괄적인 설계 공간 탐색 프레임워크인 HYDRA를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 세계는 이야기를 쓰고, 문제를 해결하며, 대화를 나눌 수 있는 새로운 종류의 디지털 지능인 대규모 언어 모델을 기반으로 움직이고 있습니다. 이러한 시스템은 매우 방대해져서 이를 구동하기 위해 설계된 컴퓨터 칩들이 따라잡기에 급급한 상황입니다. 수년간 업계는 모든 작업을 처리하기 위해 단 하나의 거대한 프로세서에 의존해 왔으나, 이러한 모델들이 점점 더 복잡해짐에 따라 그 방식은 한계에 부착하고 있습니다. 칩은 제작하기에 너무 비싸지고, 냉각하기에는 너무 뜨거워지며, 수백만 명의 사용자를 동시에 지원하는 데 필요한 혼란스러운 작업의 조합을 관리하기에는 단순히 너무 느려지고 있습니다. 이를 해결하기 위해 엔지니어들은 컴퓨터를 '칩렛(chiplet)'이라 불리는 더 작고 전문화된 조각들로 나누는 모듈형 접근 방식에 주목하고 있습니다. 엔진, 변속기, 연료 탱크가 하나의 변경 불가능한 금속 블록이 아니라, 교체하거나 재배치할 수 있도록 최적화된 개별 모듈인 고성능 차량을 상상해 보십시오. 이를 통해 더 유연하고 효율적인 시스템을 구축할 수 있지만, 이 조각들을 정확히 어떻게 배치하고 조각들 사이의 데이터 흐름을 어떻게 관리할 것인가를 결정하는 것은 매우 어려운 퍼즐이 됩니다.
연구진은 이 퍼즐을 풀기 위해 HYDRA라는 새로운 프레임워크를 개발했습니다. 이는 모듈형 칩들이 어떻게 조립될 수 있는지, 그리고 실행되는 동안 어떻게 관리되어야 하는지를 탐색하기 위해 설계된 정교한 도구입니다. 문제는 가능한 배열의 수가 너무 방대하여 강력한 컴퓨터를 사용하더라도 하나씩 모두 테스트하려면 수년이 걸린다는 점입니다. 게다가 이 모델들이 수행하는 작업은 일정하지 않으며, 사용자가 무엇을 요청하느냐에 따라 끊임없이 변합니다. 때로는 긴 문서를 빠르게 읽어야 하고, 때로는 답변을 단어 하나하나 생성해야 합니다. 이러한 서로 다른 단계들은 서로 다른 자원을 요구하며, 사용자로부터 들어오는 요청의 조합은 예측할 수 없습니다. 만약 시스템이 완벽하게 조정되지 않는다면, 에너지를 낭비하고 시간을 허비하여 사용자들이 답변을 기다리게 만듭니다.
HYDRA 팀은 모든 가능성을 일일이 테스트하지 않고도 이 복잡성을 헤쳐 나갈 수 있는 방법을 만들어냈습니다. 모든 가능한 설계의 모든 세부 사항을 시뮬레이션하는 대신, 이들은 빠르고 스마트한 추정기(estimator)를 구축했습니다. 이 도구는 숙련된 항해사처럼 잠재적인 설계의 풍경을 빠르게 스캔하여 가장 유망한 경로를 찾아냅니다. 이는 시스템이 활동 상태 사이를 어떻게 이동하는지에 기반한 수학적 접근 방식을 사용하여, 몇 주가 아닌 몇 분 만에 성능을 예측할 수 있게 해줍니다. 일단 이 도구가 최적의 후보들을 식별하면, 연구진은 그 선택된 후보들에 대해서만 상세하고 느린 시뮬레이션을 실행하여 예상대로 작동하는지 확인합니다. 이 2단계 과정 덕분에 연구진은 이전에는 다루기 너무 컸던 설계 공간을 탐색하여, 이전에는 명확히 드러나지 않았던 방식으로 속도와 효율성의 균형을 맞추는 구성을 찾아낼 수 있었습니다.
이 탐색의 결과는 매우 유의미합니다. 연구진이 자신들의 최적 설계안을 가장 진보된 기존 시스템들과 비교 테스트했을 때, 새로운 접근 방식이 동일한 시간 내에 1.55배 더 많은 작업을 처리할 수 있음을 발견했습니다. 동시에 사용자가 첫 단어를 받기까지 걸리는 시간은 거의 절반으로 줄었습니다. 특정 시나리오에서는 개선 효과가 더욱 극적으로 나타나, 이전 방식보다 두 배 이상의 작업량을 처리하기도 했습니다. 이러한 성과는 하드웨어와 이를 구동하는 소프트웨어의 세심한 공동 설계(co-design)에서 비롯되었습니다. 연구진은 단순히 더 많은 전력을 추가하는 것만으로는 충분하지 않으며, 시스템이 적절한 조각들을 필요한 데이터 근처에 배치하도록 구성되어야 하고, 소프트웨어가 작업 유형이 바뀔 때 자원을 즉각적으로 전환할 수 있을 만큼 유연해야 한다는 것을 발견했습니다.
이 연구의 핵심적인 발견은 물리적 구성 요소의 배치가 구성 요소 자체만큼이나 중요하다는 점입니다. 연구진은 서로 얼마나 많이 통신하는지에 따라 실리콘 보드 위에 서로 다른 칩렛들을 배치하는 전략을 개발했습니다. 자주 통신하는 조각들을 더 가깝게 그룹화함으로써, 데이터가 시스템을 가로질러 이동하는 시간을 단축했습니다. 이러한 통신 인지적 배치(communication-aware placement)는 사용자 요청을 그룹화하는 동적인 방식과 결래 결합되어 시스템을 훨씬 더 매끄럽게 작동하게 했습니다. 소프트웨어는 단순히 전체 요청 배치가 도착할 때까지 기다렸다가 작업을 시작하는 것이 아니라, 자원이 자유로워지는 즉시 새로운 요청을 받아들여 시스템이 지속적으로 바쁘고 효율적으로 돌아가도록 유지합니다. 이러한 유연성은 다음 사용자 그룹을 기다리는 동안 시스템이 유휴 상태로 머물러 있는 것을 방지하는 데 매우 중요합니다.
또한 이 연구는 특정 유형의 모델이 변경될 경우 이러한 설계들이 얼마나 잘 작동할지도 조사했습니다. 연구진은 특정 모델에 최적화된 구성들을 다른 서로 다른 모델들에 대해 테스트했습니다. 그 결과, 단 하나의 특정 모델을 위해 구축된 설계는 다른 모델을 실행하도록 요청받았을 때 성능이 저하되었습니다. 그러나 다양한 모델의 혼합을 처리하도록 최적화된 설계는 각자의 작업에 대해 특화된 설계만큼이나 우수한 성능을 보이면서도, 새로운 미지의 모델을 마주했을 때 견고함을 유지했습니다. 이는 여러 사용자와 애플리케이션을 서비스하기 위한 시스템의 경우, 고도로 특화된 설계보다는 유연하고 범용적인 설계가 더 가치 있다는 것을 시사합니다. 이는 시스템이 지원하는 인공지능의 유형이 진화하더라도 효율성을 유지할 수 있도록 안전망을 제공합니다.
궁극적으로 이 작업은 대규모 언어 모델을 실행하는 미래가 하드웨어 아키텍처와 소프트웨어 관리의 파트너십에 달려 있음을 보여줍니다. 단순히 더 빠른 칩을 만든다고 해서 문제가 해결될 것이라 기대해서는 안 되며, 그 칩을 통해 정보의 흐름을 관리하는 더 스마트한 방법 또한 구축해야 합니다. HYDRA 프레임워크는 이러한 공동 설계의 청사진을 제공하며, 조각들이 어떻게 서로 맞물리는지 그리고 실시간으로 어떻게 관리되는지를 신중하게 고려함으로써 훨씬 더 빠르고 효율적인 시스템을 구축할 수 있음을 보여줍니다. 연구진은 미래의 인공지능을 뒷받침할 차세대 컴퓨팅 시스템의 발전을 가속화하기 위해 자신들의 도구를 공개하였습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.