← 최신 논문
💬 NLP

Ada-MK: Adaptive MegaKernel Optimization via Automated DAG-based Search for LLM Inference

Ada-MK는 컴파일 시간 DAG 기반 탐색과 메모리 분할을 통해 런타임 동적 스케줄링을 제거하고 공유 메모리 사용량을 줄이는 새로운 최적화 프레임워크로, NVIDIA GPU 기반의 상용 온라인 광고 시스템에서 MegaKernels 을 최초로 산업적으로 배포하여 vLLM 대비 최대 50.2% 의 처리량 향상을 달성합니다.

원저자: Wenxin Dong, Mingqing Hu, Guanghui Yu, Qiang Fu, Peng Xu, Hui Xu, Yue Xing, Xuewu Jiao, Shuanglong Li, Lin Liu

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wenxin Dong, Mingqing Hu, Guanghui Yu, Qiang Fu, Peng Xu, Hui Xu, Yue Xing, Xuewu Jiao, Shuanglong Li, Lin Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 거대한 온라인 스토어 (검색 엔진이나 광고 플랫폼과 같은) 를 위한 초고속 배송 서비스를 운영한다고 상상해 보세요. 고객이 질문을 할 때마다 시스템은 단어 단위로 응답을 생성해야 합니다. 대규모 언어 모델 (LLM) 의 세계에서는 이를 '추론 (inference)'이라고 부릅니다.

문제는 생성되는 단어 하나하나마다 컴퓨터가 그래픽 카드 (GPU) 에 수천 개의 작은 명령을 전송해야 한다는 점입니다. 이는 배송 기사가 우체국에 들러 소포를 받고, 창고로 운전해 가서 내리고, 다시 돌아오는 일을 문장 하나를 위해 수천 번 반복해야 하는 것과 같습니다. 이러한 '중단과 재개' 오버헤드는 엄청난 시간을 낭비합니다. 전체 이동 시간의 약 15% 가 실제로 물건을 배송하는 것이 아니라 이러한 작은 정지에만 소요되는 것입니다.

핵심 아이디어: '메가커널 (MegaKernel)'
이를 해결하기 위해 연구자들은 **메가커널 (MegaKernel)**이라는 개념을 고안했습니다. 매번 작은 작업마다 우체국에 들르는 대신, 출발 시 필요한 모든 것을 싣고 전체 경로를 정차 없이 주행한 뒤 마지막에 모든 것을 내리는 초효율 배송 트럭을 상상해 보세요. 이는 모든 작은 정지를 하나의 거대하고 연속적인 여정으로 융합합니다. 이로써 '중단과 재개' 지연이 제거됩니다.

그러나 함정이 하나 있습니다. 해당 회사 (NVIDIA Ada/L20) 가 사용하는 트럭 (GPU) 의 특정 유형은 더 작고, 최신의 더 화려한 트럭 (Hopper/Blackwell) 에 비해 운전석의 저장 공간이 적습니다.

  • 과거 해결책 1 (수동 튜닝): 전문가들이 이 특정 작은 운전석을 위해 맞춤형 트럭을 수동으로 구축했습니다. 이는 빨랐지만, 화물 (AI 모델) 이나 도로 (하드웨어) 를 변경하면 트럭이 고장 났습니다. 이식성이 없었습니다.
  • 과거 해결책 2 (자동 튜닝): 주행 중에 화물 공간을 자동으로 조정할 수 있는 트럭을 만들려고 시도했습니다. 하지만 운전자는 주행 중에 계속 지도를 확인하고 결정을 내려야 했습니다 ("선반이 꽉 찼나요? 멈춰야 하나요?"). 이러한 지속적인 결정은 트럭 속도를 늦췄는데, 밀리초 단위로 배송해야 할 때 이는 용납할 수 없었습니다.

새로운 해결책: Ada-MK
이 논문의 저자들은 더 작은 'Ada' 트럭을 위해 이러한 문제들을 해결하는 새로운 시스템 Ada-MK를 개발했습니다. 간단한 비유를 사용하여 그들이 어떻게 했는지 설명합니다:

1. '스마트 포장' 전략 (적응형 공유 메모리)

작은 트럭에는 작은 저장 공간 (공유 메모리) 이 있습니다. 너무 많이 실으려고 하면 트럭이 멈춥니다.

  • 혁신: 전체 여행 가방을 작은 공간에 넣으려 하지 않고, 가방을 반으로 잘랐습니다 (K 차원 분할). 절반의 물품만 포장해 배송한 뒤, 나머지 절반을 포장합니다.
  • 결과: 이는 필요한 최대 저장 공간을 50% 줄였습니다. 또한 한 개의 소포를 내린 직후 빈 공간을 다음 소포를 실는 데 즉시 재사용하는 방법을 찾아내어, 트럭이 공간이 부족하다는 이유로 대기하며 멈추지 않도록 했습니다.

2. '미리 계획된 경로' (오프라인 DAG 검색)

과거의 '자동 튜닝' 트럭들은 주행 중에 결정을 내렸기 때문에 교통 체증 (분기 패널티) 을 유발했습니다.

  • 혁신: 팀은 트럭이 차고지를 떠나기 전에 수백만 가지 가능한 경로를 시뮬레이션할 수 있는 강력한 컴퓨터를 사용했습니다. 모든 회전과 정지를 상세한 다이어그램 (DAG) 으로 매핑했습니다.
  • 결과: 최적의 경로가 찾아지면 이를 '고정'했습니다. 운전자는 주행 중에 생각하거나 지도를 확인할 필요가 없으며, 미리 계획된 경로를 완벽하게 따르기만 하면 됩니다. 이로써 모든 의사결정 지연이 제거되어 주행이 매우 매끄럽고 빨라졌습니다.

3. '하이브리드 함대' (이종 엔진)

그들은 여행의 일부 구간 (시작 시 대량의 소포를 적재하는 'Prefill') 에서는 기존 표준 트럭이 실제로 더 낫다는 것을 깨달았습니다. 하지만 최종 배송 (단어 단위로 생성하는 'Decode') 에는 그들의 새로운 메가커널 트럭이 더 우수했습니다.

  • 혁신: 그들은 하이브리드 시스템을 구축했습니다. 시작 시의 무거운 작업에는 표준 트럭을 유지하되, 최종 배송 단계에서는 새로운 메가커널 트럭으로 원활하게 교체했습니다.
  • 결과: 시작 시의 고속과 마무리 시의 초저지연이라는 양쪽 세계의 장점을 모두 얻게 되었습니다. 전체 배송 네트워크를 다시 구축할 필요 없이요.

실제 영향

이 팀은 바이두의 상업용 온라인 광고 시스템에서 이를 테스트했습니다.

  • 속도: 속도가 중요한 시나리오 (작은 배치, 짧은 응답) 에서 그들의 시스템은 표준 업계 도구보다 최대 23.6% 빠르고, 인기 있는 오픈소스 도구인 vLLM 보다 50.2% 빨랐습니다.
  • 신뢰성: 다양한 유형의 AI 모델과 작업에서 일관되게 작동했습니다.
  • 최초의 사례: 이는 '메가커널'이 실제 라이브 상업용 광고 시스템에 성공적으로 배포된 첫 번째 사례입니다.

요약
이 논문은 특정 소형 컴퓨터 칩에서 AI 챗봇과 광고 시스템을 훨씬 더 빠르게 만드는 방법을 설명합니다. 그들은 데이터를 더 효율적으로 포장하고, 운전자가 결코 생각할 필요가 없도록 전체 배송 경로를 미리 계획하며, 새로운 고속 배송 방법을 기존 도구와 혼합함으로써 이를 달성했습니다. 그 결과, 특히 많은 사용자가 질문을 하나씩 할 때 답변을 훨씬 더 빠르게 전달하는 시스템이 탄생했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →