MinT: Managed Infrastructure for Training and Serving Millions of LLMs
MinT는 단일 대형 베이스 모델을 상주시키면서 경량 어댑터 수정판을 동적으로 관리함으로써 밀집 및 MoE 아키텍처 전반에서 확장성, 메모리 효율성, 배포 속도의 상당한 개선을 달성하면서 수백만 개의 LoRA 기반 LLM 정책의 효율적인 학습과 서빙을 가능하게 하는 관리형 인프라 시스템입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한, 매우 비싼 도서관의 책들 (Base Model) 을 운영한다고 상상해 보세요. 이 책들은 엄청나게 크고, 한 방을 가득 채우며, 이동하기 매우 어렵습니다.
과거의 방식대로라면, 책에 새로운 기술을 가르치고 싶을 때—예를 들어 수학 문제를 풀거나 법적 계약을 작성하는 법—책 전체를 복사하고, 여백에 새로운 메모를 적은 뒤, 그 무거운 새 복사본 전체를 다른 방으로 옮겨 사람들에게 보여줘야 했습니다. 1,000 가지의 서로 다른 기술을 가르치고 싶다면, 1,000 권의 무거운 책 복사본이 필요해 공간을 엄청나게 차지하고 이동하는 데 막대한 시간과 노력이 들었습니다.
MinT(MindLab Toolkit) 는 이 게임을 바꿉니다. MinT 는 책 전체를 옮기는 대신 이렇게 말합니다: "무거운 책은 도서관에 그대로 두어 잠가 두세요. 새로운 기술들은 작고 가벼운 스티커 메모 (LoRA 어댑터라고 부릅니다) 에 적어두겠습니다."
MinT 가 어떻게 작동하는지 세 가지 간단한 개념으로 나누어 설명해 드리겠습니다.
1. "스티커 메모" 시스템 (축소)
100 파운드의 백과사전을 옮기는 대신, 1 온스짜리 스티커 메모만 옮깁니다.
- 과거의 방식: 모델을 업데이트하려면 메모를 책에 다시 합쳐 새로운 무거운 파일을 만들어야 합니다. 이를 저장하고 이동하는 데는 시간이 매우 오래 걸립니다.
- MinT 방식: 무거운 책 (Base Model) 은 컴퓨터 메모리에 그대로 두세요. 새로운 기술을 학습할 때는 작은 스티커 메모만 저장하면 됩니다.
- 결과: "업데이트"를 이동하는 속도가 놀라울 정도로 빠릅니다. 해당 논문은 중간 크기의 모델의 경우 스티커 메모만 이동하는 것이 책 전체를 이동하는 것보다 18 배 빠르고, 거대 모델의 경우 거의 3 배 빠르다고 밝혔습니다. 벽돌을 우편으로 보내는 대신 문자 메시지를 보내는 것과 같습니다.
2. "전환 스테이션" (확대)
한 번에 하나의 무거운 책만 보관할 수 있는 거대하고 복잡한 기계 (슈퍼컴퓨터) 가 있다고 상상해 보세요.
- 문제: 보통 5 가지 다른 정책 버전 (예: 수학용, 코딩용, 법률용) 을 학습하려면 각각 무거운 책 복사본을 보관하는 5 대의 기계가 필요합니다. 이는 돈 낭비입니다.
- MinT 해결책: MinT 는 지능형 전화 교환대처럼 작동합니다. 무거운 책을 기계에 로드해 둔 채로, "수학" 버전을 학습할 때는 "수학" 스티커 메모를 끼우고, "코딩" 시간이 되면 그 메모를 빼고 "코딩" 메모를 끼웁니다.
- 결과: 더 많은 컴퓨터가 필요 없이 같은 기계에서 여러 다른 "정책"을 학습할 수 있습니다. 논문은 이 방식이 40 억 파라미터 모델의 경우 학습 속도를 1.77 배 높였고, 300 억 파라미터 모델의 경우 1.45 배 높였으며, 추가 메모리 없이도 가능했다고 밝혔습니다.
3. "지능형 카탈로그" (확장)
백만 개의 서로 다른 스티커 메모가 있는 도서관이 있지만, 독서 책상에는 한 번에 몇 개만 놓을 공간이 있다고 상상해 보세요.
- 문제: 사용자가 특정 스티커 메모를 요청했는데 책상에 없다면, 저장고로 가서 찾아와야 합니다. 1,000 명의 사람이 1,000 개의 서로 다른 메모를 동시에 요청하면 저장고가 막히고 모든 사람이 긴 줄을 서서 기다리게 됩니다.
- MinT 해결책: MinT 는 지능형 배송 서비스처럼 이를 조직화합니다.
- 카탈로그: 백만 개의 서로 다른 스티커 메모 (정책) 를 추적할 수 있습니다.
- 캐시: 가장 인기 있는 메모들은 책상 근처 선반 (CPU 캐시) 에 보관하여 즉시 사용할 수 있게 합니다.
- "패킹" 트릭: 때때로 스티커 메모는 수천 개의 아주 작은 조각 (퍼즐 조각과 같은) 으로 이루어져 있습니다. MinT 는 이 조각들을 책상으로 보내기 전에 하나의 깔끔한 패키지로 붙여줍니다. 배송 트럭이 37,000 번 멈춰서 작은 퍼즐 조각을 집어올 필요가 없고 한 상자만 집어 올리면 되므로 배송 속도가 8.5 배 빨라집니다.
큰 그림
MinT 는 본질적으로 AI 학습을 위한 관리자입니다. 거대한 파일들을 이동시키며 시간과 돈을 낭비하지 않도록 막아줍니다. 대신 무거운 "두뇌" (Base Model) 는 한 곳에 두고, 여기에 연결되는 수천 개의 작은 "기술" (어댑터) 을 관리합니다.
- 학습을 위해: 전체 두뇌를 다시 로드하지 않고도 서로 다른 기술 사이를 빠르게 전환할 수 있게 합니다.
- 서비스를 위해: 사용자에게 수백만 개의 서로 다른 기술을 제공하되, 정확히 그 순간 필요한 것만 로드하고 시스템을 막히지 않도록 합니다.
간단히 말해: 코끼리를 옮기지 말고, 마우스만 옮기세요. MinT 는 기반이 이동할 필요 없이 공유된 고가의 기반 위에서 수백만 개의 서로 다른 AI 개성을 실행할 수 있게 해줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.