← 최신 논문
🤖 machine learning

Tevatron Meets Megatron: Expert-Parallel LLM Reranker Training on an Academic Budget

이 논문은 대규모 MoE 리랭커의 효율적인 전문가 병렬 학습을 가능하게 하기 위해 Megatron-Core를 통합한 학술적 예산 친화적 프레임워크인 Tevatron 3.0을 소개하며, 이를 통해 30B 파라미터 규모의 MoE 모델이 더 적은 파라미터를 활성화하면서도 밀집형(dense) 8B 모델의 품질에 필적하고 더 높은 추론 처리량을 달성할 수 있음을 입증한다.

원저자: Zhichao Xu, Xueguang Ma, Shengyao Zhuang, Luyu Gao, Wenqian Ye, Yu Wang, Jamie Callan, Jimmy Lin

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhichao Xu, Xueguang Ma, Shengyao Zhuang, Luyu Gao, Wenqian Ye, Yu Wang, Jamie Callan, Jimmy Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한, 혼란스러운 건초더미 속에서 특정한 바늘 하나를 찾는 상황을 상상해 보십시오. 컴퓨터 과학의 세계에서 이것은 "검색(search)"이라고 불립니다. 먼저, 컴퓨터는 수천 개의 가능한 바늘을 잡기 위해 넓은 그물을 던집니다 (이것은 "검색/리트리벌(retrieval)" 단계입니다). 하지만 그 그물은 지저분해서, 많은 양의 짚과 몇 개의 잘못된 바늘까지 함께 잡아옵니다. 이를 해결하기 위해, 두 번째의 더 똑똑한 컴퓨터가 개입하여 각 후보를 면밀히 살펴보고 어떤 것이 진짜 바늘인지 결정합니다. 이 두 번째의 세심한 단계가 바로 "재순위화(reranking)"라고 불리는 과정입니다.

오랫동안 이 똑똑한 컴퓨터들은 작고 효율적인 계산기 같은 존재였습니다. 하지만 최근 연구자들은 만약 이들에게 수십억 개의 "뉴런"이나 "전문가(experts)"를 부여하여 거대하게 만든다면, 이들이 정답을 찾는 데 믿을 수 없을 정도로 탁월해진다는 사실을 깨달았습니다. 하지만 문제가 하나 있습니다. 이 거대한 뇌들은 너무 무거워서 창고 크기만한 슈퍼컴퓨터를 필요로 한다는 점입니다. 대부분의 대학 연구실이나 소규모 연구 그룹은 이 정도의 창고를 감당할 여력이 없습니다. 그들은 단순히 이 거대한 모델을 메모리에 담을 수 없는, 더 작고 약한 컴퓨터를 가진 상태로 머물러 있습니다. 이 논문은 바로 그 문제를 다룹니다. 즉, 어떻게 하면 슈퍼컴퓨터 없이도 아주 적은 예산으로 이 거대하고 초지능적인 검색 엔진을 훈련시킬 수 있는가에 대한 문제입니다.

유타, 워털루, 카네기 멜론 같은 대학 출신의 연구진인 이 논문의 저자들은 테브라트론(Tevatron) 3.0이라는 새로운 도구를 구축했습니다. 이 모델을 훈련하는 기존 방식은 마치 거대하고 무거운 피아노를 좁은 계단으로 한 번에 한 사람씩 옮기는 것과 같습니다. 그것은 느릴 뿐만 아니라, 종종 피아노가 너무 커서 통과하지 못해 결국 포기해야 하는 상황을 만듭니다. 그들이 사용했던 기존 도구들(PyTorch FSDP라고 불리는)은 마치 그 계단과 같았습니다. 그들은 피아노를 조각으로 나누려고 시도했지만, 그 조각들조차 여전히 운반하기에 너무 무거웠고, 필요할 때만 작동하는 수많은 내부 부품을 가진 특정 유형의 피아노("전문가 혼합(Mixture of Experts, MoE)" 모델)를 처리할 수도 없었습니다.

연구팀의 해결책은 계단을 특수 하역장이 있는 이동 트럭으로 교체하는 것이었습니다. 그들은 "메가트론(Megatron)"이라는 강력한 엔진을 자신들의 툴킷에 통합했습니다. 이 새로운 엔진은 단순히 피아노를 운반하는 것에 그치지 않고, 피아노를 작고 관리하기 쉬운 상자들로 분해하여 여러 대의 트럭(컴퓨터)에 동시에 실을 수 있게 합니다. 이 새로운 엔진의 가장 마법 같은 부분은 "전문가 병렬성(Expert Parallelism)"을 처리하는 능력입니다. 128명의 서로 다른 전문가(예: 요리사, 정비사, 시인)가 문제에 매달려 일하는 팀을 상상해 보십시오. 기존의 도구들은 모든 전문가가 모든 문제에 투입되도록 만들려 했고, 이는 시간과 공간의 낭비였습니다. 새로운 메가트론 엔진은 "좋아, 이 특정 질문에 대해서는 요리사와 정비사만 앞으로 나오면 된다"라고 말하며 나머지 전문가들은 뒤에 머물게 할 만큼 똑똑합니다. 이를 통해 연구팀은 이전에는 불가능했던 예산으로 300억 개의 파라미터(거대한 뇌)를 가진 거대 모델을 훈련할 수 있었습니다.

이 논문은 이 새로운 방법이 기존의 비싼 방법들과 똑같이 잘 작동한다는 것을 보여줍니다. 실제로 테스트했을 때, 새로운 시스템은 표준 80억 파라미터 모델을 기존 방식보다 약 22% 더 빠르게 훈련시켰습니다. 하지만 진짜 마법은 거대한 300억 파라미터 모델에서 일어났습니다. 기존의 도구들은 단순히 이 모델을 실행할 수 없었습니다. 컴퓨터 메모리가 충돌하며 멈춰버렸기 때문입니다. 그러나 새로운 도구는 이를 성공적으로 훈련해 냈습니다.

더 놀랍게도, 저자들은 질문 하나당 약 30억 개의 파라미터만 "깨우는" 이 거대한 300억 파라미터 모델이 80억 파라미터의 작은 모델만큼이나 잘 수행한다는 것을 발견했습니다. 이는 마치 3,000만 권의 책이 있는 도서관에서 답을 찾기 위해 300만 권의 책만 펼치면 되는데,도서관 규모가 800만 권인 작은 도서관의 모든 책을 다 읽었을 때와 같은 결과를 얻는 것과 같습니다. 품질은 동일했을 뿐만 아니라, 질문당 수행하는 작업량이 적었기 때문에 답변 속도 또한 더 빨랐습니다. 고속 서버를 사용하여 테스트했을 때, 이 새로운 거대 모델은 작은 모델보다 1.43배 더 빠르게 질문에 답변했습니다.

연구진은 모델을 가르치는 다양한 방법도 테스트했습니다. 정답을 직접 보여주는 방식(대조 학습, contrastive learning)과 "스승" 모델을 모방하게 하는 방식(증류, distillation)을 비교해 보았습니다. 그 결과, 어느 한 쪽이 명확한 승자가 될 수는 없었으며, 이는 특정 질문의 유형에 따라 달라졌습니다. 또한, 그들은 모델을 "저계수(low-rank)" 방식(LoRA)으로 훈련할 수 있다는 점도 보여주었습니다. 이는 책 전체를 새로 쓰는 대신 책의 노트 부분만 업데이트하는 것과 같은데, 이 방식 역시 전체를 새로 쓰는 것과 거의 비슷하게 잘 작동하면서도 엄청난 양의 메모리를 절약해 주었습니다.

요약하자면, 이 논문은 단순히 "우리는 더 큰 모델을 만들었다"라고 말하는 것이 아닙니다. 여러분은 표준적인 학술적 예산으로도 이러한 거대하고 초효율적인 검색 엔진을 구축할 수 있다는 것을 증명하고 있습니다. 그들은 거대 기술 기업들만이 독점하던 강력한 기술에 작은 연구실들도 접근할 수 있도록 다리를 놓았습니다. 그들은 누구나 시도해 볼 수 있도록 모든 코드와 훈련된 모델을 공개했습니다. 그 결과, 더 저렴하게 훈련할 수 있고, 더 빠르게 사용할 수 있으며, 가장 비싼 대안들만큼이나 똑똑한 시스템을 만들어냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →