← 최신 논문
🤖 AI

Training Variable Long Sequences with Data-Centric Parallel

이 논문은 가변적인 긴 시퀀스를 가진 딥러닝 모델을 학습할 때 효율성과 사용 편의성 사이의 절충안을 제거하기 위해 배치 시퀀스 길이에 따라 런타임 설정을 동적으로 조정하는 단순하고 일반화 가능한 방법인 Data-Centric Parallel (DCP)을 소개하며, 최소한의 코드 통합만으로 최대 2.88배의 속도 향상을 달성합니다.

원저자: Geng Zhang, Xuanlei Zhao, Kai Wang, Yang You

게시일 2026-08-11
📖 6 분 읽기🧠 심층 분석

원저자: Geng Zhang, Xuanlei Zhao, Kai Wang, Yang You

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능형 로봇에게 세상을 이해하는 법을 가르치려 한다고 상상해 보세요. 이를 위해 당신은 수천 시간의 비디오, 수백만 페이지의 텍스트, 또는 복잡한 과학적 모델과 같은 방대한 양의 데이터를 로봇에게 입력합니다. 로봇은 이 "시퀀스(sequence)" 정보를 살펴보며 학습합니다. 하지만 여기에는 함정이 있습니다. 모든 시퀀스의 길이가 같지는 않다는 점입니다. 어떤 것은 짧은 트윗처럼 순식간에 지나가지만, 어떤 것은 전체 영화나 책 한 권처럼 믿을 수 없을 정도로 깁니다.

이 로봇들을 훈련시킬 때, 보통 우리는 여러 대의 강력한 컴퓨터(GPU라고 불리는)가 함께 협력하여 작업을 나누어 수행합니다. 이것은 마치 거대한 주방에 있는 여러 명의 요리사 팀과 같습니다. 만약 모든 요리사가 동일한 크기의 레시피를 받는다면, 그들은 모두 동시에 작업을 마치고 함께 다음 요리를 시작할 수 있을 것입니다. 하지만 현실 세계의 레시피는 매우 다양합니다. 한 요리사는 아주 작은 에피타이저를 받을 수도 있고, 다른 요리사는 거대한 10코스 만찬을 받을 수도 있습니다. 만찬을 맡은 요리사가 요리를 마칠 때까지 기다리는 동안, 작은 요리를 맡은 요리사는 몇 초 만에 일을 끝내고 아무것도 하지 못한 채 서 있게 됩니다. 이것을 "워크로드 불균형(workload imbalance)"이라고 하며, 이는 엄청난 시간과 에너지를 낭비하게 만듭니다. 과학자들이 직면한 과제는 시스템을 너무 복잡하게 만들지 않으면서도, 어떻게 하면 주방을 원활하게 운영할 수 있을지 찾아내는 것입니다.

이것이 바로 싱가포르 국립대학교 연구진이 소개한 **데이터 중심 병렬 처리(Data-Centric Parallel, DCP)**라는 새로운 방식이 해결하고자 하는 문제입니다. 모든 데이터를 하나의 경직된, 일률적인 시스템에 강제로 맞추는 대신, DCP는 데이터 자체가 작업이 수행되는 방식을 결정하도록 허용합니다. 이것을 스마트한 주방 매니저가 주문이 들어올 때마다 즉각적으로 결정하는 상황이라고 상상해 보세요. "좋아, 이 작은 에피타이저를 위해서는 요리사 한 명만 사용해서 빠르게 조리하자. 반면에 이 거대한 만찬을 위해서는 팀 전체를 투입해 동시에 재료를 다듬고 요리하자."라고 말이죠.

이 논문은 데이터의 배치(batch)마다 팀 규모와 조리 전략을 동적으로 조정함으로써 훈련 과정을 훨씬 더 빠르게 만들 수 있다는 것을 밝혀냈습니다. 32대의 강력한 H200 GPU를 사용한 테스트에서, 이 방식은 기존 방식보다 최대 2.88배 더 빠르게 훈련을 수행했습니다. 또한, 이 시스템은 매우 유연하여 단 10줄의 코드만으로 거의 모든 새로운 AI 모델에 추가할 수 있어, 미래의 AI를 위한 단순하면서도 강력한 도구가 될 수 있음을 보여주었습니다.

문제점: "기다림이 가득한" 주방

이것이 왜 중요한지 이해하기 위해, 과거에 이 "불균형한 주문" 문제를 해결하기 위해 어떤 방식들이 사용되었는지 살펴보겠습니다. 과거의 연구자들은 이 문제를 두 가지 주요 방식으로 해결하려 했으나, 두 방법 모두 심각한 결함이 있었습니다.

첫 번째 방식은 엄격한 헤드 셰프가 "주문의 크기와 상관없이 우리는 항상 8명의 요리사를 사용할 것이다"라고 말하는 것과 같습니다. 이것을 **버킷 병렬 처리(Bucket Parallel)**라고 합니다. 주문이 아주 작더라도 8명의 요리사를 배정한다면, 8번째 요리사가 요리를 하는 동안 나머지 7명은 그냥 서서 구경만 하게 됩니다. 이는 매우 간단하지만, 엄청나게 낭비적입니다. 작은 주문을 맡은 요리사들은 즉시 일을 끝내지만, 주방 전체는 큰 주문을 맡은 가장 느린 요리사가 끝날 때까지 기다려야 다음 라운드를 시작할 수 있습니다. 이는 많은 유휴 시간(idle time)을 초래합니다.

두 번째 방식은 큰 주문을 받은 요리사에게 한 번에 요리할 재료를 적게 주는 방식으로 부하를 조절하는 것이었습니다. 이것은 10코스 만찬을 맡은 요리사에게는 한 번에 한 코스씩만 요리하도록 하고, 에피타이저를 맡은 요리사는 한 번에 전체를 요리하게 하는 것과 같습니다. 이것을 팩킹 병렬 처리(Packed Parallel) 또는 배치 크기 조절이라고 합니다. 이 방식은 요리사들이 동시에 작업을 마치도록 도와주기는 하지만, 새로운 문제가 발생합니다. 주방이 재료를 가져오기 위해 팬트리(pantry)를 훨씬 더 많이 왔다 갔다 해야 한다는 점입니다. 컴퓨터 용어로 말하면, 이는 막대한 통신 비용(communication costs)의 증가를 의미하며, 결국 전체 속도를 늦추게 됩니다.

연구자들은 핵심적인 문제가 이러한 기존 방식들이 훈련이 시작되기도 전에 결정된 정적 설정(static settings), 즉 규칙에 의존했다는 점이라고 주장했습니다. 즉, 데이터가 실시간으로 계획을 바꾸도록 내버려 두지 않았던 것입니다.

해결책: 역동적이고 데이터 중심적인 매니저

새로운 방식인 **데이터 중심 병렬 처리(DCP)**는 데이터가 실행 시간을 주도하게 함으로써 판도를 바꿉니다. 고정된 규칙 책 대신, 이 시스템은 주문의 길이(시퀀스 길이)를 보고 즉각적으로 설정을 조정하는 스마트하고 적응력 있는 매니저처럼 작동합니다.

연구자들은 이를 두 가지 영리한 전략으로 나누었습니다.

  1. DCP-inter (팀워크 전략):
    이 전략은 재료를 낭비하지 않으면서 워크로드를 균형 있게 맞추는 데 집중합니다. 만약 데이터 배치의 시퀀스가 매우 길다면(큰 주문이라면), 시스템은 앞서 언급한 통신 오버헤드를 유발하는 배치 크기 축소 대신, **그래디언트 누적(gradient accumulation)**을 사용합니다. 이것은 셰프가 큰 주문을 여러 작은 단계로 나누어 요리하되, 팀 규모는 그대로 유지하는 것과 같습니다. 이는 빠른 작업자들의 "유휴 시간"을 활용하여, 전체 주방의 속도를 늦추지 않으면서도 큰 주문을 돕도록 함으로써 업무를 분담합니다. 즉, 짧은 주문의 효율성을 해치지 않으면서도 모두가 일하는 시간을 균형 있게 맞춥니다.

  2. DCP-intra (메모리 전략):
    이 전략은 메모리 문제를 해결합니다. 긴 시퀀스를 훈련할 때, 컴퓨터는 나중에 최종 답을 계산하기 위해 많은 "중간 노트(activations)"를 저장해야 하는 경우가 많습니다. 이는 많은 메모리를 차지합니다. 공간을 아끼기 위해 보통 **그래디언트 체크포인팅(gradient checkpointing)**이라는 기술을 사용하는데, 이는 노트를 버렸다가 나중에 다시 계산하는 방식입니다. 이는 메모리를 절약하지만, 수학 계산을 다시 수행하는 데 추가 시간이 걸립니다.
    연구자들은 짧은 시퀀스의 경우, 컴퓨터에 실제로 여유 메모리가 충분하다는 점에 주목했습니다. 따라서 DCP-intra는 "이 짧은 주문들을 위해서는 노트를 버릴 필요가 없다! 노트를 보관하고 재계산을 건너뛰자!"라고 말합니다. 이를 통해 짧은 주문은 훨씬 더 빠르게 진행됩니다. 만약 긴 주문 때문에 컴퓨터의 메모리가 부족해지면, 시스템은 전체 속도를 늦추지 않으면서도 공간을 확보하기 위해 팀 규모(시퀀스 병렬성)를 조정합니다.

결과: 속도와 단순함

연구진은 두 가지 서로 다른 유형의 AI 모델(텍스트와 같은 1D 데이터용 모델과 비디오와 같은 2D 데이터용 모델)을 사용하여 세 가지 유형의 데이터셋(짧은 시퀀스, 균형 잡힌 시퀀스, 긴 시퀀스)에 대해 이 새로운 방법을 테스트했습니다. 이 테스트는 32대의 NVIDIA H200 GPU 클러스터에서 수행되었습니다.

결과는 인상적이었습니다. 기존의 "버킷(bucket)" 방식과 비교했을 때, DCP-inter 단독으로도 훈련 속도를 1.68배에서 2.70배까지 높였습니다. 여기에 메모리 사용을 최적화하는 두 번째 전략(DCP-intra)을 추가했을 때, 속도 향상은 더욱 높아져 가장 까다로운 데이터셋에서 최대 2.88배에 달했습니다.

가장 중요한 점은 연구진이 이 시스템이 사용하기 매우 쉽다는 것을 발견했다는 것입니다. 그들은 단 10줄의 코드 변경만으로 DCP를 거의 모든 기존 AI 모델에 통합할 수 있음을 보여주었습니다. 이는 이 방법이 단순히 이론적인 아이디어에 그치는 것이 아니라, 널리 채택될 수 있는 실용적인 도구임을 시사합니다.

이것이 의미하는 바

이 논문은 고정된 규칙에서 벗어나 데이터 자체가 훈련 방식을 결정하게 함으로써, AI 훈련의 고질적인 비효율성 문제를 해결할 수 있음을 시사합니다. 연구진은 강력한 하드웨어에서의 실제 시뮬레이션을 통해 이러한 속도 향상을 측정했으며, 이 방법이 다양한 모델 크기와 데이터 분포에서도 잘 작동함을 입증했습니다.

현재 이 방법은 대부분의 현대적 텍스트 및 이미지 생성에 사용되는 트랜스포머(Transformer) 기반 모델로 제한되어 있지만, 저자들은 이 접근 방식이 새로운 표준을 세울 것이라고 믿습니다. 이는 사용하기 쉬운 시스템과 높은 효율성 사이에서 하나를 선택할 필요가 없음을 증명합니다. 데이터 중심 병렬 처리를 통해 당신은 두 가지를 모두 가질 수 있으며, 이는 향 true 더 크고 복잡한 AI 모델을 훈련하는 미래를 위한 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →