← 최신 논문
🤖 machine learning

Online Dynamic Batching with Formal Guarantees for LLM Training

이 논문은 배치 형성을 정확한 비용 관측 가능 시점으로 이동시킴으로써 LLM 학습의 블라인드 배치 구성 문제를 해결하고, 모델이나 커널의 수정 없이도 공식적인 데드락 프리(deadlock-free) 보장과 함께 상당한 처리량 향상(최대 4.43배)을 제공하는 드롭인(drop-in) 데이터 로더 시스템인 Online Dynamic Batching(ODB)을 소개한다.

원저자: Dian Li, Zekun Wang, Yaoru Wang, Jiahong Yan

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dian Li, Zekun Wang, Yaoru Wang, Jiahong Yan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 바쁜 주방의 매니저(당신의 컴퓨터 GPU)라고 상상해 보세요. 당신은 아주 많은 사람을 위한 거대한 식사를 준비하려고 합니다(대규모 언어 모델 학습).

문제점: "눈먼" 요리사

과거의 방식(표준 배치/Standard Batching)에서는, 주방 매니저가 재료가 준비되기도 전에 각 주문의 크기가 얼마나 될지 미리 추측해야 했습니다.

  • 추측: "쟁반 하나에 8인분을 담아야지."
  • 현실: 어떤 주문은 아주 작고(쿠키 한 조각), 어떤 주문은 엄청나게 큽니다(칠면조 한 마리 전체).
  • 낭비: 만약 작은 쿠키와 거대한 칠면조를 같은 쟁반에 담는다면, 그것들을 다 담기 위해 쟁반에 빈 공간을 채워 넣어야 합니다. 만약 칠면조가 너무 크다면 쟁반이 깨져 버립니다(메모리 부족/Out of Memory).
  • 결과: 주방은 빈 공간으로 가득 차거나(에너지 낭비), 쟁반이 계속 깨지는 상황(충돌)에 직면합니다. 요리사는 다음 쟁반이 준비되기를 기다리느라 정작 요리를 하는 데 시간을 쓰지 못합니다.

해결책: 온라인 동적 배치 (Online Dynamic Batching, ODB)

이 논문의 저자들은 **온라인 동적 배치(ODB)**라고 불리는 새로운 시스템을 도입했습니다. 이것은 마치 음식이 완전히 준비될 때까지 마지막 순간까지 기다렸다가 어떻게 그룹을 묶을지 결정하는 스마트한 실시간 조립 라인과 같습니다.

  1. 진실을 기다리기: 추측하는 대신, 시스템은 음식이 완전히 준비되고, 다지고, 접시에 담길 때까지(토큰화 및 이미지 처리 이후) 기다립니다. 이제 시스템은 모든 주문의 정확한 크기를 알게 됩니다.
  2. 스마트한 그룹화: 시스템은 즉시 크기별로 주문을 그룹화합니다. 작은 쿠키들은 하나의 쟁반에 모으고, 큰 칠면조들은 다른 쟁반에 모읍니다.
    • 낭비 없음: 쟁반이 꽉 차게 됩니다. 빈 공간이 없습니다.
    • 깨짐 없음: 쟁반의 크기가 완벽하게 맞춰지므로 절대 깨지지 않습니다.
  3. "동기화" 기술: 여기가 어려운 부분입니다. 멀티 키친 설정(여러 대의 컴퓨터가 함께 작동하는 경우)에서는 모두가 쟁반을 완성하고 정확히 동시에 벨을 울려야 합니다. 만약 한 주방이 일찍 끝나서 기다리게 되면, 전체 라인이 멈춰버립니다.
    • 논문은 "그룹 정렬(Group Alignment)" 프로토콜을 소개합니다. 이는 마치 지휘자가 되어, 설령 주방 A에는 쟁반이 5개 있고 주방 B에는 7개가 있더라도, 아무도 음식을 떨어뜨리거나 영원히 기다리며 갇히지 않고 모두가 함께 벨을 울릴 수 있도록 음식을 빠르게 재배치하는 것과 같습니다.

결과: 맛은 그대로, 속도는 더 빠르게

연구진은 단순한 텍스트부터 복잡한 이미지 및 텍스트 결합에 이르기까지 다양한 "메뉴"(데이터셋)를 통해 이 새로운 시스템을 테스트했습니다.

  • 속도: 연구진은 ODB가 기존의 추측 방식보다 1.5배에서 4배 더 빠르게 요리한다는 것을 발견했습니다. 일부 실제 운영 환경에서는 거의 4.5배 더 빨랐습니다.
  • 품질: 훨씬 더 빠르게 요리했음에도 불구하고 음식의 맛은 똑같았습니다. "맛 테스트"(벤치마크 점수) 결과, ODB로 학습된 모델은 기존의 느린 방식으로 학습된 모델만큼이나 똑똑했습니다.
  • 새로운 장비 불필요: 가장 좋은 점은 주방을 새로 짓거나 레시피를 바꿀 필요가 없었다는 것입니다. 단지 "쟁반 관리자"(데이터 로더)를 더 스마트한 것으로 교체했을 뿐입니다.

이것이 중요한 이유

이 시스템은 수동 조립 라인을 실시간으로 스스로 재구성되는 스마트한 적응형 로봇 팔로 업그레이드하는 것과 같습니다. 이는 핵심적인 요리 과정을 변경하지 않고도 "빈 공간"과 "대기 시간" 문제를 해결합니다.

요약하자면, ODB는 실제 자동차(데이터 샘리)를 직접 볼 때까지 기다렸다가 어떻게 그룹을 묶을지 결정하는 스마트한 교통 경찰과 같습니다. 이를 통해 고속도로(GPU)가 항상 교통량으로 가득 차 있으면서도 정체되지 않도록 하여, 승객을 잃지 않고도 여정을 훨씬 더 빠르게 만들어 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →