← 최신 논문
🤖 machine learning

PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR

PlexRL 는 구조적 유휴 간격을 채우기 위해 작업 간 통합 LLM 서비스를 멀티플렉싱하여 검증 가능한 보상 기반 강화 학습 (RLVR) 훈련의 효율성을 향상시키는 클러스터 수준 런타임으로, 비싼 모델 마이그레이션 없이 사용자 GPU 비용을 최대 37.58% 까지 절감합니다.

원저자: Yiqi Zhang, Fangzheng Jiao, Tian Tang, Boyu Tian, Hangyu Wang, Qiaoling Chen, Guoteng Wang, Zhen Jiang, Peng Sun, Ping Zhang, Xiaohe Hu, Ziming Liu, Menghao Zhang, Yanmin Jia, Yang You, Siyuan Feng

게시일 2026-05-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yiqi Zhang, Fangzheng Jiao, Tian Tang, Boyu Tian, Hangyu Wang, Qiaoling Chen, Guoteng Wang, Zhen Jiang, Peng Sun, Ping Zhang, Xiaohe Hu, Ziming Liu, Menghao Zhang, Yanmin Jia, Yang You, Siyuan Feng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 첨단 기술이 적용된 제과점을 운영한다고 상상해 보세요. 이 제과점에는 두 가지 주요 작업 유형이 있습니다: 구이(거대하고 비싼 오븐이 필요함)와 장식(작고 빠른 스테이션이 필요함).

인공지능, 특히 수학 문제를 해결하는 '추론' 모델의 학습 세계에서는 '구이'가 **학습 **(training) 단계에 해당하고, '장식'은 AI 가 답변을 생성하는 **롤아웃 **(rollout) 단계에 해당합니다.

문제: '빈 오븐' 증후군

현재 대부분의 AI 학습 설정은 모든 주문이 시간 내내 사용하지 않더라도 전용 오븐과 장식 스테이션을 각각 하나씩 갖는 제과점처럼 작동합니다.

  1. 분리된 제과점: 한 팀은 구이를 하고 다른 팀은 장식을 하지만, 교대 근무로 일합니다. 제과사가 일할 때는 장식사가 가만히 앉아 있고, 장식사가 일할 때는 제과사가 가만히 앉아 있습니다. 두 팀 전체에 대한 비용을 지불하지만, 한 번에 일하는 팀은 하나뿐입니다.
  2. 공용 공간 제과점: 공간 절약을 위해 제과사와 장식사를 같은 방에 배치합니다. 하지만 오븐이 너무 거대합니다 (AI 모델이 방대하기 때문). 그래서 장식팀은 제과사가 작업을 마칠 때까지 카운터에 손도 대지 못하고 기다려야 합니다. 작은 장식 작업에는 오븐이 과대 배치되어 에너지가 낭비됩니다.
  3. 비동기식 제과점: 제과사가 오늘의 케이크를 구는 동안 장식사가 어제의 케이크를 장식하도록 시도합니다. 이는 약간 도움이 되지만, 결국 타이밍이 엉망이 되어 구식 케이크가 남거나 어쨌든 기다리게 됩니다.

이 논문은 이를 **'작업 로컬 비효율 **(job-local inefficiency)이라고 부릅니다. 모든 AI 학습 작업마다 비싼 컴퓨터 칩 (GPU) 이 아무것도 하지 않고 가만히 있는 '유휴 간격'이 존재합니다.

해결책: PlexRL(공유 주방 시스템)

저자들은 PlexRL이라는 시스템을 구축했습니다. PlexRL 은 모든 AI 작업에 전용 주방을 할당하는 대신, 전체 데이터 센터를 하나의 거대한 공유 주방으로 바꿉니다.

제과점 비유를 사용하여 작동 방식을 설명하면 다음과 같습니다:

  • **중앙 관리자 **(스케줄러) 어떤 제과점 주문이 만들어지는지에는 관심이 없는 수석 셰프를 상상해 보세요. 그들은 오직 **작업 **(tasks)에만 관심을 가집니다. 작업 A 가 현재 '장식' 중 (오븐의 작은 부분 사용) 이고 작업 B 가 '구이' 중 (오븐의 큰 부분 사용) 임을 파악합니다.
  • 시간 분할: 관리자는 작업 A 가 도구를 기다리는 동안 작업 B 가 그 같은 오븐을 몇 초간 사용할 수 있음을 깨닫습니다. PlexRL 은 오븐에서 '상태 (레시피와 현재 케이크)'를 빠르게 내리고 넣습니다.
  • 오븐 이동 금지: 보통 거대한 오븐을 새로운 주방으로 옮기는 데는 시간이 무한히 걸립니다. PlexRL 은 똑똑합니다: 오븐을 한곳에 두고 오븐 안으로 **재료 **(AI 모델의 메모리)만 매우 빠르게 교환합니다. '상태 관리자'를 사용하여 모든 재료가 어디에 있는지, 카운터 (빠른 메모리) 에 있는지 아니면 냉동고 (느린 저장소) 에 있는지를 추적합니다.

마법의 트릭: '부정적 상관관계' 간격

비밀 소스는 서로 다른 AI 작업의 '유휴 시간'이 거의 동시에 발생하지 않는다는 점입니다.

  • 작업 A는 도구 호출을 기다리고 있을 수 있습니다 (긴 멈춤).
  • 작업 B는 격렬한 수학 계산 중일 수 있습니다 (멈춤 없음).

PlexRL 은 작업 A 의 멈춤 시간을 작업 B 의 작업으로 채웁니다. 이는 차고지로 빈 채로 돌아오는 대신 북쪽으로 가는 승객을 태운 후 즉시 남쪽으로 가는 승객을 태우는 택시 운전사와 같습니다.

결과

이 논문은 다양한 크기 (작은 것부터 거대한 것까지) 의 AI 모델을 학습시키는 2,048 개의 컴퓨터 칩 (GPU) 으로 구성된 거대한 클러스터에서 이를 테스트했습니다.

  • 비용 절감: 모든 빈 간격을 채움으로써 학습 비용을 최대 **37.58%**까지 줄였습니다. 이는 전등을 켜는 시기를 더 똑똑하게 조절함으로써 전기세에서 37% 할인을 받는 것과 같습니다.
  • 속도: AI 의 학습 속도가 느려지지 않았습니다. 모델은 이전과 똑같이 학습했지만, 더 적은 자원을 사용하여 그 목표에 도달했습니다.
  • 유연성: 연구원들은 전체 시스템을 다시 작성할 필요 없이 AI 학습의 새롭고 기이하며 복잡한 방법들을 여전히 시도할 수 있습니다. PlexRL 은 데이터를 이동시키는 복잡한 '배관'을 처리하여 연구원들이 수학에 집중할 수 있게 합니다.

요약하자면

PlexRL은 AI 학습 작업을 고립된 섬처럼 취급하는 것을 중단하는 시스템입니다. 대신 이를 바쁜 공유 도시 버스 시스템처럼 취급합니다. 비싼 '버스'(컴퓨터 칩) 가 빈 채로 운행되지 않도록 보장합니다. 동일한 하드웨어에 서로 다른 작업을 지능적으로 교환함으로써 AI 를 더 멍청하게 만들지 않으면서 막대한 비용과 컴퓨팅 파워를 절약합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →