← 최신 논문
🤖 AI

RollArt: Disaggregated Multi-Task Agentic RL Training at Scale

RollArt는 파이프라인 단계를 특화된 하드웨어에 매핑하고, 동기화 병목 현상을 제거하기 위해 궤적 수준의 상호작용을 분리하며, 비동기 가중치 업데이트를 통해 롤아웃과 학습을 중첩시킴으로써 대규모 클러스터에서 최대 2.05배 빠른 학습 시간을 달리는 분산형 멀티태스크 에이전트 강화학습 시스템입니다.

원저자: Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Zhao, Ju Huang, Siran Yang, Yongbin Li, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng
게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Zhao, Ju Huang, Siran Yang, Yongbin Li, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng, Wei Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 매우 까다로운 로봇(AI)에게 소프트웨어 코드를 작성하거나 웹사이트를 탐색하는 것과 같은 복잡한 문제를 해결하는 법을 가르치려 한다고 상상해 보세요. 이를 위해 단순히 교과서를 주는 것이 아니라, 실세계 시뮬레이션에서 연습하게 합니다. 이 과정을 **에이전틱 강화 학습(Agentic Reinforcement Learning)**이라고 부릅니다.

이 논문은 이 훈련 과정의 초효율적인 교통 관제사 역할을 하는 ROLLART라는 새로운 시스템을 소개합니다. 다음은 쉬운 비유를 사용한 작동 원리입니다.

문제점: "일률적인" 교통 체증

하나의 공장에서 한 팀의 작업자들이 세 가지 매우 다른 일을 수행해야 한다고 상상해 보세요:

  1. 사고하기: 어려운 수학 문제를 풀기 (빠른 두뇌가 필요함).
  2. 읽기: 긴 책을 빠르게 읽기 (빠른 눈이 필요함).
  3. 만들기: 물리적인 부품을 조립하기 (강한 손이 필요함).

기존 시스템에서는 모든 일에 동일한 유형의 작업자를 배치했습니다. 만약 "빠른 두뇌"를 가진 작업자에게 "읽기" 업무를 맡기면 속도가 느려졌습니다. 또한 "강한 손"을 가진 작업자에게 "수학" 업무를 맡기면 역시 느려졌습니다. 게다가, 만약 한 작업자가 고장 난 장난감을 고치느라 쩔쩔매는 "지연자(straggler)"가 되면, 공장 전체가 다음 단계로 넘어가기 위해 그 작업자를 기다려야 했습니다. 이는 엄청난 지연을 초래했습니다.

해결책: ROLLART의 전문화된 조립 라인

ROLLART는 공장을 전문화된 구역으로 나누고 각 팀이 자신의 속도에 맞춰 일할 수 있도록 함으로써 이 문제를 해결합니다.

1. 적절한 도구에 작업자 매칭하기 (하드웨어 친화성)

시스템은 어떤 작업에는 연산 능력(수학 문제 풀기 등)이 필요하고, 어떤 작업에는 메모리 속도(긴 텍스트 읽기 등)가 필요한지를 인식합니다.

  • 기존 방식: 모두가 똑같이 비싸고 고성능인 컴퓨터를 사용했습니다.
  • ROLLART 방식: "수학" 작업은 초고속 컴퓨터로 보내고, "읽기" 작업은 거대하고 빠른 메모리를 가진 컴퓨터로 보냅니다. 이는 마치 요리사를 화력이 센 가스레인지가 있는 주방으로 보내고, 사서에게 거대하고 빠른 카드 목록이 있는 도서관으로 보내는 것과 같습니다. 그들은 적재적소에 맞는 도구를 사용하기 때문에 훨씬 더 빠르게 일을 완수합니다.

2. 작업자가 자신의 속도대로 움직이게 하기 (궤적 수준의 비동기성)

기존의 공장에서는 한 작업자가 작업을 마치는 데 10분이 걸리고 다른 작업자들이 1분 만에 끝낸다면, 공장 전체가 10분 동안 멈춰 서서 기다려야 했습니다.

  • ROLLART 방식: 모든 개별 연습 실행(이를 "궤적(trajectory)"이라 부름)을 독립적인 프로젝트로 취급합니다. 만약 한 로봇이 어려운 퍼즐에 막히더라도, 다른 로봇들은 자신만의 퍼즐을 계속 수행합니다. 시스템은 느린 로봇을 기다리지 않고, 빠른 로봇들이 계속해서 다음 단계로 나아가게 합니다. 느린 로봇이 마침내 작업을 완료하면, 그제야 점수를 매기고 빠른 로봇들은 새로운 작업으로 넘어갑니다.

3. 단순한 작업을 위한 "긱 워커(Gig Worker)" 고용 (서버리스 오프로딩)

로봇이 작업을 마친 후에는 누군가 그 결과를 채점해야 합니다. 때로는 간단한 확인(예: "문이 열렸는가?")일 수도 있고, 때로는 다른 AI에 의한 복잡한 검토일 수도 있습니다.

  • 기 old 방식: 단순한 채점 작업을 위해 값비싼 고성력 컴퓨터 팀을 대기 상태로 유지했습니다. 이는 작업 중이 아닐 때도 비용을 발생시키는 비효효율적인 일이었습니다.
  • ROLLART 방식: "긱 워커"(서버리스 클라우드 컴퓨팅)를 활용합니다. 채점이 실제로 일어날 때만 비용을 지불합니다. 채점할 일이 없으면 비용은 발생하지 않습니다. 이를 통해 값비싼 컴퓨터들이 로봇을 가르치는 핵심적인 작업에 집중할 수 있도록 해줍니다.

4. 배우면서 동시에 가르치기 (경계된 신선도 훈련)

보통 선생님(훈련 컴퓨터)과 학생(연습하는 로봇)은 차례를 주고받습니다. 학생은 연습하고, 멈추고, 선생님의 지식을 업데이트하기 위해 기다린 다음, 다시 시작합니다.

  • ROLLART 방식: 선생님과 학생이 동시에 작업합니다. 학생은 선생님이 "오늘 버전"의 지식을 업데이트하는 동안 "어제의 버전" 지식을 가지고 계속 연습합니다. 시스템은 학생이 너무 뒤처지지 않도록 관리하지만(신선도 경계 사용), 결코 멈춰서 기다릴 필요는 없습니다. 이는 마치 코치가 러너에게 새로운 팁을 줄 때마다 러너를 출발선에서 멈춰 세우는 것이 아니라, 러너가 이미 질주하고 있는 동안 코치가 옆에서 소리 높여 지시를 내리는 것과 같습니다.

결과

이 논문은 알리바바의 3,000대 이상의 컴퓨터를 사용하여 이 시스템을 대규모로 테스트했습니다.

  • 속도: 기존 방식보다 훈련 과정을 1.3배에서 2배 더 빠르게 만들었습니다.
  • 효율성: 유휴 상태의 작업에 비싼 컴퓨터 전력을 낭비하는 것을 방지했습니다.
  • 안정성: 컴퓨터가 다운되거나 작업이 너무 오래 걸리는 등의 문제가 발생하더라도 시스템이 끊김 없이 계속 작동함을 증명했습니다.

요약하자면, ROLLART는 AI 훈련의 "기다림의 게임"을 멈추게 하는 스마트한 매니저입니다. 적절한 작업을 적절한 컴퓨터에 배치하고, 느린 작업자가 뒤처지더라도 빠른 작업자들이 계속 움직이게 하며, 단순한 잡무에는 저렴한 온디맨드 도움을 활용함으로써, 더욱 빠르고 저렴하게 고급 AI를 훈련하는 방법을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →