← 최신 논문
🤖 AI

D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models

D-VLA 는 플레인 디커플링, 4 스레드 비동기식"수영로"파이프라인, 듀얼 풀 VRAM 관리를 활용하여 시스템 병목 현상을 극복하고 수십억 및 수조 개 파라미터 규모의 비전 - 언어 - 행동 모델에 대한 우수한 처리량과 확장성을 달성하는 고동시성 저지연 분산 강화학습 프레임워크입니다.

원저자: Yucheng Guo, Yongjian Guo, Zhong Guan, Wen Huang, Haoran Sun, Haodong Yue, Xiaolong Xiang, Shuai Di, Zhen Sun, Luqiao Wang, Junwu Xiong, Yicheng Gong

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yucheng Guo, Yongjian Guo, Zhong Guan, Wen Huang, Haoran Sun, Haodong Yue, Xiaolong Xiang, Shuai Di, Zhen Sun, Luqiao Wang, Junwu Xiong, Yicheng Gong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 작업을 로봇에게 가르친다고 상상해 보세요. 예를 들어 가구를 조립하거나 병 뚜껑을 여는 작업 말입니다. 이를 위해서는 '두뇌'(거대한 AI 모델) 와 '체육관'(로봇이 훈련하는 고정밀 물리 시뮬레이션) 이 필요합니다.

이 논문에서 설명하듯, 문제는 이 두 가지가 끔찍한 룸메이트라는 점입니다.

  • 체육관은 혼란스럽습니다. 로봇의 손, 중력, 바닥의 마찰력을 끊임없이 확인해야 합니다. 매초마다 지시를 외치는 초조한 코치와 같습니다.
  • 두뇌는 거대하고 느린 사고방식을 가진 존재입니다. 자신이 무엇을 보고 있는지 처리하고 다음 행동을 결정하려면 막대한 양의 메모리와 시간이 필요합니다.

전통적인 설정에서는 이 둘이 동일한 컴퓨터 자원을 두고 싸웁니다. 체육관은 두뇌가 생각할 때까지 멈춰 서고, 두뇌는 체육관이 계산을 끝낼 때까지 멈춰 섭니다. 이는 릴레이 경기에서 주자와 바톤 넘기는 사람이 교통 체증에 걸려 서로를 기다리며 멈춰 서 있는 것과 같습니다. 이로 인해 전체 훈련 과정이 극도로 느리고 비효율적이 됩니다.

D-VLA 등장: '수영 레인' 해결책

저자들은 D-VLA(분산형 비전 - 언어 - 행동) 라는 새로운 시스템을 제안합니다. 그들은 트랙을 완전히 재설계하여 교통 체증을 해결합니다. 간단한 비유를 들어 그 방법을 설명해 보겠습니다.

1. 플레인 분리: '데이터 고속도로'와 '관제탑' 분리

바쁜 공항을 상상해 보세요.

  • 데이터 플레인은 수천 대의 비행기 (데이터) 가 매초 이착륙하는 활주로입니다. 이는 빠르고 막힘없이 운영되어야 합니다.
  • 제어 플레인은 관제탑입니다. 관제탑은 비행 경로를 업데이트 (AI 의 두뇌 가중치 변경) 하기 위해 조종사와 가끔만 대화하면 됩니다.

구식 시스템에서는 활주로나 관제탑이 같은 건물에 있어 혼잡을 초래했습니다. D-VLA는 이들을 물리적으로 분리합니다. '활주로'(시뮬레이션 및 데이터 수집) 는 '관제탑'(AI 모델 업데이트) 과 완전히 격리된 전용 트랙에서 독자적으로 실행됩니다. 이는 혼란스러운 데이터 수집이 두뇌 업데이트라는 느린 과정에 의해 차단되지 않음을 의미합니다.

2. '수영 레인' 파이프라인: 네 개의 레인, 대기 없음

네 개의 레인이 있는 수영 경기를 생각해 보세요. 전통적인 경기에서는 두 번째 사람이 시작하기 전에 첫 번째 레인의 사람이 끝날 때까지 모두 기다려야 합니다.

D-VLA 는 4 개 스레드 '수영 레인' 파이프라인을 사용합니다. 네 명의 수영 선수가 동시에 일하는 상황을 상상해 보세요:

  1. 수영 선수 1(샘플링): 로봇이 시뮬레이션 (체육관) 에서 훈련합니다.
  2. 수영 선수 2(추론): AI 가 데이터를 보고 추측을 합니다.
  3. 수영 선수 3(훈련): AI 가 실수에서 배웁니다 (기울기 계산).
  4. 수영 선수 4(배포): AI 는 더 똑똑해진 새로운 두뇌를 다음 라운드로 전달합니다.

그들이 별도의 레인에 있기 때문에, 수영 선수 3 이 이전 동작에서 배우는 동안 수영 선수 1 은 다음 동작을 훈련할 수 있습니다. 그들은 서로를 기다리지 않습니다. 이 '중첩'은 컴퓨터가 항상 작동하고 절대로 유휴 상태로 머무르지 않음을 의미합니다.

3. 메모리 관리자: 두 개의 전문화된 주머니

컴퓨터는 제한된 양의 메모리 (VRAM) 를 가지고 있습니다. 시뮬레이션 엔진 (체육관) 은 지저분합니다. 메모리를grab 하고, 사용했다가 빠르게 버리는데, 이로 인해 메모리가 '파편화'되어 사용할 수 없게 될 수 있습니다. 반면 AI 모델 (두뇌) 은 작동하기 위해 깨끗하고 단단한 메모리 블록이 필요합니다.

D-VLA 는 듀얼 풀 메모리 관리 시스템을 사용합니다. 이는 배낭에 두 개의 별도 주머니를 가진 것과 같습니다:

  • 주머니 A: 지저분한 체육관 장비 (물리 시뮬레이션) 에만 엄격히 예약됩니다.
  • 주머니 B: 무거운 두뇌 (AI 모델) 에만 엄격히 예약됩니다.

이들을 분리해 두면 지저분한 체육관이 두뇌가 필요로 하는 공간을 훼손하지 않아 충돌과 속도 저하를 방지합니다.

4. 결과: 경기 속도 향상

저자들은 LIBEROManiSkill과 같은 표준 로봇 훈련 벤치마크에서 이 시스템을 테스트했습니다.

  • 주장: D-VLA 는 기존 시스템보다 훨씬 빠릅니다.
  • 숫자: 일부 테스트에서 처리 단계 속도가 기존 최상위 방법보다 86% 더 빠릅니다.
  • 품질: 훨씬 빠르지만 로봇의 학습 능력은 동일합니다. '두뇌'는 속도에 혼란을 느끼지 않았으며 여전히 올바른 작업을 학습했습니다.

요약

간단히 말해, D-VLA는 로봇 두뇌를 훈련시키는 새로운 방법입니다. 로봇의 '훈련'과 '학습'을 단일 줄에서 번갈아 가며 수행하도록 강요하는 대신, D-VLA 는 이 두 가지가 동시에 일어나는 다차선 고속도로를 구축합니다. 지저분하고 빠른 데이터 수집과 느리고 무거운 두뇌 업데이트를 물리적으로 분리하고 메모리를 신중하게 관리함으로써, 그들은 거대한 AI 모델이 시스템을 파괴하지 않고 이전보다 훨씬 빠르게 로봇으로부터 학습할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →