Efficient Vision-Language-Action Management and Serving for Robot Factories
본 논문은 밀리초 단위의 안전 서비스 수준 목표(SLO)를 엄격히 준수하면서 로봇 부하를 극대화하기 위해 GPU 내부 스테이지 분해(intra-GPU stage disaggregation)와 지능형 트래픽 제어를 채택하여, 엣지 서버 상의 다중 로봇, 다중 모델 시각-언어-행동(VLA) 워크로드를 위한 새로운 서빙 및 관리 시스템인 Robion을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
단순히 미리 프로그래밍된 명령을 따르는 것이 아니라, 세상을 보고, 일상적인 언어로 주어진 지시를 이해하며, 부품을 집거나 구성 요소를 조립하기 위해 자신의 팔을 어떻게 움직일지 스스로 결정하는 기계들이 있는 공장 바닥을 상상해 보십시오. 이것이 바로 로봇에게 '시각-언어-행동(vision-language-action)' 모델을 탑재하는 분야인 물리적 인공지능의 약속입니다. 이러한 시스템은 로봇의 두뇌 역할을 하며, 카메라 이미지와 "빨간 상자를 집어라"와 같은 텍스트 프롬프트를 입력받아 작업을 완료하는 데 필요한 정확한 물리적 움직임을 계산합니다. 이러한 로봇이 안전하고 효과적으로 작동하려면 눈 깜빡할 사이에 반응해야 합니다. 만약 두뇌가 생각하는 데 너무 오래 걸리면, 로봇이 팔을 급격하게 움직이거나, 물체를 떨어뜨리거나, 심지어 전체 조립 라인을 멈추게 하여 비용이 많이 드는 지연이나 안전 문제를 일으킬 수 있습니다.
문제는 이러한 사고 모델을 실행할 수 있을 만큼 강력한 컴퓨터가 로봇에 직접 장착하기에는 너무 무겁고, 비싸며, 전력을 많이 소모한다는 점입니다. 대신, 엔지니어들은 로봇의 생각을 근처의 로컬 서버, 즉 일종의 디지털 두뇌 센터로 보내서 그곳에서 복잡한 계산을 수행하고 답변을 다시 보내는 방식을 제안했습니다. 하지만 이 설정은 새로운 문제를 만듭니다. 어떻게 하면 단 하나의 서버가 수십 대의 로봇을 동시에 서비스하면서, 모든 요청에 대해 공장이 원활하게 돌아갈 수 있을 만큼 빠르게 답변을 제공하도록 관리할 것인가 하는 문제입니다. 바로 이 퍼즐을 해결하기 위해 설계된 새로운 시스템이 Robion이며, 이는 단일 서버가 여러 로봇의 다양한 작업을 끊김 없이 동시에 처리할 수 있도록 해줍니다.
Robion의 연구진은 이러한 로봇의 두뇌가 챗봇에 사용되는 대규모 언어 모델이나 예술 작품에 사용되는 거대한 이미지 생성기와는 근본적으로 다르게 작동한다는 것을 발견했습니다. 그러한 시스템은 종종 수백 밀리초 또는 심지어 몇 초 동안 실행되지만, 로봇의 사고 과정은 불과 몇 밀리초 만에 이루어집니다. 이는 두 단계의 과정으로 이루어집니다. 첫째, 시스템은 상황을 이해하기 위해 이미지를 보고 지시 사항을 읽습니다. 둘째, 행동에 필요한 구체적인 물리적 움직임을 계산합니다. 이 단계들은 매우 빠르고 서로 다른 요구 사항을 가지고 있기 때문에—하나는 무거운 계산을 필요로 하고, 다른 하나는 빠른 메모리 접근을 필요로 함—서버에서 이들을 하나의 연속적인 파이프라인으로 실행하려고 시도하는 것은 비효률적입니다. 이는 마치 마라톤과 단거리 달리기를 동시에 하려는 것과 같습니다. 느리고 무거운 주자가 빠르고 가벼운 주자를 느리게 만드는 격입니다.
이를 해결하기 위해 팀은 이 두 단계를 분리하여 동일한 컴퓨터 칩 위에서 나란히 실행되도록 Robion을 구축했습니다. 다만 정교하게 제어된 방식으로 말입니다. 그들은 서버의 프로세서에 두 개의 별도 교통 차선을 만들었습니다. 한 차선은 무거운 사고를 처리하고, 다른 차선은 빠른 움직임 계산을 처리합니다. 결정적으로, 그들은 무거운 차선이 가벼운 차선을 완전히 막지 않도록 하는 교통 관제사를 설계했습니다. 그들은 가벼운 차선이 항상 실행될 수 있는 공간을 보장하기 위해 특정 양의 컴퓨팅 파워를 예약해 둠으로써, 무거운 사고가 진행되는 동안에도 항상 공간을 확보합니다. 이를 통해 서버는 한 로봇의 사고 과정과 다른 로봇의 움직임 계산을 중첩시켜 여러 로봇의 요청을 정확히 동시에 처리할 수 있습니다.
나아가 연구진은 단일 서버가 각기 다른 작업과 각기 다른 버전의 두뇌를 가진 다양한 유형의 로봇들을 처리할 수 있다는 점을 깨달았습니다. 어떤 로봇은 상자를 포장하고, 다른 로보은 자동차 부품을 조립할 수도 있습니다. Robion은 이러한 서로 다른 로봇의 두뇌들이 동일한 컴퓨팅 차선을 공유하며 동일한 서버에 존재할 수 있도록 합니다. 이 시스템은 스마트한 배차원처럼 작동하여, 어떤 로봇이 안전 마감 기한을 놓치기에 가장 가까운지 끊임없이 확인합니다. 만약 로봇이 작업을 마칠 시간이 다 되어간다면, 시스템은 즉시 해당 요청의 우선순위를 높여 가장 긴급한 작업이 먼저 완료되도록 보장합니다. 이는 한 로봇이 답변을 기다리느라 공장이 멈추는 일을 방지합니다.
팀은 최대 4개의 강력한 그래픽 카드(AI 모델을 구동하는 엔진)를 사용하는 시뮬레이션된 공장 환경에서 이 시스템을 테스트했습니다. 그들은 로봇의 두뇌를 하나의 끊어지지 않는 연속된 사건으로 실행하거나 단계를 서로 다른 컴퓨터로 나누어 실행하는 기존 방식들과 Robion을 비교했습니다. 결과에 따르면, Robion은 엄격한 타이밍 요구 사항을 충려하면서도 다른 방식들보다 훨씬 더 많은 로봇을 지원할 수 있었습니다. 한 대규모 테스트에서, Robion을 실행하는 단일 서버는 8가지의 서로 다른 로봇 모델을 성공적으로 관리하며, 최대 64대의 로봇을 동시에 서비스하면서 98%의 성공률을 기록했습니다. 이는 거의 모든 요청에 대해 로봇이 안전하게 계속 움직일 수 있는 시간 내에 답변을 받았음을 의미합니다.
또한 연구진은 로봇 두뇌의 서로 다른 부분들을 별개의 컴퓨터에 두는 것이 나은지, 아니면 함께 두는 것이 나은지 탐구했습니다. 그들은 사고 단계와 움직임 단계를 서로 다른 컴퓨터로 나누는 것이 데이터를 주고받는 과정에서 귀중한 시간을 낭비하게 만들어 오히려 더 느리고 비효율적이라는 것을 발견했습니다. 모든 것을 하나의 강력한 서버에 유지하고 내부 트래픽을 세심하게 관리함으로써, Robion은 훨씬 더 나은 성능을 달ert했습니다. 연구진은 또한 비용 측면을 검토하며, 많은 로봇을 실행하기 위해 단일 강력한 서버를 사용하는 것이 각 로봇에 값비싼 고성능 컴퓨터를 설치하는 것보다 훨씬 저렴하다고 언급했습니다. 이러한 접근 방식은 주요 기업들이 첨단 자율 공장을 실현 가능하게 하여, 컴퓨팅 자원을 과도하게 사용하지 않고도 효율적으로 협력하는 지능형 로봇 군단을 배치할 수 있게 해줄 것입니다.
궁극적으로, Robion은 지능형 로봇 공장을 운영하는 핵심이 단순히 강력한 컴퓨터를 갖는 것이 아니라, 컴퓨터를 극도로 정밀하게 관리할 수 있는 시스템을 갖추는 것임을 보여줍니다. 로봇의 의사결정이 가진 독특하고 찰나적인 특성을 이해하고, 엄격한 마감 시간을 준-수하는 서버를 설계함으로써, 연구진은 물리적 인공지능을 확장할 수 있는 청사진을 만들었습니다. 이 시스템은 공장이 커지고 복잡해지더라도 로봇이 실시간으로 보고, 생각하고, 행동할 수 있도록 보장하여 생산 라인이 원활하고 안전하게 돌아가도록 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.