← 최신 논문
💻 computer science

Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment

본 논문은 다양한 가속기 전반에 걸친 모델-하드웨어 트레이드오프를 체계적으로 평가하고, 2 단계 추론 병목 현상을 규명하며, 최소의 성능 저하로 GPU 와 엣지 NPU 모두에서 상당한 속도 향상을 달성하기 위한 DP-Cache 와 V-AEFusion 기법을 제안함으로써, 리소스 제약이 있는 로봇에 비전-언어-동작 (VLA) 모델을 배포하는 데 따른 과제를 다룹니다.

원저자: Kaijun Zhou, Qiwei Chen, Da Peng, Zhiyang Li, Xijun Li, Jinyu Gu

게시일 2026-04-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kaijun Zhou, Qiwei Chen, Da Peng, Zhiyang Li, Xijun Li, Jinyu Gu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 컵을 들거나 테이블을 닦는 것과 같은 작업을 수행하도록 가르친다고 상상해 보세요. 이를 위해 로봇은 비전 - 언어 - 행동 (VLA) 모델이라는 '뇌'가 필요합니다. 이 뇌는 세상을 보고 (비전), 당신의 말을 이해하며 (언어), 무엇을 할지 결정합니다 (행동).

문제는 이러한 뇌들이 현재 매우 무겁고 실행 속도가 느리다는 점입니다. 특히 충돌 없이 실시간으로 움직여야 하는 로봇에서는 더욱 그렇습니다. 대부분의 연구자들은 이러한 뇌들을 고사양 데스크톱 컴퓨터와 같은 거대하고 비싼 슈퍼컴퓨터에서 테스트해 왔지만, 실제 로봇은 더 작고 저렴하며 배터리로 작동하는 장치에서 실행되어야 합니다.

이 논문은 이러한 로봇 뇌를 위한 메커닉 가이드이자 성능 튜너와 같습니다. 그들이 무엇을 발견했고 어떻게 문제를 해결했는지 간단히 설명해 드리겠습니다.

1. "적합한 크기"의 자동차 비유

연구자들은 단순한 질문을 던졌습니다. 식료품점을 가기 위해 정말 포뮬러 1 레이싱카 엔진이 필요한가요?

  • 과거의 방식: 모든 사람이 이러한 로봇 뇌를 구동하려면 가장 강력하고 비싼 그래픽 카드 (예: 엔비디아 RTX 4090) 가 필요하다고 가정했습니다. 이는 미니밴에 레이싱카 엔진을 장착하는 것과 같습니다. 빠르지만 천문학적인 비용이 들고 연료 (에너지) 를 많이 소비합니다.
  • 새로운 발견: 그들은 강력한 데스크톱부터 엣지 장치에 탑재된 작고 저렴한 칩에 이르기까지 다양한 하드웨어에서 이러한 로봇 뇌를 테스트하는 **리더보드 (점수판)**를 구축했습니다.
  • 결과: 많은 작업의 경우 "적합한 크기"의 작은 엔진 (더 저렴하고 저전력인 칩) 이 실제로 더 좋다는 것을 발견했습니다. 구매 비용이 저렴하고 배터리 소모가 적으며 작업을 완벽하게 수행하기에 충분히 빠릅니다. 항상 가장 크고 비싼 도구가 필요한 것은 아닙니다.

2. "두 단계 춤" 문제

이러한 로봇 뇌가 작동하는 방식을 자세히 살펴보면, 이상한 리듬 문제가 있음을 발견했습니다. 뇌는 일정한 속도로 작동하지 않으며, 두 단계 춤처럼 두 가지 뚜렷한 단계를 가집니다.

  • 1 단계: 사고하는 사람 (비전 - 언어 모델): 이 부분은 카메라를 보고 장면을 이해합니다. 거의 100% 에 가까운 컴퓨터의 두뇌 능력을 사용하여 매우 열심히 일합니다. 마라톤 선수가 질주하는 것과 같습니다.
  • 2 단계: 계획하는 사람 (행동 전문가): 이 부분은 팔을 어떻게 움직일지 정확히 결정합니다. 놀랍게도 이 부분은 컴퓨터의 전력을 매우 게으르게 사용합니다. 대부분 메모리에서 데이터를 가져오기를 기다리며, 강력한 컴퓨터를 가만히 방치합니다. 경주 도중 반나절 동안 신발 끈을 묶기 위해 멈추는 스프린터와 같습니다.

병목 현상: 이 두 단계가 순차적으로 (한 번에 하나씩) 발생하기 때문에, 강력한 컴퓨터는 "계획하는 사람"이 느리게 작동하는 동안 많은 시간을 기다리며 보냅니다. 이는 에너지를 낭비하고 전체 속도를 늦춥니다.

3. 해결책: "단계 건너뛰기"와 "병렬 주차"

이를 해결하기 위해 팀은 로봇을 "바보"처럼 만들지 않고 (정확도 저하 없이) 더 빠르게 만드는 두 가지 영리한 트릭을 고안했습니다.

트릭 A: "단계 건너뛰기" 캐시 (DP-Cache)

"계획하는 사람" 부분은 종종 움직임을 파악하기 위해 100 개의 작은 단계를 밟으며, 마치 완벽한 그림을 완성할 때까지 그림을 반복해서 스케치하는 방식으로 작동합니다.

  • 해결책: 연구자들은 이 과정의 중간에 스케치가 한동안 크게 변하지 않는다는 것을 발견했습니다. 따라서 그들은 **캐시 (메모리 단축키)**를 구축했습니다. 스케치가 안정화되면 로봇은 처음부터 다시 계산하는 대신 이전 결과를 재사용합니다.
  • 비유: 벽을 페인트칠한다고 상상해 보세요. 매 평방 인치마다 새로운 페인트를 섞어 바르는 대신, 중간 부분은 이미 건조되어 완벽하다는 것을 깨닫고 페인트칠을 건너뛰고 가장자리로 이동합니다. 이로 인해 일부 작은 칩에서 최대 6 배의 속도 향상을 얻었습니다.

트릭 B: "조립 라인" (V-AEFusion)

"사고하는 사람"과 "계획하는 사람"이 보통 한 번에 하나씩 작동하기 때문에 컴퓨터는 유휴 상태가 됩니다.

  • 해결책: 두 부분이 조립 라인처럼 동시에 작동하도록 만들었습니다. "사고하는 사람"이 현재 장면을 보는 동안, "계획하는 사람"은 이전 장면의 데이터를 사용하여 다음 움직임을 시작합니다. 로봇은 천천히 움직이기 때문에 "이전" 장면과 "현재" 장면은 거의 동일하므로 "계획하는 사람"이 혼란을 겪지 않습니다.
  • 비유: 야채를 썰고 있는 셰프 (사고하는 사람) 와 이를 볶고 있는 요리사 (계획하는 사람) 를 상상해 보세요. 셰프가 모든 야채를 다 썰기를 기다렸다가 요리사가 볶기 시작하는 대신, 요리사는 셰프가 두 번째 배치의 야채를 썰고 있는 동안 첫 번째 배치를 볶기 시작합니다. 이렇게 하면 주방 (컴퓨터) 이 계속 바쁘게 움직이며 더 빠르게 진행됩니다.

4. 결론

이 논문은 다음과 같이 결론 내립니다.

  1. 과도한 지출 금지: 로봇을 구동하기 위해 항상 가장 비싼 컴퓨터가 필요한 것은 아닙니다. 올바른 칩을 선택하면 작고 저렴한 칩도 똑같이 잘 수행할 수 있습니다.
  2. 리듬 이해: 로봇 뇌에는 "바쁜" 단계와 "기다리는" 단계가 있습니다.
  3. 현명한 단축키: 불필요한 계산을 건너뛰고 뇌의 다른 부분들이 병렬로 작동하도록 하면, 재학습이나 추가 비용 없이 로봇을 2 배에서 6 배까지 더 빠르게 만들 수 있습니다.

연구팀은 또한 어떤 로봇 뇌가 어떤 특정 컴퓨터 칩에서 가장 잘 작동하는지 누구나 확인할 수 있는 공개 웹사이트 (리더보드) 를 구축하여 엔지니어들이 더 좋고 저렴한 로봇을 구축하는 데 도움을 주고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →