← 최신 논문
💻 computer science

Efficient Block-Layer Parallel Inference for Vision-Language-Action on Hybrid Architectures

본 논문은 비전-언어-행동(VLA) 모델을 블록 레이어 단위로 분할하여 비동기 파이프라인을 통해 CPU로 연산을 오프로딩하는 하이브리드 CPU-GPU 추론 프레임워크를 제시하며, 이를 통해 자원 제한적인 자율 주행 플랫폼에서의 성공적인 배포를 가능케 함으로써 추론 지연 시간과 GPU 메모리 사용량을 크게 줄인다.

원저자: Haibo HU, Lianming Huang, Qiao Li, Nan Guan, Chun Jason Xue

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haibo HU, Lianming Huang, Qiao Li, Nan Guan, Chun Jason Xue

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자율주행은 오랫동안 도로를 보는 것, 다른 차량의 이동 경로를 예측하는 것, 그리고 어떻게 조향할지 결정하는 것과 같이 별도의 컴퓨터 프로그램이 각기 다른 작업을 처리하는 모듈형 방식에 의존해 왔습니다. 이러한 시스템들은 서로 협력하며 작동하지만, 종종 경직되어 있어 복잡하고 변화하는 상황에 적응하는 데 어려움을 겪습니다. 최근에는 시각-언어-행동(Vision-Language-Action) 모델이라고 불리는 새로운 유형의 인공지능이 유망한 대안으로 등장했습니다. 이 모델들은 장면을 보고, 음성 명령이나 복잡한 교통 상황을 이해한 뒤, 즉시 물리적인 행동을 결정할 수 있는 인간 운전자처럼 하나의 통합된 뇌 안에서 모든 것을 수행합니다. 이러한 모델들은 더 부드럽고 안전한 주행을 구현할 수 있는 큰 잠재력을 보여주지만, 심각한 장애물에 직면해 있습니다. 바로 컴퓨터 자원을 엄청나게 많이 소모한다는 점입니다. 이 모델들은 막대한 양의 연산 능력과 메모리를 요구하며, 이는 현재 자율주행 자동차에 탑재된 특수 그래픽 칩을 압도하곤 합니다. 이는 자동차의 컴퓨터가 모델의 요구 사항을 따라가지 못하는 병목 현상을 만들어, 속도나 안전을 희생하지 않고는 이러한 첨단 시스템을 실제 차량에 설치하는 것을 어렵게 만듭니다.

홍콩 시립대학교와 모하메드 빈 자이드 인공지능 대학교의 연구진은 모델 자체를 변경하지 않고도 이 강력한 모델들을 실행할 수 있는 새로운 방법을 개발하여 이 자원 문제를 해결했습니다. 전체 인공지능의 뇌를 그래픽 칩에서 실행하도록 강제하는 대신, 그들은 작업의 역할을 그래픽 칩과 자동차의 메인 중앙 프로세서 사이로 나누었습니다. 연구진은 그래픽 칩이 도로를 '보는' 초기 작업에는 탁월하지만, 보통 이러한 무거운 시각 작업 중에 유휴 상태로 머무는 중앙 프로세서가 후속 단계의 추론을 처리하기에 충분히 능력이 있다는 것을 발견했습니다. 모델을 여러 층(layers)으로 나누어 첫 번째 층들은 그래픽 칩에 할당하고 마지막 층들은 중앙 프로세서에 할당함으로써, 그들은 균형 잡힌 시스템을 만들어냈습니다. 또한, 자동차는 끊임없이 움직이며 새로운 이미지의 흐름을 받아들이기 때문에, 연구진은 중앙 프로세서가 현재의 순간에 대한 추론을 수행하는 동안 그래픽 칩이 이미 다음 순간을 처리하기 시작하는 파이프라인을 설계했습니다. 이러한 작업의 중첩은 두 프로세서를 모두 바쁘게 가동시켜 의사 결정 과정을 크게 가속화합니다.

연구팀이 이 접근 방식을 두 가지 선도적인 자율주행 모델에 테스트했을 때, 결과는 상당했습니다. Orion이라는 모델의 경우, 주행 결정을 내리는 데 걸리는 시간이 521밀리초에서 408밀리초로 줄어들어 약 22% 감소했습니다. MindDrive라는 또 다른 모델의 경우, 시간은 443밀리초에서 306밀리초로 줄어들어 30% 이상 감소했습니다. 속도보다 아마도 더 중요한 것은 자동차의 메모리에 가해지는 부담을 완화했다는 점입니다. 기존의 Orion 모델은 그래픽 칩에 45기가바이트의 메모리를 요구했는데, 이는 너무 높은 수요여서 테스트 차량의 다른 필수 시스템들과 함께 실행될 수 없었습니다. 새로운 하이브리드 방식은 이 요구량을 29기가바이트로 줄여, 기존 버전이 완전히 실패했던 동일한 하드웨어에서 모델이 성공적으로 실행될 수 있도록 했습니다. 이러한 테스트 전반에 걸쳐 주행 결정의 품질은 변함이 없었습니다. 즉, 자동차가 더 나쁘게 운전하거나 더 자주 충돌하지 않았으며, 이는 속도 향상이 안전을 희생하며 얻어진 것이 아님을 증명했습니다.

연구진은 단순히 작업을 나누는 것만으로는 충분하지 않으며, 그 분할의 타이밍이 매우 중요하다는 사실도 발견했습니다. 만약 중앙 프로세서에 너무 많은 작업을 할당하면, 그것이 새로운 병목 지점이 되어 전체 속도를 늦추게 됩니다. 반대로 너무 적게 할당하면 그래픽 칩이 계속 과부하 상태로 남게 됩니다. 연구진은 작업량이 균등하게 배분되어 시스템이 가장 빠른 속도를 달성할 수 있는 특정 균형점을 찾아냈습니다. 또한, 그들은 중첩 파이프라인이 필수적임을 확인했습니다. 파이프라인이 없다면 시스템은 여전히 한 작업이 완전히 끝날 때까지 기다린 후에 다음 작업을 시작해야 하므로, 두 프로세서를 사용하는 이점이 상쇄될 것입니다. 프로세서들이 서로 다른 영상 프레임을 동시에 처리하게 함으로써, 시스템은 안정적이고 빠른 의사 결정의 흐름을 달성했습니다.

이 연구는 현재의 자율주행 하드웨어의 한계가 막다른 길이 아니라, 오히려 작업이 어떻게 분배되어야 하는지를 재고하라는 신호임을 보여줍니다. 이 연구는 자동차의 컴퓨터를 단일한 강력한 장치가 아닌 전문가들의 팀으로 취급함으로써, 기존 차량에 고급 대규모 인공지능 모델을 배치하는 것이 가능하다는 점을 시사합니다. 연구진은 자신들의 시스템을 실제 차량에서 표준 자율주행 소프트웨어 세트와 함께 실행함으로써, 이 하이브리드 접근 방식이 단순한 이론적 개선이 아니라 자동차를 운전하는 데 이미 필요한 복잡한 소프트웨어와 공존할 수 있는 실질적인 해결책임을 입증했습니다. 이러한 결과는 더 강력한 하드웨어를 기다리는 것보다 효율적인 시스템 설계가 이러한 정교한 주행 모델을 현실 세계로 가져오는 핵심이라는 점을 나타냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →