← 최신 논문
💻 computer science

FlashDrive: Flash Vision-Language-Action Inference for Autonomous Driving

FlashDrive는 자율 주행을 위한 시각-언어-행동(Vision-Language-Action) 모델의 네 가지 계산 병목 현상을 동시에 최적화하여, 10B 파라미터 모델에서 정확도를 유지하거나 향상시키면서 실시간 배포를 가능하게 함으로써 4.7배의 지연 시간 감소(717ms에서 151ms로)를 달성한 알고리즘-시스템 공동 설계 프레임워크입니다.

원저자: Zekai Li, Yihao Liang, Hongfei Zhang, Jian Chen, Yesheng Liang, Zhijian Liu

게시일 2026-08-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zekai Li, Yihao Liang, Hongfei Zhang, Jian Chen, Yesheng Liang, Zhijian Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간처럼 생각하지만 나무늘보처럼 움직이는 자동차를 운전하는 것을 상상해 보십시오. 이것이 현재 자율주행 분야의 '시각-언어-행동(Vision-Language-Action, VLA)' 모델이 처한 현주소입니다. 이 모델들을 단순히 도로를 보는 것(시각)을 넘어, 무엇을 할지 스스로에게 말하고(언어), 실제로 핸들을 조작하는(행동) 초지능적인 부조종사라고 생각해 보십시오. 이 모델들은 모든 상황에 대해 별도의 경직된 규칙을 사용하는 대신, 인간이 그러하듯 복잡하고 무질서한 교통 상황을 추론하려고 시도합니다. 문제는 무엇일까요? 이들은 믿기 힘들 정도로 느립니다. 현재는 단 하나의 결정을 내리는 데 시간이 너무 오래 걸려, 고속도로 주행 속도에서는 차가 사실상 멈춰 있는 것이나 다름없는 위험한 상태입니다. 과학자들이 던지는 핵심 질문은 이것입니다: 어떻게 하면 이 초지능적인 두뇌가 지능을 잃지 않으면서도 실시간으로 주행할 수 있을 만큼 빠르게 생각하게 만들 것인가?

여기, 이 느릿느릿한 슈퍼컴퓨터를 속도광으로 바꾸기 위해 설계된 새로운 프레임워크, FlashDrive가 등장했습니다. 연구진은 이 느린 속도가 하나의 큰 문제 때문이 아니라, 각각 다른 방식으로 에너지를 낭비하는 네 가지의 작고 뚜렷한 병목 현상 체인 때문에 발생한다는 것을 발견했습니다. 그들은 자동차의 두뇌를 바쁜 공장의 조립 라인처럼 취급했고, 네 곳의 특정 지점에서 작업자들이 불필요한 잔업을 하고 있다는 것을 찾아냈습니다.

첫째, 비전 인코더(Vision Encoder)(눈)는 비디오의 같은 부분을 반복해서 다시 읽고 있었습니다. 마치 영화를 볼 때마다 매 초마다 이전 한 시간 분량의 대본을 처음부터 다시 읽어야 현재 장면을 이해할 수 있는 상황과 같습니다. FlashDrive는 '스트리밍' 방식을 사용하여 모델이 오직 새로운 프레임만을 보고 나머지는 기억하도록 함으로써 이 문제를 해결하며, 이를 통해 시각 처리 시간을 약 75% 단축했습니다.

둘째, 프리필(Prefill) 단계(생각할 준비 단계)에서도 똑같은 재독해 실수가 발생하고 있었습니다. 모델은 지난 순간에 이미 알고 있었던 맥락을 다시 계산하고 있었습니다. FlashDrive는 이전 단계의 '기억'을 그대로 이어받아, 두뇌가 매번 처음부터 다시 시작할 필요가 없도록 해결했습니다.

셋째, 디코드(Decode) 단계(실제 생각하기)는 너무 예의를 차리고 있었습니다. 답이 명확하고 예측 가능한 상황임에도 불구하고, 마치 사람이 문장을 천천히 속삭이듯 한 단어씩 생성하고 있었습니다. FlashDrive는 '추측적(speculative)' 접근 방식을 도입하여, 가볍고 빠른 드래프트 모델을 사용해 한 번에 문장 덩어리를 통째로 추측하게 했습니다. 이는 마치 속독 능력을 갖춘 조수가 문단 전체를 빠르게 휘갈겨 쓰면, 메인 두뇌가 그것이 맞는지 빠르게 확인만 하는 것과 같습니다. 이 방식은 느릿한 단계별 과정을 신속한 사고의 폭발로 바꾸어 놓았습니다.

마지막으로, 액션(Action) 단계(자동차 움직이기)는 세부 사항에 과하게 몰두하고 있었습니다. 경로의 중간 부분은 지루하고 예측 가능한데도 불구하고, 경로를 매끄럽게 만들기 위해 너무 많은 복잡한 수학적 단계를 수행하고 있었습니다. FlashDrive는 자동차의 움직임 속도가 회전의 아주 시작과 끝 부분에서만 급격히 변한다는 점을 깨달았습니다. 그래서 지루한 중간 단계들은 '캐싱(저장)'하고, 실제로 중요한 부분에서만 무거운 수학 연산을 수행하도록 했습니다.

이 네 가지 영리한 지름길을 시스템 레벨의 기술(컴퓨터의 작업을 조직화하여 대기 줄을 피하는 방식 등)과 결합함으로써, FlashDrive는 놀라운 성과를 거두었습니다. 강력한 그래픽 카드에서 주행 결정을 내리는 데 걸리는 시간을 717밀리초에서 151밀리초로 단축했습니다. 이는 4.7배의 속도 향상이며, 자동차의 제어 빈도를 느릿한 초당 1.4회에서 민첩한 초당 6.6회로 끌어올렸습니다.

결정적으로, 논문은 이러한 속도 향상이 안전이나 정확도를 희생하며 이루어진 것이 아님을 보여줍니다. 시뮬레이션 결과, 차선 유지 및 장애물 회피 능력은 거의 동일하게 유지되었으며, 일부 지표는 오히려 약간 개선되었습니다. 연구진은 강력한 워크스테이션부터 작은 엣지 디바이스에 이르기까지 다양한 하드웨어에서 이를 테스트했으며, FlashDrive가 실시간 엔드 투 엔드 자율주행을 현실에 훨씬 더 가깝게 만들었음을 입증했습니다. 그들은 단순히 자동차를 빠르게 만든 것이 아니라, 실제로 도로 위를 달릴 수 있을 만큼 빠르게 만든 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →