MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving
MindVLA-U1 는 공유 백본과 메모리 채널을 통해 autoregressive 언어 추론과 플로우 매칭 기반의 연속 행동 생성을 통합하여 자율 주행용 최초의 통합 스트리밍 비전 - 언어 - 행동 아키텍처를 도입함으로써, WOD-E2E 벤치마크에서 인간 성능을 능가하는 언어 기반 궤적 제어를 가능하게 하면서도 실시간 처리량을 유지합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 운전하는 법을 가르쳐 보라고 상상해 보세요. 오랫동안 이를 위한 최선의 방법은 도로를 보고 즉시 조향과 브레이킹을 결정하는 시스템을 구축하는 것이었습니다. 이는 반사 작용과 같습니다. 공이 당신을 향해 굴러오는 것을 보면, 생각 없이 손이 움직여 공을 잡는 것과 마찬가지입니다. 이 논문에서는 이를 시각-행동 (Vision-to-Action, VA) 모델이라고 부릅니다. 이는 놀라울 정도로 빠르고 정밀하지만, '블랙박스'입니다. 왜 그런 움직임을 했는지 물어볼 수 없으며, 이전에 본 적 없는 이상한 것을 마주하면 어려움을 겪습니다.
그런 다음 연구자들은 사고하고 추론할 수 있는 '두뇌'를 추가하여 시각 - 언어 - 행동 (Vision-Language-Action, VLA) 모델을 만들었습니다. 아이디어는 "차에 언어 모델을 부여하여 인간처럼 세상을 이해하게 하자"는 것이었습니다. 하지만 여기에 문제가 있었습니다. 이러한 새로운 시스템 대부분이 서툴렀습니다. 느렸고, 반사 작용만 있는 모델만큼 정밀하게 조향할 수 없었으며, '말하기' 부분이 실제로 '운전' 부분을 돕지 못했습니다. 이는 레이싱 카를 운전하러 영리한 철학자를 고용했지만, 그 철학자가 뒷좌석에 묶여 유용하기엔 너무 늦게 도착하는 지시를 외치는 것과 같았습니다.
MindVLA-U1은 저자가 제안하는 해결책입니다. 그들은 문제가 '사고'와 '운전'이 양립할 수 없기 때문이 아니라, 잘못된 인터페이스로 구축되었기 때문이라고 주장합니다.
다음은 간단한 비유를 사용하여 MindVLA-U1 이 작동하는 방식입니다:
1. "하나의 두뇌" 아키텍처
메모를 주고받는 별도의 '사고' 모듈과 별도의 '운전' 모듈을 갖는 대신, MindVLA-U1 은 단일 통합된 두뇌를 사용합니다.
- 비유: 오케스트라를 지휘하는 지휘자를 상상해 보세요. 기존 시스템에서는 지휘자 (언어 모델) 가 악보를 작성하여 별도의 악기 섹션 (행동 모델) 에 전달하고 그들이 올바르게 연주하기를 바랐습니다. 반면 MindVLA-U1 에서 지휘자 그 자체가 오케스트라입니다. "도로가 얼어붙었다"는 언어를 이해하는 뉴런이 조향 각도를 계산하는 정확히 같은 뉴런입니다.
- 결과: 차는 자신이 보는 것에 대해 자연스럽게 말하면서도 동시에 센티미터 단위의 정밀도로 운전할 수 있으며, 두 작업 모두에 동일한 '가중치 (기억)'를 사용합니다.
2. "스트리밍" 메모리 (더 이상 청크 단위로 나누지 않음)
이전 시스템은 짧은 고정된 클립 (5 초 단위의 영화 감상과 유사) 으로 도로를 관찰하며 학습하려고 시도했습니다. 이로 인해 차는 클립 사이의 경계에서 "얼어붙는" 현상이 발생하여, 불과 1 초 전에 일어난 일을 잊어버렸습니다.
- 비유: 책을 한 장씩만 보고는 책을 닫았다가 다음 장을 여는 방식으로 읽는다고 상상해 보세요. 흐름을 잃게 됩니다. MindVLA-U1 은 책을 한 단어씩, 연속적으로 읽습니다.
- 메커니즘: 이는 '스트리밍 메모리' 채널을 사용합니다. 이를 최근 몇 초간의 운전 요약본을 운반하는 컨베이어 벨트로 생각하세요. 차가 움직이면 벨트 뒤쪽에서 가장 오래된 요약본을 떨어뜨리고 앞쪽에 새로운 요약본을 추가합니다. 이를 통해 차는 매번 전체 비디오를 다시 읽는 데 매몰되지 않고 먼 거리를 부드럽게 계획할 수 있습니다.
3. "의도" 브릿지 (운전대를 조종하는 언어)
이것은 이 논문의 가장 큰 돌파구입니다. 이전 시스템에서 차의 '언어'는 단순한 부수적 현상이었으며, 실제로 조향을 제어하지 못했습니다.
- 비유: "좌회전 하세요"라고 말하는 내비게이션이 있지만, 차는 이를 무시하고 직진하는 상황을 상상해 보세요. MindVLA-U1 에서 언어 부분은 바로 운전대 그 자체입니다.
- 작동 방식: 차는 먼저 "직진" 또는 "차선 변경"과 같은 간단한 '의도'를 단어로 예측합니다. 그런 다음 이 단어를 운전 경로를 생성하는 수학을 안내하는 리모컨으로 사용합니다. 차가 "직진"을 예측하면 수학은 직진 경로를 만들도록 살짝 조정됩니다. "회전"을 예측하면 수학은 회전하도록 조정됩니다. 이는 언어가 단순히 말하는 것이 아니라 물리적으로 차의 결정을 조종하고 있음을 증명합니다.
4. 빠르고 느린 모드 (반사 작용 대 사고하는 자)
AI 차량에 대한 일반적인 불만은 "사고"를 너무 많이 하기 때문에 비상 상황에서 반응하는 데 너무 느리다는 것입니다.
- 비유: 인간 운전자를 생각해 보세요. 고속도로를 주행할 때는 **반사 작용 (시스템 1)**으로 운전합니다. 복잡한 교차로에 접근하면 **사고 (시스템 2)**를 합니다.
- 혁신: MindVLA-U1 은 동일한 두뇌를 사용하여 이러한 모드 사이를 즉시 전환할 수 있습니다.
- 빠른 모드: '사고' 부분을 건너뛰고 반사 작용만으로 운전합니다. 이는 이전의 말을 하지 않는 모델만큼 빠릅니다.
- 느린 모드: 복잡한 시나리오를 파악하기 위해 전체 언어 추론을 활성화합니다.
- 이점: 사고하는 운전자의 안전성을 유지하면서도 반사 작용 운전자의 속도를 희생하지 않습니다.
결과: 인간을 능가함
저자들은 매우 어렵고 실제적인 운전 데이터셋 (Waymo Open Dataset) 에서 이를 테스트했습니다.
- 점수: 그들은 인간 전문가가 0 에서 10 점 척도로 운전 경로의 질을 평가하는 "평가자 피드백 점수 (RFS)"라는 지표를 사용했습니다.
- 성과: MindVLA-U1 은 8.20점을 기록한 반면, 데이터셋 내 최고의 인간 운전자는 8.13점을 받았습니다.
- 의미: 처음으로 AI 시스템이 인간 전문가들이 경험 많은 인간 운전자의 것보다 약간 더 좋다고 평가하는 운전 경로를 계획하는 것으로 입증되었으며, 이는 동시에 도로에 대해 말하고 추론할 수 있는 능력을 유지하면서 이루어졌습니다.
요약
MindVLA-U1 은 '인터페이스' 문제를 해결합니다. 언어와 운전을 붙여야 하는 별도의 두 가지 작업으로 취급하는 것을 중단합니다. 대신, 사고와 수행이 동일한 순간에 발생하는 단일 시스템을 구축합니다. 이는 연속적인 메모리 스트림과 단어가 물리적으로 차를 조종할 수 있는 직접적인 브릿지를 사용합니다. 말할 수 있는 차와 잘 운전하는 차 사이에서 선택해야 한다는 것은 사실이 아니며, 둘 다 가질 수 있고 실제로 서로 도울 수 있음을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.