← 최신 논문
💻 computer science

From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving

본 논문은 엔드투엔드 자율주행에서 시각-언어 모델과 시각 전용 인코더 사이의 표현 및 행동적 상보성을 조사하며, 단순한 시나리오와 복잡한 시나리오에서의 각기 다른 강점을 활용하는 하이브리드 구조가 단독 베이스라인 모델보다 정확도와 효율성을 유의미하게 향상시킨다는 것을 입증한다.

원저자: Sining Ang, Yuguang Yang, Chenxu Dang, Canyu Chen, Cheng Chi, Haiyan Liu, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sining Ang, Yuguang Yang, Chenxu Dang, Canyu Chen, Cheng Chi, Haiyan Liu, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 자동차 운전하는 법을 가르치고 있다고 상상해 보세요. 오랫동안 엔지니어들은 두 가지 서로 다른 '뇌'를 사용하여 로봇을 가르치려 노력했습니다. 한 가지 뇌는 비전 전용(Vision-Only) 모델로, 이는 초정밀 관찰력을 가진 사진가와 같습니다. 도로, 차선, 자동차를 놀라운 선명도로 보지만, 그것들이 더 넓은 맥의 맥락에서 무엇을 의미하는지에 대해서는 깊이 '생각'하지 못합니다. 다른 뇌는 **시각-언어 모델(VLM)**로, 이는 사진가이면서 동시에 철학자인 것과 같습니다. 이 모델은 똑같은 도로를 보지만, 길 표지판을 읽을 수 있고, 복잡한 사회적 신호(예: 길을 건너려다 망설이는 보행자)를 이해하며, 언어를 사용하여 "만약 ~한다면 어떻게 될까"와 같은 시나리오에 대해 추론할 수 있습니다.

한동안 자율주행 자동차 업계의 큰 화두는 이것이었습니다: "우리는 비싸고 무거운 철학자 뇌가 꼭 필요한가, 아니면 날카로운 사진가 뇌만으로도 충분한가?" 어떤 이들은 철학자가 엄격히 더 낫다고 생각했고, 또 어떤 이들은 사진가가 더 빠르고 저렴하게 그 일을 해낼 수 있기를 바랐습니다. 하지만 누구도 이 두 종류의 뇌가 실제로 결정을 내릴 때 어떻게 다른지, 혹은 단순히 서로 다른 방식으로 같은 말을 하고 있는 것뿐인지 알지 못했습니다. 이 논문은 이 미스터리를 파헤치기 위해, 두 종류의 뇌가 실제로 중복되는 것인지(같은 일을 하는지), 아니면 특정 상황에서만 나타나는 비밀스러운 초능력을 가지고 있는지 확인하기 위해 로봇의 의사결정 과정을 탐정 소설처럼 다룹니다.

탐정 작업: 두 개의 뇌, 하나의 도로

연구진은 NAVSIM이라는 디지털 주행 코스에서 이 두 종류의 '뇌'를 맞붙이는 통제된 실험을 설계했습니다. 그들은 단순히 운전을 시킨 것이 아니라, 두 가지 핵심 순간에 뉴런에 마이크를 대고 그들이 무엇을 생각하는지 귀를 기울였습니다. 첫째는 도로를 보고 있을 때(백본(backbone) 단계)이고, 둘째는 조향 방향을 결정하기 직전(결정(decision) 단계)입니다.

여기서 그들은 발견을 했으며, 이는 일종의 반전입니다.

1. 시작은 다르지만, 대부분 합의하는 법을 배웁니다.
로봇이 처음 도로를 보았을 때, '철학자'(VLM)와 '사진가'(Vision-Only)는 세상을 매우 다르게 보았습니다. 그들의 내부 지도는 확연히 달랐습니다. 그러나 일단 운전을 배우기 시작하자(정책 학습 단계), 그들은 도로의 상당 부분에 대해 의견이 일치하기 시작했습니다. 이는 마치 두 사람이 춤을 배우는 것과 같습니다. 스타일은 다를 수 있지만, 빠르게 함께 기본 스텝을 익히게 됩니다. 연구진은 의사결정 공간의 약 **54%**가 두 모델 사이에서 공유된다는 것을 발견했습니다.

2. 하지만 결코 동일해지지는 않습니다.
이것이 핵심적인 부분입니다. 학습을 마친 후에도 그들은 완전히 똑같은 로봇으로 붕괴되지 않았습니다. 그들은 여전히 자신만의 고유한 '잔여(residual)' 부분을 뇌에 남겨두었습니다. 연구진은 두 존재의 공통점과 고유함을 분리해내는 마법의 필터인 Shared–Unique SAE라는 도구를 사용하여 이를 증명했습니다. 그들은 두 모델이 운전의 '상식'은 많이 공유하지만, 서로 복제할 수 없는 각자만의 '비법 소스'를 여전히 가지고 있다는 것을 발견했습니다.

3. '비법 소스'는 무작위가 아닙니다. 바로 상황에 관한 것입니다.
이 대목에서 이야기는 흥кси팅해집니다. 연구진은 질문했습니다: "언제 철학자가 이기고, 언제 사진가가 이기는가?"

  • **사진가(Vision-Only)**는 단순하고 기하학적인 도로의 챔피언입니다. 과제가 맑은 날 직선 차선을 유지하는 것이라면, 사진가는 종종 더 보수적이고 안정적입니다.
  • **철학자(VLM)**는 혼돈 속에서 빛을 발합니다. 도로가 이상해질 때—예를 들어 혼란스러운 콘이 놓인 공사 구간, 명확한 차선이 없는 좁은 골목, 또는 보행자가 어떻게 행동할지 예측해야 하는 번잡한 교차로 등—철학자의 고유한 '언어 및 추론' 뇌가 주도권을 잡습니다. 이러한 "롱테일(long-tail, 희귀하고 까다로운)" 시나리오에서 철학자는 결정적으로 더 뛰어났습니다.

4. 어떤 것을 사용할지 그냥 예측할 수는 없습니다.
연구팀은 로봇의 '생각'을 보고 "좋아, 이건 단순한 도로니까 사진가를 쓰자"라거나 "이건 까다로우니 철학자로 전환하자"라고 결정하는 간단한 스위치를 만들려고 시도했습니다. 그들은 로봇의 내부 신호를 바탕으로 다양한 방식을 시도했습니다. 실패했습니다. 연구팀은 로 raw 데이터만 보고 어떤 뇌가 더 나을지 신뢰성 있게 예측할 수 있다는 아이디어를 명시적으로 부정했습니다. 신호가 너무 복잡했습니다. 차이는 무엇을 '보느냐'가 아니라, 어떻게 '행동하느냐'에 있었습니다.

해결책: "빠른-느린" 팀

완벽하게 어떤 뇌를 사용할지 예측할 수 없었기에, 연구진은 HybridDriveVLADualDriveVLA라는 영리한 시스템 설계를 고안했습니다.

한 쪽 뇌를 선택해 운에 맡기는 대신, 그들은 둘 다 실행하기로 했습니다.

  • HybridDriveVLA는 사진가와 철학자를 병렬로 실행합니다. 그런 다음 두 가지 서로 다른 주행 경로를 가져와서, 두 경로를 혼합한 경로를 포함한 '메뉴'를 만듭니다. 그러면 스마트한 채점기가 이 메뉴에서 가장 완벽한 경로를 선택합니다. 이 방식은 NAVSIM 테스트에서 92.10점을 기록했는데, 이는 철학자 하나만 사용했을 때(90.80점)보다 유의미한 향상입니다.

하지만 두 개의 뇌를 실행하는 것은 비용이 많이 들고 느립니다. 그래서 그들은 DualDriveVLA라는 "빠른-느린(Fast-Slow)" 시스템을 만들었습니다.

  • 이 버전에서 로봇은 기본적으로 빠른 사진가를 사용합니다. 주행하면서 자신의 확신 점수를 체크합니다. 도로가 단순해 보이고 점수가 높다면 그대로 계속 주행합니다.
  • 하지만 도로가 까다로워 보이거나 점수가 떨어지면, 즉시 느린 철학자를 호출하여 재검토를 요청하고 더 나은 경로를 제공받습니다.
  • 결과는 어땠을까요? 이 시스템은 비싼 철학자를 전체 주행 시나리오의 약 15% 정도에서만 호출했습니다. 그럼에도 불구하고 점수는 91.00으로 개선되었으며, 자동차를 거의 1.9배 더 빠르게(지연 시간을 약 280ms에서 150ms로 단축) 만들었습니다.

요약

이 논문은 자율주행 자동차의 세계에서 우리가 단지 "거대한 언어 모델이 더 나은가?"라고 물어서는 안 된다고 제안합니다. 답은 "상황에 따라 다르다"입니다. 거대 모델과 작은 비전 모델은 중복되는 것이 아니라 상호 보완적입니다. 그들은 서로 다른 강점을 가지고 있으며, 이는 주행 시간의 서로 다른 부분에서 나타납니다. 최선의 전략은 승자를 고르는 것이 아니라, 빠른 단순 뇌가 힘든 일을 처리하고, 똑똑하고 복잡한 뇌가 도로가 이상해지는 순간 정확히 개입할 수 있는 팀을 구축하는 것입니다. 이 "최고의 조합" 접근 방식은 단 하나의 완벽한 뇌가 발명되기를 기다리지 않고도, 자율주행 자동차를 더 똑똑하고 빠르게 만드는 방법을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →