← 최신 논문
💻 computer science

OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models

이 논문은 사전 학습된 비전 - 언어 모델 (VLM) 을 기반으로 단일 트랜스포머 디코더 내에서 비언어적 구조화 출력과 텍스트 생성을 통합하여 다양한 자율 주행 태스크를 처리하는 'OneDrive' 프레임워크를 제안하며, 이를 통해 기존 방법론의 아키텍처 단편화를 해소하고 nuScenes 및 NAVSIM 벤치마크에서 최첨단 성능을 달성했습니다.

원저자: Yiwei Zhang, Xuesong Chen, Jin Gao, Hanshi Wang, Fudong Ge, Weiming Hu, Shaoshuai Shi, Zhipeng Zhang

게시일 2026-04-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yiwei Zhang, Xuesong Chen, Jin Gao, Hanshi Wang, Fudong Ge, Weiming Hu, Shaoshuai Shi, Zhipeng Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🚗 OneDrive: 자율주행차의 '만능 두뇌'를 만든 혁신적인 연구

이 논문은 자율주행차의 인공지능이 어떻게 **눈 (카메라), 입 (말하기), 손 (운전)**을 하나로 통합해 더 똑똑하고 안전하게 운전할 수 있게 했는지 설명합니다.

이 연구의 핵심은 **'OneDrive'**라는 새로운 시스템을 개발한 것입니다. 기존 방식의 복잡한 문제를 해결하기 위해, 마치 한 명의 천재 운전 기사가 모든 일을 동시에 처리하듯 설계되었습니다.


1. 기존 방식의 문제점: "분업의 비효율" 🤯

기존의 자율주행 AI 는 일을 할 때 여러 명의 전문가를 따로 불러 모으는 방식이었습니다.

  • 시각 전문가: 차를 보고 사물을 인식합니다.
  • 언어 전문가: 상황을 설명하거나 명령을 받습니다.
  • 운전 전문가: 핸들을 돌리고 가속페달을 밟습니다.

비유하자면?

한 식당에서 요리사가 요리를 하고, 서빙하는 사람이 따로 있고, 계산하는 사람이 따로 있는 것과 같습니다. 각자가 따로따로 일하다 보니, 정보가 오가는 데 시간이 걸리고, 서로의 의도를 오해할 수도 있습니다. 또한, 각자 다른 도구 (머리) 를 쓰기 때문에 훈련 비용도 많이 듭니다.

이런 방식은 AI 가 **이미지 (시각)**만 보고 **글 (언어)**을 쓰거나, **운전 (행동)**을 하는 등 서로 다른 일을 할 때, 구조가 너무 복잡해져서 대규모 데이터로 함께 학습하기 어렵게 만들었습니다.


2. OneDrive 의 해결책: "한 명의 만능 천재" 🧠✨

OneDrive 는 이 모든 일을 **단 하나의 거대한 뇌 (Transformer 디코더)**로 처리합니다.

핵심 아이디어: "주의 (Attention) 는 공유하되, 손 (FFN) 은 상황에 맞게 쓴다"

이 시스템은 이미 **대규모 데이터로 훈련된 '언어 - 시각 모델 (VLM)'**이라는 훌륭한 기초 지식을 가져옵니다.

  • 기존의 문제: 이 기초 지식을 운전이라는 새로운 일에 적용하려니, '말하는 방식'과 '운전하는 방식'이 달라서 충돌이 일어났습니다.
  • OneDrive 의 해법:
    1. 눈 (Attention) 은 그대로: 이미 훈련된 '주의를 기울이는 능력'은 그대로 둡니다. 이 능력은 사물을 보고 문맥을 이해하는 데 이미 훌륭하기 때문입니다.
    2. 손 (FFN) 은 교체: 하지만 구체적인 일을 처리하는 '손' 부분 (데이터를 변환하는 부분) 은 운전, 물체 감지, 말하기 등 각 작업에 맞게 새로 교체합니다.

창의적인 비유:

imagine 한 명의 베테랑 요리사가 있다고 상상해 보세요.

  • 그는 **맛을 보고 재료를 구별하는 능력 (주의/Attention)**은 이미 천재 수준입니다. 이 능력은 그대로 유지합니다.
  • 하지만 **요리할 때 쓰는 칼질 (운전), 접시 차림 (물체 감지), 손님에게 메뉴 설명하기 (말하기)**는 각각 다른 기술이 필요하죠.
  • OneDrive 는 이 요리사가 **하나의 주방 (단일 디코더)**에서, 같은 재료를 보면서도 상황에 따라 칼질, 접시 차림, 설명을 동시에 해내는 방식을 개발한 것입니다.

3. 어떻게 작동할까요? "한 줄의 이야기" 📜🚗

OneDrive 는 모든 정보를 **하나의 긴 이야기 (토큰 시퀀스)**로 만듭니다.

  1. 카메라 이미지를 글자처럼 나열합니다.
  2. **차량 주변의 사물 (자동차, 보행자)**을 감지하는 질문 (쿼리) 을 추가합니다.
  3. **앞으로 갈 경로 (운전 계획)**를 위한 질문을 추가합니다.
  4. 필요한 경우 말로 설명할 글자도 추가합니다.

이 모든 것을 하나의 줄에 나열하고, AI 가 앞에서부터 순서대로 읽어가며 (Causal Attention) 모든 것을 결정합니다.

  • "저기 빨간 차가 보이니 (이미지), 그 차를 피해서 (질문), 오른쪽으로 살짝 핸들을 돌리고 (운전), '앞차에 주의하세요'라고 말해줘 (글자)."

이렇게 하면 운전과 말하기, 감지가 서로의 정보를 자연스럽게 공유하게 되어, 훨씬 더 안전하고 정확한 운전이 가능해집니다.


4. 실제 성과: "더 빠르고, 더 똑똑한 운전" 🏆

이 시스템을 실제 도로 시뮬레이션 (nuScenes, NAVSIM) 에서 테스트한 결과는 놀라웠습니다.

  • 정확도: 차가 길을 벗어날 확률 (L2 오차) 이 가장 낮았고, 사고율 (Collision Rate) 이 0.18% 로 극도로 낮아졌습니다. (기존 최고 수준보다 훨씬 안전함)
  • 속도: 기존 방식보다 약 40% 더 빠릅니다. (약 264ms → 156ms)
    • 비유: 복잡한 계산기를 여러 대 돌려서 답을 구하던 것을, 한 대의 슈퍼컴퓨터로 한 번에 해결한 것과 같습니다.

5. 결론: 자율주행의 새로운 시대 🌟

OneDrive 는 **"자율주행차의 두뇌"**를 단순화하면서도 성능을 극대화한 획기적인 연구입니다.

  • 기존: 여러 개의 작은 뇌를 연결해서 복잡한 일을 시킴.
  • OneDrive: 하나의 거대한 뇌가 모든 일을 통합적으로 처리함.

이 기술은 자율주행차가 더 안전하고, 더 빠르게, 그리고 사람처럼 상황을 이해하며 운전할 수 있는 토대를 마련해 주었습니다. 마치 한 명의 완벽한 운전 기사가 우리 모두를 안전하게 목적지까지 데려다주는 날이 머지않았음을 보여주는 연구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →