← 최신 논문
💻 computer science

Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving

Drive-JEPA는 예측적 표현 학습을 위한 비디오 합동 임베딩 예측 아키텍처(V-JEPA)와 단일 궤적 감독의 한계를 극복하기 위해 멀티모달 시뮬레이터 생성 궤적을 증류하는 제안 중심 플래너를 통합함으로써 엔드 투 엔드 자율 주행의 새로운 최첨단 기술을 확립합니다.

원저자: Linhan Wang, Zichong Yang, Chen Bai, Guoxiang Zhang, Xiaotong Liu, Xiaoyin Zheng, Xiao-Xiao Long, Chang-Tien Lu, Cheng Lu

게시일 2026-07-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Linhan Wang, Zichong Yang, Chen Bai, Guoxiang Zhang, Xiaotong Liu, Xiaoyin Zheng, Xiao-Xiao Long, Chang-Tien Lu, Cheng Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자율주행 자동차에게 단순히 인간이 운전하는 몇 가지 사례를 보여주는 것을 넘어, 방대한 양의 운전 영화 라이브러리를 공부하게 하고, 그 다음 초고성능 비디오 게임 시뮬레이터에서 연습하게 한다고 상상해 보세요. 이것이 바로 Drive-JEPA가 하는 일입니다.

다음은 이 새로운 시스템이 어떻게 작동하는지 쉬운 비유를 사용하여 설명한 내용입니다.

1. 문제점: "단일 경로"의 함정

오늘날 대부분의 자율주행 자동차는 인간 운전자를 관찰하며 학습합니다. 하지만 여기에는 함정이 있습니다. 특정 상황(예: 황색 신호등에 접근할 때)에서 인간은 보통 하나의 특정한 행동만을 취합니다. 하지만 현실 세계에서는 어떤 상황을 처리하는 데 있어 여러 가지 안전한 방법이 존재할 수 있습니다(예: 부드럽게 속도를 줄이거나, 완전히 멈추거나).

만약 자동차가 오직 그 하나의 인간 경로만을 학습한다면, 자동차는 단 하나의 방법만이 존재한다고 생각하는 "경직된" 상태에 빠지게 됩니다. 이는 자동차가 유연성을 잃고 다른 안전하고 편안한 선택지들을 놓치게 만들 수 있습니다. 이를 **모드 붕괴(mode collapse)**라고 하며, 자동차가 문제를 해결하는 다양한 방법이 있다는 사실을 잊어버리는 현상을 말합니다.

2. 해결책: Drive-JEPA

연구진은 시간 여행 기능이 있는 타임머신과 비디오 게임 콘솔을 갖춘 숙련된 운전 강사처럼 작동하는 세 부분으로 구성된 시스템을 구축했습니다.

파트 A: "영화광" 사전 학습 (V-JEPA)

자동차는 단순히 특정 회전 동작을 암기하는 대신, 먼저 수천 시간의 가공되지 않은 주행 영상을 시청합니다.

  • 비유: 마치 아직 무엇을 해야 할지 배우지 않은 상태에서 수천 시간의 운전 영화를 보는 학생을 상상해 보세요. 그들은 자동차가 어떻게 움직이는지, 교통 흐름이 어떠한지, 그리고 세상이 시간이 지남에 따라 어떻게 변하는지와 같은 운전의 "문법"을 배웁니다.
  • 기술: 이들은 V-JEPA라는 기술을 사용합니다. 이것은 비디오를 이용한 "빈칸 채우기" 게임과 같습니다. 컴퓨터는 영상의 일부 구간을 숨기고 AI에게 다음에 어떤 일이 일어날지 예측하도록 요청합니다. 이를 수백만 번 반복함으로써, AI는 모든 사물에 일일히 라벨을 붙이지 않고도 운전하는 세상이 어떻게 돌아가는지에 대한 깊고 직관적인 이해를 구축합니다. 이를 통해 자동차는 본격적으로 조향을 배우기 전에 강력한 "두뇌"를 갖게 됩니다.

파트 B: "시뮬레이터 코치" (다중 모드 궤적 증류)

AI가 "두뇌"를 갖추었다면, 이제 결정을 내리는 법을 배워야 합니다. 보통은 인간이 지나간 단 하나의 경로만을 보게 됩니다. Drive-JEPA는 시뮬레이터 코치를 도입하여 이 판도를 바꿉니다.

  • 비유: 운전 학생이 비디오 게임에서 연습하고 있다고 상상해 보세요. 게임은 수천 가지의 서로 다른 "만약에" 시나리오를 생성할 수 있습니다. 어떤 버전의 시뮬레이션에서는 자동차가 왼쪽으로 피하고, 다른 버전에서는 급브레이크를 밟으며, 또 다른 버전에서는 교통 흐름 사이를 헤치고 나갑니다. 이 모든 것은 안전하고 법적으로도 문제가 없습니다.
  • 기술: 이 시스템은 규칙 기반 시뮬레이터를 사용하여 모든 장면마다 여러 가지 안전한 경로(궤적)를 생성합니다. 그런 다음 AI에게 인간이 취한 단 하나의 경로뿐만 아니라, 이 모든 다양한 옵션을 인식하고 가치를 부여하도록 가르칩니다. 이를 **다중 모드 궤적 증류(Multimodal Trajectory Distillation)**라고 합니다. 이는 AI에게 "정답은 하나가 아니야. 이 교차로를 통과하는 다섯 가지 서로 다른 안전한 방법이 있어"라고 말해주는 것과 같습니다.

파트 C: "매끄러움 필터" (모멘텀 인식 선택)

이제 AI는 선택할 수 있는 수많은 경로를 가지고 있습니다. 그중에서 최선의 경로를 어떻게 고를까요?

  • 비유: 당신이 복도를 걷고 있다고 상상해 보세요. 만약 몸을 갑자기 왼쪽, 오른쪽, 다시 왼쪽으로 급격하게 움직인다면, 어지럽고 불편함을 느낄 것입니다. 당신은 부드럽게 움직이고 싶을 것입니다.
  • 기술: 시스템에는 모멘텀 인식 선택(Momentum-Aware Selection) 모듈이 포함되어 있습니다. 이 모듈은 자동차가 아주 짧은 순간 전의 경로를 살펴보고 새로운 옵션들을 체크합니다. 만약 어떤 옵션이 갑작스럽고 거친 방향 전환을 요구한다면, 시스템은 해당 옵션에 불이익을 줍니다. 시스템은 안전할 뿐만 아니라 승객에게도 부드럽고 자연스럽게 느껴지는 경로를 선택하여, "덜컥거리는" 운전을 방지합니다.

결과

연구진이 이 시스템을 표준 주행 벤치마크(NAVSIM 및 Bench2Drive와 같은)로 테스트했을 때, 결과는 인상적이었습니다.

  • 더 똑똑한 결정: 이 시스템은 기존의 최첨단 방식들을 능가하며 안전성과 부드러움 측면에서 새로운 기록을 세웠습니다.
  • 적을수록 좋다: 모든 화려한 "인지" 센서(LiDAR 등)를 제거하고 단 하나의 전방 카메라만 사용했을 때도, 이 시스템은 다른 시스템보다 더 뛰어난 성능을 보였습니다. 이는 "영화광" 사전 학습이 자동차에게 정말 강력한 기초를 제공했음을 입증합니다.
  • 더 부드러운 승차감: 모멘텀 필터를 사용함으로써, 자동차는 갑작스럽고 충격적인 움직임을 피하며 더 편안하게 주행합니다.

요약

Drive-JEPA는 자율주행 자동차 학생에게 수천 편의 영화를 보게 함으로써 운전 이론에 대한 박사 학위를 주고, 가능한 모든 안전한 결과를 볼 수 있는 비디오 게임에서 연습하게 한 뒤, 가장 부드럽고 편안한 경로를 선택하는 법을 가르치는 것과 같습니다. 그 결과, 단순히 지도 위의 한 줄을 따라가는 로봇이 아니라, 교통의 흐름을 이해하는 숙련된 인간처럼 운전하는 자동차가 탄생하게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →