← 최신 논문
🤖 AI

WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving

이 논문은 하이브리드 미래 마스킹 사전 학습과 조건부 플로우 매칭을 사용하여 그럴듯한 미래 잠재 상태를 생성함으로써 Video JEPA 패러다임을 재고하고, 이를 통해 NAVSIM 및 HUGSIM과 같은 벤치마크에서 자율 주행 계획 분야의 최첨단 성능을 달성하는 새로운 월드-액션 모델인 WA-JEPA를 소개한다.

원저자: Xinlin Wang, Yujiao Xiang, Yuheng Zhou, Jingqi Wang, Minqing Huang, Jiajie Huang, Dongxu Wei, Tingguang Zhou, Xiyang Wang, Gong Chen, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xinlin Wang, Yujiao Xiang, Yuheng Zhou, Jingqi Wang, Minqing Huang, Jiajie Huang, Dongxu Wei, Tingguang Zhou, Xiyang Wang, Gong Chen, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자율주행 자동차는 오랫동안 하나의 소프트웨어 파트는 도로를 보고, 다른 파트는 무엇을 할지 결정하며, 또 다른 파트는 차량을 조종하는 모듈형 방식에 의존해 왔습니다. 이러한 분리는 마치 메시지가 단계마다 왜곡되는 '전화기 게임(telephone game)'처럼 실수가 누적되는 결과를 초래하곤 합니다. 이를 해결하기 위해 연구자들은 카메라 이미지로부터 직접 조향 명령까지 학습하는 엔드 투 엔드(end-to-end) 시스템을 개발해 왔으며, 이는 마치 인간 운전자가 상황을 보고 이를 의식적으로 단계별로 나누지 않고 즉각 반응하는 것과 유사합니다. 그러나 이러한 시스템은 진정으로 다음에 어떤 일이 일어날지 '앞을 내다보는' 능력이 부족하기 때문에 드물거나 복잡한 시나리오에서 어려움을 겪는 경우가 많습니다. 이들은 현재를 명확하게 보지만, 안전한 주행에 필수적인 미래를 상상하는 데는 어려움을 겪습니다.

유망한 새로운 방향은 영상이 시간이 지남에 따라 어떻게 변할지 예측하도록 훈련된 컴퓨터 프로그램인 '월드 모델(world models)'을 포함합니다. 영상의 다음 몇 초를 예측하는 법을 배움으로써, 이 모델들은 교통의 역동성을 이해하고 이러한 예견을 사용하여 자신의 움직임을 계획할 수 있습니다. 하지만 기존의 강력한 비디오 예측 기술과 자율주행의 구체적인 요구 사항 사이에는 여전히 상당한 격차가 존재해 왔습니다. 기존의 많은 방식은 비디오의 누락된 부분을 무작위로 채우려 하는데, 이는 과거를 이해하는 데는 유용할지 몰라도 미래를 예측하는 데는 부적합합니다. 또 다른 방식들은 너무 단순화되고 압축된 세계 표현에 의존하여 복잡한 의사결정에 사용하기에는 세부 정보가 너무 많이 손실되기도 합니다. 과제는 도로의 풍부하고 상세한 현실을 이해하면서도, 자신의 행동을 안내할 수 있는 그럴듯한 미래를 신뢰성 있게 생성할 수 있는 시스템을 만드는 것이었습니다.

아파리 인텔리전트 드라이브(Afari Intelligent Drive)와 여러 대학의 연구진은 V-JEPA(Video Joint Embedding Predictive Architecture)라고 알려진 특정 구조를 재고함으로써 이 문제를 해결했습니다. 이 기술은 인간의 라벨 없이도 비디오에서 깊고 의미 있는 패턴을 학습하도록 설계되었으나, 원래 형태는 앞을 내다보는 것이 아니라 비디오의 누able 누락된 부분을 채우는 데 맞춰져 있었습니다. 연구팀은 자동차가 스스로 운전하기 위해서는 단순히 빈칸을 채우는 것이 아니라 앞을 내다봐야 한다는 점을 깨달았습니다. 그들은 V-JEPA의 강력한 학습 능력을 자율주행 작업에 맞게 변형한 WA-JEPA라는 새로운 시스템을 개발했습니다. 이 모델은 비디오의 누락된 부분을 무작위로 추측하는 대신, 현재의 도로를 관찰하고 미래에 장면이 정확히 어떻게 보일지를 예측하는 동시에 자동차가 무엇을 해야 할지도 결정하도록 훈련됩니다.

그들의 혁신의 핵심은 모델에게 시간에 대해 생각하는 법을 가르치는 방식에 있습니다. 훈련의 첫 번째 단계에서 시스템은 자동차의 여러 카메라에서 촬영된 연속적인 비디오 프레임을 보여줍니다. 그런 다음 마지막으로 보이는 순간 이후의 미래 프레임을 상상하도록 요청받습니다. 비디오 중간의 누락된 프레임을 추측하려는 기존 방식과 달리, 이 모델은 엄격하게 앞을 내다보도록 강제되어 교통의 인과관계를 학습합니다. 이러한 예측을 더 현실적으로 만들기 위해 연구진은 표준적인 수학적 접근 방식 대신 '플로우 매칭(flow matching)'이라는 기술을 도입했습니다. 이를 통해 모델은 단 하나의 정적인 결과만을 추측하는 것이 아니라, 미래의 가능성들을 부드럽고 연속적인 경로로 생성할 수 있습니다. 이는 미래가 결코 하나의 고정된 점이 아니라, 자동차가 헤쳐 나가야 할 다양한 가능성의 범위이기 때문에 매우 중요합니다.

두 번째 단계에서 연구진은 이 미래를 보는 능력을 자동차의 제어 장치와 직접 연결했습니다. 그들은 도로의 미래 모습과 자동차의 미래 행동을 동시에 예측하는 단일 통합 시스템을 구축했습니다. 이 두 가지 과업을 함께 훈련함으로써, 모델은 세계가 변하는 방식이 자동차의 움직임과 직접적으로 연결되어 있다는 것을 학습합니다. 자동차가 회전하면 시야가 특정 방식으로 변하고, 자동차가 멈추면 세계가 다르게 작동합니다. 이러한 긴밀한 결합은 모델이 단순히 세계를 보는 것을 넘어, 자신의 행동이 그 세계를 어떻게 변화시키는지 이해하게 합니다. 그 결과, 이 시스템은 움직임을 취하기 전에 마음속으로 미래를 시뮬레이션함으로써 복잡한 교통 상황에 대해 추론할 수 있습니다.

연구팀은 자율주행 차량이 얼마나 잘 주행하는지 평가하기 위해 실제 주행 데이터를 사용하는 표준 벤치마크인 NAVSIM을 통해 새로운 시스템을 테스트했습니다. NAVSIM-v2 테스트에서 WA-JEPA는 91.7점을 기록하며, 기존의 가장 뛰어난 엔드 투 엔드 주행 방식과 다른 월드 모델 접근 방식들을 능가했습니다. 이러한 개선은 시스템이 충돌을 피하고 교통 규칙을 준-수하는 데 더 뛰어나다는 것을 나타냅니다. 더욱 인상적인 것은, 연구진이 이 모델을 해당 환경에 대한 추가 훈련 없이 완전히 다른 폐쇄 루프 시뮬레이터인 HUGSIM에서 테스트했다는 점입니다. 실시간으로 자신의 실수를 인지하고 반응하며 지속적으로 주행해야 하는 이 제로샷(zero-shot) 테스트에서, WA-VEPA는 0.4462라는 높은 점수를 기록하며 다른 모든 방식을 큰 차이로 앞질렀습니다. 이는 미래를 예측하고 행동을 계획하는 능력을 결과적으로 결합하는 것이 새로운 상황에서도 잘 전이되는 견고한 운전 이해력을 만들어낸다는 것을 시사합니다.

이러한 발견은 더 나은 자율주행의 핵심이 더 많은 센서를 추가하거나 더 복잡한 규칙을 만드는 것이 아니라, 시스템이 미래를 더 정확하게 상상하도록 가르치는 데 있음을 시사합니다. 단순히 누락된 비디오 데이터를 완성하는 것에서 벗어나, 다음에 올 것을 능동적으로 예측하고 그 예측을 자동차의 결정과 직접 연결함으로써, 연구진은 인간과 유사한 예견 능력을 갖춘 모델을 만들어냈습니다. 이 접근 방식은 시각적 세계를 이해하는 것과 행동을 취하는 것 사이의 간극을 메우며, 예측 불가능한 실제 도로 상황을 더 높은 확신과 안전성을 가지고 다룰 수 있는 차량을 향한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →