← 최신 논문
💻 computer science

Long-Horizon Consistent and Interaction-Aware World Models for Multi-Style End-to-End Driving

본 논문은 시간적 일관성 정규화, 명시적 상태 분리, 그리고 그룹 상대 정책 최적화(Group Relative Policy Optimization)를 통해 시간적 불일치, 상호작용 모델링, 스타일 적응성 문제를 해결하는 월드 모델 기반 프레임워크인 StyleDrive를 제안하며, 이를 통해 Bench2Drive 벤치마크에서 최첨단 성능을 달ato 달성하고 성공적인 sim-to-real 전이를 입증하였다.

원저자: Yuxuan Han, Kunyuan Wu, Liyunong Yang, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu

게시일 2026-09-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuxuan Han, Kunyuan Wu, Liyunong Yang, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자율주행 차량은 오랫동안 도로를 먼저 보고, 그다음 다른 차들이 어디로 갈지 예측하고, 마지막으로 어떻게 조향할지를 결정하는 단계별로 작업을 나누는 모듈형 방식에 의존해 왔습니다. 이 방식은 효과적이긴 하지만, 이전에 본 적 없는 새로운 상황이 도로에 나타날 때 어려움을 겪는 경우가 많습니다. 엔드 투 엔드(end-to-end) 학습이라고 알려진 더 새로운 접근 방식은, 인간 운전자가 경험을 통해 배우는 것과 매우 유사하게 센서가 보는 것을 직접 스티어링 휠과 페달로 매핑하도록 차량을 가르치고자 합니다. 이러한 학습 과정을 더 안전하고 효율적으로 만들기 위해, 연구자들은 '월드 모델(world models)'을 사용하기 시작했습니다. 이는 차량이 컴퓨터를 떠나지 않고도 미래의 시나리오를 상상하고 그에 대한 반응을 연습할 수 있는 내부 시뮬레이션입니다. 이를 통해 AI는 갑작스러운 충돌과 같은 위험한 상황을 탐색하고, 실제 세계의 위험 없이 그 결과를 통해 배울 수 있습니다. 그러나 이러한 정신적 시뮬레이션은 종종 특정한 결함 문제를 겪습니다. 차량이 더 먼 미래를 상상할수록 화면이 흐릿하고 일관성이 없어지며, 시스템이 중요한 근처 차량과 중요하지 않은 먼 차량을 구분하는 데 실패하곤 합니다.

연구팀은 이러한 문제들을 해결하기 위해 '스타일드라이브(StyleDrive)'라는 새로운 시스템을 개발했습니다. 고정밀 주행 시뮬레이터와 실제 차량에서 테스트된 이들의 연구는, AI가 미래에 대해 명확하고 일관된 그림을 유지하는 동시에 다양한 '성격'에 맞춰 운전하는 법을 배우는 방법을 도입합니다. 이 혁신의 핵심은 차량의 정신적 타임라인을 안정적으로 유지하는 방법입니다. 차량이 몇 초 뒤의 미래를 상상할 때 오류가 쌓이도록 내버려 두는 대신, 시스템은 현재의 예측을 과거 상태의 이력과 끊임없이 대조합니다. 이는 마치 흔들림 없는 손처럼 작용하여, 상상된 앞길이 장기간에 걸쳐서도 물리적으로 타당하고 일관성을 유지하도록 보장합니다. 이를 통해 차량은 빠른 속도로 움직이는 교통 흐름에 합류하는 것과 같은 복잡한 기동을 훨씬 높은 확신을 가지고 계획할 수 있습니다.

연구진은 또한 차량이 주변 환경에 주의를 기울이는 방식도 다루었습니다. 이전 시스템에서 AI는 종종 모든 다른 차량이나 보행자를 동일한 수준의 중요도로 취급하여 집중력을 분산시키곤 했습니다. 새로운 시스템은 세상을 두 부분으로 명확히 나눕니다. 즉, 차량의 안전과 움직임에 직접적인 영향을 미치는 요소와 그렇지 않은 배경 요소입니다. 이를 통해 차량은 보행자가 연석에서 내려오거나 차량이 끼어드는 것과 같이 결정적인 상호작용에 의사결정 능력을 집중하는 한편, 무관한 세부 사항은 무시할 수 있습니다. 이러한 분리는 차량의 선택을 더 해석 가능하고 안전하게 만듭니다. 왜냐하면 어떤 환경적 요소가 자신의 행동을 유도하는지 명확히 식별할 수 있기 때문입니다.

StyleDrive의 가장 독특한 특징은 처음부터 다시 학습할 필요 없이 다양한 운전 스타일에 적응할 수 있는 능력입니다. 대부분의 자율주행 시스템은 단일하고 고정된 방식으로 운전하도록 훈련되며, 종-종 극도로 조심스러운 방향으로 치우칩니다. 그러나 StyleDrive는 동일한 프레임워크 내에서 보수적, 보통, 또는 공격적으로 운전하는 법을 배울 수 있습니다. 연구진은 서로 다른 여러 주행 시나리오를 동시에 학습시키고 그 결과를 비교함으로써 이를 달성했습니다. 시스템은 차량이 내딛는 모든 작은 발걸음에 보상을 주는 대신, 여정 전체의 성공 여부를 평가합니다. 이를 통해 차량은 완벽한 조건이 갖춰질 때까지 기다리는 신중한 운전자부터 계산된 위험을 감수하는 적극적인 운전자에 이르기까지, 안전을 유지하면서도 폭넓은 행동 양식을 배울 수 있습니다.

이러-접근 방식의 결과는 상당했습니다. 표준 자율주행 벤치마크에서 테스트했을 때, 이 시스템은 88.44의 주행 점수와 66.82%의 성공률을 기록했습니다. 이 수치들은 유사한 월드 모델 기술을 사용했던 기존의 최고 방법들보다 실질적인 향상을 나타내는데, 기존 방식들은 훨씬 낮은 점수를 기록했습니다. 이 시스템은 교차로에서 마주 오는 차량을 통과하거나 갑작스러운 장애물에 반응하는 것과 같은 복잡한 시나리오에서 특히 효과적이었습니다. 한 테스트에서 다른 시스템들이 긴급 차량과 충돌하거나 보도로 돌진하는 동안, StyleDrive는 올바르게 양보하고 안전하게 합류했습니다. 또 다른 테스트에서는 경쟁 모델들이 보인 불안전한 기동 없이 멈춰 선 차량들을 부드럽게 추월했습니다.

연구진은 이러한 기술이 단순히 시뮬레이터의 결과가 아님을 증명하기 위해, 카메라와 레이저 센서가 장착된 실제 자동화 차량에 시스템을 배치했습니다. 실제 환경 테스트에서 차량은 마주 오는 장애물을 피하거나 예상치 못하게 길을 건너는 보행자를 위해 멈추는 것과 같은 역동적인 상황을 성공적으로 처리했습니다. 시스템은 가상 세계에서 학습한 행동을 물리적 세계로 전이할 수 있음을 입증했으며, 상황에 따라 다양한 운전 스타일을 전환하는 능력을 유지했습니다. 시뮬레이션에서 현실로의 이러한 성공적인 전환은 시스템의 내부 세계 모델이 실제 교통의 예측 불가능성을 다룰 만큼 견고하다는 것을 시사합니다.

이 연구는 자율주행의 미래가 단일하고 경직된 규칙 세트가 아니라, 미래를 명확하게 상상하고 맥락에 따라 행동을 적응시킬 수 있는 유연한 시스템에 있다는 점을 강조합니다. 미래를 안정적으로 예측하고 중요한 것에 집중함으로써, StyleDrive는 더 안전할 뿐만 아니라 다양하고 종종 혼란스러운 실제 도로를 항해할 수 있는 역량을 갖춘 차량을 향한 길을 제시합니다. 연구진의 작업은 적절한 내부 모델이 있다면, 기계가 이전에는 도달할 수 없었던 수준의 미묘함과 적응력을 가지고 운전하는 법을 배울 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →