CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving
CLEAR는 이질적인 시뮬레이션 파이프라인을 사용하여 사전 학습된 시각-언어-행동(Vision-Language-Action) 모델 위에 잔차 웨이포인트 정책(residual waypoint policy)을 학습시킴으로써, 전통적인 모방 학습의 분포 변화(distribution shift) 한계를 극복하고 도전적인 벤치마크에서 최첨단 성능을 달나하는 엔드투엔드 자율 주행을 위한 확장 가능한 폐쇄 루프 강화 학습 프레임워크를 도입한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
자율주행 자동차를 가르치는 상황을 상상해 보세요. 오랫동안 이 데이들을 위한 가장 좋은 방법은 **모방 학습(Imitation Learning)**이었습니다. 이것은 마치 숙련된 전문가가 운전하는 차 뒷좌동에 앉아 있는 학생 운전자를 생각하면 쉽습니다. 학생은 그저 전문가가 하는 것을 그대로 따라 합니다. 전문가가 왼쪽으로 회전하면, 학생도 왼쪽으로 회전합니다.
문제는 무엇일까요? 이 방식은 "오픈 북" 테스트에서만 작동한다는 점입니다. 만약 학생이 전문가가 보여준 적 없는 상황을 마주하거나, 아주 작은 실수를 하게 되면 학생은 혼란에 빠집니다. 현실 세계(또는 복잡한 시뮬레이션)에서는 작은 실수 하나가 사고로 이어질 수 있는데, 학생은 단지 따라 하는 법만 배웠을 뿐 '생각'하거나 '적응'하는 법을 배우지 못했기 때문에 어떻게 복구해야 할지 알지 못합니다.
최근 연구자들은 시각-언어-행동(Vision-Language-Action, VLA) 모델을 사용하기 시작했습니다. 이들은 도로를 "보고", 교통 표지판을 "읽고", 운전 명령을 "말할" 수 있는 매우 똑똑한 운전 강사와 같습니다. 하지만 이 똑똑한 강사들조차도 주로 "전문가를 복제하는" 방식으로 훈련되었기 때문에, 상황이 잘못되었을 때 취약하다는 점은 여전했습니다.
여기, CLEAR가 등장합니다.
핵심 아이디어: "잔차(Residual)" 코치
이 논문의 저자들은 이를 해결하기 위해 CLEAR라고 불리는 시스템을 구축했습니다. 단순히 복제하는 대신, 그들은 AI에게 훈련생을 교정하는 코치가 되도록 가르쳤습니다.
- 사전 훈련된 "훈련생": 먼저, 매우 똑똑한 VLA 모델(훈련생)을 가져와 방대한 전문가 운전 데이터 라이브러리를 통해 기초를 가르칩니다. 이 훈련생은 "500피트 앞에서 좌회전하세요"라고 말하는 GPS처럼 일반적인 경로를 예측하는 데 능숙합니다.
- "코치" (강화 학습, RL): 그다음, **강화 학습(RL)**을 도입합니다. 훈련생 옆에 서 있는 코치를 상상해 보세요. 훈련생이 예측(기본 경로)을 하면, 코치는 "사실, 저 포트홀을 피하려면 왼쪽으로 조금 더 꺾어야 해요"라고 말합니다.
- AI는 처음부터 운전법을 다시 배우지 않습니다(그러면 엄청난 컴퓨터 자원이 필요합니다).
- 대신, **잔차 정책(residual policy)**을 학습합니다. 이것은 마치 좋은 계획과 완벽한 계획 사이의 '차이'를 배우는 것과 같습니다. AI는 오직 훈련생의 실수를 바로잡기 위해 필요한 작은 "교정"만을 배웁니다.
"이종 파이프라인(Heterogeneous Pipeline)": 교통 체증 해결하기
이 AI 코치들을 훈련시키는 데는 엄청난 양의 데이터가 필요합니다. 코치를 가르치기 위해 수백만 번의 운전 시뮬레이션을 실행해야 합니다.
여기에 병목 현상이 있습니다:
- 시뮬레이터 (도로): 현실적인 운전 시뮬레이터(CARLA 등)를 실행하는 것은 그래픽 연산 부하가 큽니다. 마치 고사양 비디오 게임을 실행하는 것과 같습니다.
- 학습기 (두뇌): AI 모델 또한 매우 거대하며, 사고하기 위해 강력한 그래픽 카드(GPU)를 필요로 합니다.
만약 시뮬레이터와 두뇌를 같은 컴퓨터에서 실행하려고 하면, 둘은 그래픽 카드를 두고 서로 싸우게 됩니다. 이는 마치 좁은 체육관에서 마라톤과 헤비급 웨이트리프팅 대회를 동시에 진행하려는 것과 같으며, 결국 모든 것이 느려지거나 멈추게 됩니다.
CLEAR의 해결책: 그들은 **이종 파이프라인(heterogeneous pipeline)**을 구축했습니다.
- **시뮬레이터(도로)**는 한 세트의 오래되고 저렴한 컴퓨터들에 배치했습니다.
- **AI 두뇌(학습기)**는 별도의 초강력 컴퓨터 클러스터에 배치했습니다.
- 그리고 이들을 디지털 터널(SSH)로 연결했습니다.
이는 원격 레이싱 트랙(시뮬레이터)들이 중앙 본부(두뇌)로 데이터를 보내는 것과 같습니다. 트랙 자체가 화려할 필요는 없습니다. 그저 돌아가기만 하면 됩니다. 그러면 두뇌는 그래픽 렌더링 때문에 속도가 느려지는 일 없이 필요한 모든 데이터를 받아올 수 있습니다. 덕분에 이들은 64개의 시뮬레이션을 동시에 실행하며 1억 개의 샘플로 훈련할 수 있었습니다.
결과: "실패"에서 "승리"로
이 시스템은 몇 가지 매우 어려운 운전 챌린지(예: "longest6" 및 "Bench2Drive" 벤치마크)에서 테스트되었습니다.
- CLEAR 이전: 기존의 방식들은, 심지어 똑똑한 방식들조차도 이 어려운 경로들에서 거의 100% 실패했습니다. 그들은 작은 오류로부터 복구하지 못해 충돌하거나 멈춰버리곤 했습니다.
- CLEAR 적용 후: 시스템은 자신의 실수를 스스로 교정하는 법을 배웠습니다. 단순히 대본을 따르는 것이 아니라, 장애물을 피해 주행하고 복잡한 교통 상황을 처리하는 법을 배웠습니다.
- 한 벤치마크에서는 성공률이 0%(완전한 실패)에서 **25%**로 급증했습니다.
- 또 다른 벤치마크에서는 운전 효율성과 안전성 면에서 이전의 모든 방식을 제치고 역대 최고 점수를 기록했습니다.
요약
CLEAR를 똑똑하지만 경직된 학생 운전자에게, 학생이 경로를 벗어나기 시작할 때 올바른 방향으로 살짝 밀어줄 수 있는 초스마트 코치를 붙여주고, 컴퓨터가 멈추지 않고도 수백만 마일을 연습할 수 있도록 거대한 분산형 훈련 시설을 구축한 것이라고 생각하면 됩니다. 그 결과, 복잡하고 예측 불가능한 실제 도로 상황을 훨씬 더 잘 다룰 수 있는 자율주행 시스템이 탄생했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.