← 최신 논문
🤖 AI

Imitation Learning for Autonomous Driving in CARLA

이 논문은 CARLA에서 236,882개의 전문가 시연 윈도우를 통해 학습되어, 훈련된 경로와 보지 못한 경로 모두에서 충돌 없이 수 시간 동안 자율 주행에 성공하며 효과적인 폐루프 성능과 새로운 환경으로의 질적 전이를 입증하는 소형 멀티모달 행동 복제 정책을 제시한다.

원저자: Jordy Kieto

게시일 2026-09-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jordy Kieto

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자동차를 스스로 운전하도록 가르치려는 꿈은 오랫동안 단순하고 직관적인 아이디어에 의존해 왔습니다. 만약 기계가 숙련된 운전자를 관찰하고 그들의 모든 움직임을 복제할 수 있다면, 결국 스스로 운전하는 법을 배울 것이라는 생각입니다. 모방 학습(imitation learning)이라고 알려진 이 접근 방식은 조향, 제동, 가속이라는 복잡한 과제를 패턴 매칭 작업으로 취급합니다. 컴퓨터는 인간이나 완벽한 컴퓨터 프로그램으로부터 얻은 수 시간 분량의 비디오와 센서 데이터를 관찰하며, 자신이 보는 것을 바탕으로 다음에 어떤 행동을 취해야 할지 예측하는 법을 배웁니다. 문제는 관찰하는 것과 실제로 행하는 것 사이의 간극에 있습니다. 인간이 운전을 배울 때, 그들은 루프 안에서 연습합니다. 만약 경로에서 약간 벗어나면, 이를 수정하며 그 수정 과정으로부터 배웁니다. 그러나 완벽한 사례들로만 훈련된 기계는 자신이 실수를 저질렀을 때 어떤 일이 발생하는지 본 적이 없습니다. 만약 기계가 아주 조금이라도 경로를 이탈하면, 전문가가 보여준 적 없는 상황에 처하게 되며, 가이드가 없다면 그 작은 오류는 충돌로 이어지는 악순환을 일으킬 수 있습니다. 연구자들이 직면한 질문은, 시스템이 정적인 완벽한 주행 라이브러리로부터 스스로 운전하는 메로한이고 예측 불가능한 현실을 다룰 수 있을 만큼 충분히 배울 수 있는가 하는 점입니다.

최근 CARLA라는 정교한 주행 시뮬레이터를 사용한 연구에서, 조디 키에토(Jordy Kieto)라는 연구자는 바로 이 질문을 탐구했습니다. 목표는 새로운 유형의 컴퓨터 두뇌를 발명하는 것이 아니라, 세심하게 선별된 숙련된 주행 라이브러리로부터 상대적으로 단순하고 컴팩트한 시스템이 얼마나 많은 실제 운전 기술을 습득할 수 있는지 확인하는 것이었습니다. 연구자는 카메라의 이미지 스트림, 레이저 스캐너로 생성된 버드 아이 뷰(bird's-eye view) 지도, 그리고 다가오는 도로 방향 목록을 볼 수 있는 정책(policy)—즉, 자동차를 위한 일련의 지침—을 구축했습니다. 이 시스템에 한 번에 5초간의 이력을 입력함으로써, 팀은 전문가 운전자의 가속 페달, 브레이크, 스티어링 휠 움직임을 예측하도록 훈련시켰습니다. 훈련 데이터는 독특한 출처에서 왔습니다. 이는 수천 개의 짧은 주행 클립을 생성하는 체계적인 과정을 통해, 주행 로그에서 흔히 나타나는 쉬운 직선 경로뿐만 아니라 좌회전과 우회전이 균형 있게 섞인 환경을 자동차가 볼 수 있도록 보장했습니다.

실험 결과는 놀라울 정도로 견고했습니다. 약 3시간 반 분량의 검증된 주행 클립으로 훈련을 마친 후, 이 정책은 인간의 개입이나 안전망 없이 시뮬레이터 안에서 스스로 주행하도록 배치되었습니다. 자동차가 내린 모든 회전이 다음에 무엇을 보게 될지를 결정하는 이 폐쇄 루프(closed-loop) 테스트에서, 시스템은 훈련받았던 도로뿐만 아니라 한 번도 본 적 없는 완전히 다른 도로에서도 몇 시간 동안 주행했습니다. 시스템은 곡선 구간을 통과하고, 교차로를 관리하며, 단 한 번의 충돌 없이 차선을 유지했습니다. 아마도 가장 주목할 점은, 이 시스템이 큰 실수를 했을 때 회복하는 능력을 보여주었다는 것입니다. 자동차가 도로에서 멀리 벗어나거나 잘못된 방향을 향하게 된 상황—즉, 명시적으로 수정하는 법을 배운 적이 없는 상황—에서도, 시스템은 종종 스스로 도로 위로 다시 돌아와 여정을 재개했습니다. 이러한 회복은 시스템이 훈련 데이터에서 '회복' 시연을 본 적이 없음에도 불구하고 발생했습니다. 즉, 훈련 과정 중에 학습한 작은 수정 사항들로부터 단순히 일반화하여 수행한 것입니다.

하지만 이 연구는 관찰된 내용과 증명된 내용 사이를 신중하게 구분합니다. 여기서 설명된 주행 성과는 보행자, 신호등, 또는 예측 불가능한 날씨가 없는 통제된 환경인 컴퓨터 시뮬레이션 내에서 전적으로 이루어졌습니다. 시스템의 성공은 시뮬레이터의 내부 지도에서 제공하는 정밀하게 사전 계산된 차선 표시라는 '특권적인(privileged)' 정보에 크게 의존했습니다. 실제 운전자는 이와 같은 방식으로 정보에 접근할 수 없습니다. 연구진은 자동차가 우수한 성능을 보였지만, 이것이 실제 세계에서의 운전 문제를 해결했다고 주장하는 것은 아니라고 명시했습니다. 또한 시스템이 회전하는 것을 처리하는 능력이 여전히 가장 어려운 부분이었으며, 직선 주행 시보다 회전 시의 오류가 더 빈번했다는 점도 지적했습니다. 이 연구는 단순한 시스템이 고품질의 다양한 데이터로 훈련될 때 시뮬레이션 내에서 장기간 자율 주행할 수 있음을 강력하게 보여주는 증거이지만, 이것이 실제 도로를 위한 완성된 제품이라고 선언하기에는 아직 미치지 못합니다.

이 연구의 의의는 사용된 특정 컴퓨터 아키텍처보다는 준비 방법론에 있습니다. 연구자는 데이터 자체를 주요 변수로 취급하여, 작고 무질서한 수동 주행 데이터에서 모든 훈련 클립을 생성하고 검증하는 엄격하고 자동화된 과정으로 나아갔습니다. 훈련 데이터가 특정 기동을 포함하고 시작 위치에 약간의 무작위 변동을 포함하도록 보장함으로써, 시스템은 표준 데이터셋보다 더 넓은 범위의 상황을 다룰 수 있도록 학습했습니다. 연구는 오프라인 훈련—정적인 라이브러리로부터 배우는 것—이 루프 내에서 잘 작동하는 운전자를 만들어낼 수는 있지만, 역량을 판가름하는 진정한 시험은 예상치 못한 상황을 다루는 능력에 남아 있다고 결고합니다. 연구진은 다른 이들이 이 결과들을 테스트하고, 회복률을 더 정밀하게 측정하며, 이 성공이 특권적인 지도 정보에 얼마나 의pend하는지 혹은 도로에 대한 시각적 이해에 얼마나 의존하는지를 탐구할 수 있도록 모든 코드, 데이터, 그리고 훈련된 모델을 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →