← 최신 논문
💻 computer science

RedLight-VLA: Models for traffic-rule grounding and behavioral emphasis in driving policies

RedLight-VLA는 궤적 유래 행동 재가중치 부여와 병렬 보조 헤드를 결합하여 신호 교차로에서의 규칙 준수 및 행동 강조를 개선함으로써, 추가적인 수동 규칙 주석 없이도 적색 신호 무시 및 궤적 오류를 크게 줄이는 시각-언어-행동(Vision-Language-Action) 주행 정책을 위한 새로운 학습 목적 함수이다.

원저자: Bala Murali Manoghar Sai Sudhakar, Sourab Bapu Sridhar, Sandipan Das, Rahul Ahuja, Meda Lazar, Ashish Garg, Pratik Likhar, Senthil Yogamani

게시일 2026-09-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bala Murali Manoghar Sai Sudhakar, Sourab Bapu Sridhar, Sandipan Das, Rahul Ahuja, Meda Lazar, Ashish Garg, Pratik Likhar, Senthil Yogamani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

도시에서 자동차를 운전하는 것은 매끄럽고 예측 가능한 움직임과 갑작스럽고 결정적인 정지 사이의 끊임없는 협상입니다. 대부분의 경우, 차량은 고속도로를 순항하거나 교통 흐름 사이를 부드럽게 헤치며 일정한 속도를 유지합니다. 이러한 일상적인 주행이 자동차가 도로 위에서 보내는 시간의 대부분을 차지합니다. 그러나 운전자의 기술과 안전을 진정으로 시험하는 순간은 드문 예외적인 상황들입니다. 보행자가 갑자기 튀어나올 때의 급브레이크, 신호등에서의 갑작스러운 출발, 또는 적신호에서의 주의 깊은 정지 같은 것들입니다. 엔지니어들이 컴퓨터에게 수천 시간의 기록된 인간 운전 데이터를 보여주며 자율주행을 가르칠 때, 컴퓨터는 주로 쉽고 지루한 부분들을 보게 됩니다. 컴퓨터는 순항하는 법은 잘 배우지만, 데이터에 너무 드물게 등장하기 때문에 희귀하고 위험도가 높은 기동에는 종종 어려움을 겪습니다. 이러한 불균형은 컴퓨터가 충분히 강하게 브레이크를 밟지 못하거나 다시 출발하는 것을 주저하게 만드는 사각지대를 만들어, 교차로에서 안전하지 않은 행동으로 이어질 수 있습니다.

Qualcomm과 Arriver의 연구진은 시각-언어-행동(Vision-Language-Action) 모델로 알려진 새로운 접근 방식을 통해 자율주행 소프트웨어의 이러한 특정 약점을 해결하는 방법을 개발했습니다. 이 시스템들은 시각적 세계를 이해하고, 교통 규칙을 해석하며, 자동차를 어떻게 움직일지 결정하도록 설계되었습니다. Bala Murali Manoghar Sai Sudhakar와 동료들이 이끄는 팀은 단순히 컴퓨터에게 더 많은 주행 데이터를 보여주는 것만으로는 충분하지 않다는 것을 깨달았습니다. 대신, 그들은 컴퓨터가 희귀하고 어려운 순간들에 특별히 더 집중하도록 강제하는 동시에, 교통 신호와 정지선을 명시적으로 인식하도록 가르치는 훈련 방법을 만들었습니다. 그들은 이 시스템을 RedLight-VLA라고 부릅니다. 컴퓨터가 실수로부터 배우는 방식을 조정하고 교통 신호를 "읽는" 전용 방식을 부여함으로써, 그들은 별도의 수동 라벨링 없이도 차량이 적신호에 훨씬 더 잘 멈추고 녹색 신호에 출발할 수 있도록 만들었습니다.

연구진이 다룬 핵심 문제는 표준적인 훈련이 모든 주행 영상의 매 초를 동일하게 취급한다는 점입니다. 일반적인 데이터셋에서 자동차는 98%의 시간 동안 순항하고 단 2%의 시간 동안만 급브레이크를 밟을 수 있습니다. 만약 컴퓨터가 이 모든 초에 걸쳐 평균 오차를 최소화하도록 훈련된다면, 희귀한 제동 이벤트는 수천 초의 부드러운 주행에 묻혀버리게 됩니다. 컴퓨터는 평균적인 경우에는 잘하도록 학습하지만, 결정적인 엣지 케이스(edge cases)에서는 실패하게 됩니다. 이를 해결하기 위해 팀은 '행동 재가중치(behavioral reweighting)'라고 불리는 기술을 도입했습니다. 마치 어려운 수학 문제 하나를 맞히는 것이 쉬운 문제 열 개를 맞히는 것만큼의 점수를 받도록 결정하는 선생님이 학생의 숙제를 채점하는 상황을 상상해 보십시오. 이와 마찬가지로, 연구진은 시스템이 희귀한 급브레이크나 급가속 순간에 훨씬 더 높은 중요성을 부여하도록 프로그래밍했습니다. 컴퓨터가 이러한 결정적인 순간에 실수를 할 때, 시스템은 스스로를 수정하려는 훨씬 더 강력한 "압박"을 느끼게 됩니다. 이 조정은 기록된 전문가 운전자의 속도와 가속도를 분석함으로써 자동으로 수행되므로, 사람이 일일이 어떤 클립이 중요한지 표시할 필요가 없습니다.

그들의 솔루션 중 두 번째 부분은 다른 문제를 다룹니다. 즉, 컴퓨터는 멈춰야 하는지를 알아야 한다는 것입니다. 많은 현재 시스템에서 정지 결정은 자동차가 따라가려는 경로의 부산물일 뿐입니다. 연구진은 컴퓨터가 교통 신호의 상태와 정지선의 위치를 명시적으로 이해하기를 원했습니다. 그들은 컴퓨터가 이 정보를 담기 위해 메모리에 몇 개의 특정 내부 "슬롯(slots)"을 확보하는 시스템을 만들었습니다. 컴퓨터가 카메라 이미지와 지도를 살펴본 후, "적신호가 있는가?" 또는 "정지선까지의 거리는 얼마인가?"와 같은 질문에 대한 답으로 이 슬롯들을 채웁니다. 그러면 시스템의 별도 소규모 부분이 알려진 교통 규칙에 근거하여 이 슬롯 안의 답이 맞는지 확인합니다. 이는 컴퓨터가 단순히 자동차의 경로를 추측하는 것을 넘어, 교통 규칙에 대한 명확한 내부 표현을 구축하도록 강제합니다. 결정적으로, 이 과정은 컴퓨터가 자신의 추론을 설명하기 위해 말하거나 글을 쓸 필요 없이 빠르고 효율적으로 진행됩니다.

연구진이 대규모 실제 주행 기록을 통해 이 결합된 접근 방식을 테스트했을 때, 결과는 안전에 직결되는 행동에서 명확한 개선을 보여주었습니다. 희귀한 기동에 대한 추가적인 주의와 명시적인 규칙 검사를 모두 사용한 시스템은 적신호에서 정지선을 초과하는 횟수를 7.3%에서 6.8%로 줄였습니다. 또한 정지선에 접근할 때의 차량 속도 오차를 거의 13% 줄였습니다. 아마도 가장 중요한 점은, 이 시스템이 전반적으로 자동차의 미래 경로를 예측하는 능력이 향ward되어, 자동차가 예측한 위치와 실제로 있어야 할 위치 사이의 평균 거리를 줄였다는 것입니다. 그러나 연구진은 트레이드오프(trade-off)도 언급했습니다. 적신호에서의 안전을 높이려는 노력으로 인해, 시스템이 다소 신중해져서 녹색 신호에서 불필요하게 멈추는 횟수가 약간 증가했습니다. 결합된 방법이 단일 기술을 사용할 때보다 이러한 트레이드오프를 더 잘 관리하기는 했지만, 이는 시스템을 더 안전하게 만드는 것이 종종 서로 다른 유형의 오류 사이에서 균형을 잡는 과정임을 보여주었습니다.

이 연구는 자율주행 자동차를 더 신뢰할 수 있게 만드는 방법이 단순히 더 많은 데이터를 입력하는 것이 아니라, 흔하고 안전한 순간보다 희귀하고 위험한 순간의 가치를 더 높게 평가하도록 가르치는 데 있음을 입증합니다. 운전자가 급브레이크를 밟거나 출발하는 순간을 자동으로 식별하고, 교통 신호를 명시적으로 추적하도록 강제함으로써, 연구진은 도로의 규칙을 이해하는 인간처럼 행동하는 모델을 만들었습니다. 이 작업은 자율주행의 미래가 단순히 데이터를 쌓는 것이 아니라, 경험의 가장자리(edges)로부터 배우는 방식을 정교화하여 가장 중요한 순간들을 가장 잘 배울 수 있도록 보장하는 데 있다는 것을 시사합니다. 이 접근 방식은 새로운 센서나 교통 규칙에 대한 수동 라벨링을 요구하지 않으므로, 도시 주행의 예측 불가능한 특성을 처리할 수 있는 더 안전하고 견고한 자율주행 차량을 향한 실질적인 단계가 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →