← 최신 논문
💻 computer science

Driving Intents Amplify Planning-Oriented Reinforcement Learning

본 논문은 연속 행동 주행 정책의 모드 붕괴를 극복하고 기존 최첨단 모델 및 인간 주행 시연의 성능을 능가할 수 있도록 의도 조건부 흐름 매칭과 다중 의도 선호 강화 학습을 결합한 2 단계 프레임워크인 DIAL 을 제시합니다.

원저자: Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang, Pengfei Jing, Jifeng Dai, Yan Xie, Benjin Zhu

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang, Pengfei Jing, Jifeng Dai, Yan Xie, Benjin Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자율주행차를 가르칠 때, 사람이 붐비는 거리를 운전하는 동영상을 보여주는 상황을 상상해 보십시오. 이 논문이 설명하듯, 이 접근법의 문제는 해당 동영상이 인간 운전자가 선택한 단 하나의 운전 방식만을 보여준다는 점입니다. 그들은 일찍 브레이크를 걸었을 수도 있고, 차선을 변경했을 수도 있으며, 약간 속도를 높였을 수도 있습니다. 하지만 그 동영상은 그 순간에 가능했던 다른 유효한 옵션들은 보여주지 않습니다.

컴퓨터에게 단순히 그 단일 동영상을 복사하도록 훈련시키면, 그것은 고착화됩니다. 컴퓨터는 본 그대로만 수행하도록 학습하여, 상황을 처리할 수 있는 다른 안전하고 현명한 방법들을 모두 놓치게 됩니다. 저자들은 이를 **"모드 붕괴 (mode collapse)"**라고 부릅니다. 이는 수학 문제의 특정 정답 하나만 암기한 학생이 숫자가 조금만 바뀌면 실패하는 것과 같습니다. 왜냐하면 그들은 근본적인 논리나 다른 가능한 해법들을 결코 배우지 못했기 때문입니다.

여기서 이 논문의 새로운 방법인 DIAL이 두 가지 교묘한 단계를 통해 이를 어떻게 해결하는지 살펴보겠습니다.

문제: "한 가지 생각"

과거의 훈련 방식 (지도 미세 조정 또는 SFT) 에서는 AI 가 장면을 보고 경로를 추측하려 합니다. 훈련 데이터에서 오직 하나의 경로만 보았기 때문에, 모든 추측은 그 단일 선 주위에 빽빽하게 뭉칩니다.

  • 유사점: 요리사에게 특정 레시피 하나만 보여준 후 그 요리를 만들게 한 뒤, "100 가지 변형"을 요구한다고 상상해 보십시오. 요리사는 그 동일한 요리의 100 가지 약간 다른 버전만 내놓을 것입니다. 파스타에서 수프로 완전히 다른 맛을 시도해 보라는 말을 듣지 않았기 때문에, 그런 옵션들이 존재한다는 사실조차 생각하지 못합니다.
  • 결과: 128 개의 추측 중 "가장 좋은" 것을 선택하더라도, 그 중 어느 것도 원래 인간 운전자의 동영상보다 낫지 않습니다. AI 는 갇혀 있습니다.

해결책: DIAL (Driving-Intent-Amplified Learning, 운전 의도 증폭 학습)

저자들은 이 함정을 깨기 위해 2 단계 훈련 과정을 도입했습니다.

1 단계: "의도 메뉴"

AI 에게 단순히 "어떤 경로를 택해야 하나요?"라고 묻는 대신, 먼저 8 가지 구체적인 옵션 중 **운전 의도 (Driving Intent)**를 선택하게 합니다: 순항, 왼쪽 차선 변경, 오른쪽 차선 변경, 좌회전, 우회전, 유턴, 가속, 감속.

  • 유사점: 요리를 시작하기 전에 요리사에게 다양한 스타일 메뉴를 제공하는 것과 같습니다. "오늘은 매운 볶음 요리를 만들 것입니다," 또는 "오늘은 크림 수프를 만들 것입니다."
  • 작동 원리: AI 는 해당 특정 의도를 기반으로 경로를 생성하도록 훈련됩니다. 의도가 "좌회전"이면 좌회전 경로를 생성하고, "가속"이면 빠른 경로를 생성합니다.
  • 마법 같은 효과: AI 를 이러한 명확한 범주로 생각하도록 강제함으로써, 단일 선 주위에 뭉치는 것을 멈추게 됩니다. 서로 다른 행동의 "분지 (basins)"를 탐색하도록 학습합니다. 갑자기 128 가지 변형을 요청하면, 동일한 것의 128 개 복제가 아니라 128 가지 서로 다른 운전 기동들이 나옵니다.
  • 결과: 단순히 이렇게만 해도, AI 의 가장 좋은 추측은 원래 인간 동영상보다 더 좋아집니다. 인간 동영상에 보이지 않았던 옵션들을 마침내 탐색했기 때문입니다.

2 단계: "맛보기 테스트" (강화 학습)

이제 AI 가 다양한 옵션 메뉴를 갖게 되었으니, 어떤 것이 상황에 실제로 최고인지 가르쳐야 합니다. 이를 위해 Multi-Intent GRPO라는 시스템을 사용합니다.

  • 유사점: 요리사가 만든 16 가지 요리 (8 가지 스타일 각각 2 개씩) 를 모두 맛보는 음식 평론가 ("평가자") 를 상상해 보십시오. 평론가는 원래 레시피와 가장 비슷해 보이는 것을 고르는 것이 아니라, 맛이 가장 좋은 것을 고릅니다.
  • 회피된 함정: 요리사가 "매운 볶음 요리"의 16 가지 버전만 만들었다면, 평론가는 "매운 볶음 요리"가 실제로 "크림 수프"보다 나은지 판단할 수 없습니다. 비교가 불공평합니다.
  • 해결책: DIAL 은 요리사에게 모든 스타일 (좌회전, 우회전, 가속 등) 의 2 개씩을 모든 장면마다 만들도록 강제합니다. 그런 다음 평론가가 모두를 비교합니다. 이는 AI 에게 다음과 같이 가르칩니다: "아, 이 특정 교통 체증 상황에서는 '가속' 스타일이 아니라 '감속' 스타일이 가장 높은 평가를 받았구나."
  • 결과: AI 는 단순히 경로를 복사하는 대신 상황에 맞는 올바른 의도를 선택하도록 학습합니다. 1 단계에서 배운 다양성을 유지하며 단일 습관으로 다시 붕괴되지 않습니다.

최종 점수

이 논문은 실제 세계 운전 데이터셋 (Waymo) 에서 이를 테스트했습니다.

  • 구식 방법: 128 개의 추측을 사용하더라도, 그들이 할 수 있는 최선은 인간 운전자의 원본 동영상보다 약간 못 미쳤습니다.
  • DIAL: "의도 메뉴"와 "공정한 맛보기 테스트"를 사용하여, AI 의 가장 좋은 추측은 인간 운전자의 동영상보다 높은 점수를 받았습니다. 인간이 8.13 점인 척도에서 9.14 점을 기록하여, AI 가 원래 기록된 인간보다 더 나은 운전 방법을 찾아냈음을 증명했습니다.

요약

이 논문은 자율주행차 교육의 병목 현상은 단순히 AI 가 더 똑똑하게 복사하도록 만드는 것이 아니라, AI 가 운전 방식이 하나뿐이라고 생각하며 고착되지 않도록 보장하는 데 있다고 주장합니다. AI 에게 명시적으로 서로 다른 "모드"(의도) 로 생각하도록 가르친 다음, 가장 좋은 모드를 선택하도록 보상함으로써, 이전 방법들이 도달하지 못했던 성능 수준을 unlocked 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →