← 최신 논문
🤖 AI

RetroMotion: Retrocausal Motion Forecasting Models are Instructable

RetroMotion 은 역인과적 정보 흐름을 사용하여 복잡한 다중 에이전트 예측을 주변 분포와 결합 분포로 분해하는 트랜스포머 기반 운동 예측 모델로, 주요 데이터셋에서 최첨단 성능을 달성하면서도 장면 적응형 지시 추종을 독창적으로 지원합니다.

원저자: Royden Wagner, Omer Sahin Tas, Felix Hauser, Marlon Steiner, Dominik Strutz, Abhishek Vivekanandan, Jaime Villa, Yinzhe Shen, Carlos Fernandez, Christoph Stiller

게시일 2026-04-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Royden Wagner, Omer Sahin Tas, Felix Hauser, Marlon Steiner, Dominik Strutz, Abhishek Vivekanandan, Jaime Villa, Yinzhe Shen, Carlos Fernandez, Christoph Stiller

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 교차로에 서서 자동차, 보행자, 자전거가 움직이는 모습을 상상해 보세요. 다음 몇 초 동안 모두 어디로 갈지 예측하는 것은 매우 어렵습니다. 모든 사람의 정확한 경로를 한 번에 추측하려 한다면, 가능성의 수가 폭발합니다. 마치 모든 조각이 백만 가지 다른 모양이 될 수 있는 퍼즐을 풀려는 것과 같습니다.

"RetroMotion"이라는 논문은 컴퓨터가 이 퍼즐을 풀 수 있는 새로운 방법을 제시합니다. 그들의 접근 방식을 간단한 비유로 설명하면 다음과 같습니다:

1. 두 단계 춤: 솔로 vs 그룹

혼란스러운 군중 전체를 한 번에 예측하는 대신, 저자들은 문제를 두 부분으로 나눕니다:

  • 솔로 공연 (주변 예측): 먼저 컴퓨터는 각 사람을 개별적으로 봅니다. "이 자동차가 도로에 혼자 있다면 어디로 갈까?"라고 묻습니다. 그리고 모든 사람을 위한 "솔로 계획"을 세웁니다.
  • 그룹 춤 (공동 예측): 다음으로 컴퓨터는 상호작용하는 사람들 (예: 보행자가 횡단보도를 건너기를 기다리는 자동차) 을 봅니다. 그리고 그 "솔로 계획"들을 가져와서 어떻게 조화를 이루는지 재배열합니다.

마술 (역인과성):
보통은 과거를 바탕으로 미래를 예측합니다. 하지만 이 모델은 "역인과성"이라는 교묘한 트릭을 사용합니다. 이야기를 쓰는 것과 같다고 생각하세요. 보통은 시작을 쓰고, 그다음 중간을 쓰고, 마지막을 씁니다. 하지만 이 모델은 (솔로 계획을 바탕으로) 마지막을 먼저 쓰고, 그 결말을 이용해 그룹 이야기의 시작을 다시 씁니다.

  • 왜 이렇게 할까요? "아, 그 자동차가 결국 왼쪽으로 꺾인다면, 더 일찍 속도를 줄였을 거야"라고 깨닫는 것과 같습니다. 목적지를 알면 상호작용의 시작을 더 잘 이해할 수 있습니다. 이로 인해 초기 솔로 추측이 완벽해야 한다는 부담이 줄어들어, "그룹 춤" 단계에서 작은 실수들을 수정할 수 있습니다.

2. "흐릿한" 지도 (불확실성)

자동차가 어디에 있을지 예측할 때, 단순히 얇은 선 하나를 그을 수는 없습니다. 운전자가 급회전하거나 브레이크를 밟을 수 있으므로 가능성의 "구름"을 보여줘야 합니다.

  • 옛 방법: 대부분의 모델은 이 구름이 완벽한 원 (정규 분포) 이나 특정 마름모 모양 (라플라스 분포) 이라고 가정합니다.
  • RetroMotion 방법: 저자들은 "구름을 특정 모양에 억지로 맞추지 말자"라고 말합니다. 대신 지수 멱함수 분포 (Exponential Power Distribution) 라는 유연한 모양을 사용합니다.
  • 비유: 연기를 유리병에 넣으려 한다고 상상해 보세요. 어떤 구름은 둥글고, 어떤 것은 평평하며, 어떤 것은 뾰족합니다. 이 모델은 연기를 둥근 병에 억지로 넣는 대신, 연기에 맞춰 병을 성형합니다. 그들은 이러한 "연기 구름"이 보통 마름모 (라플라스) 처럼 보이지만 약간의 둥글기가 섞여 있어 훨씬 더 정확하다는 것을 발견했습니다.

3. 압축 트릭 (DCT)

8 초 동안의 경로를 예측하려면 수백 개의 데이터 포인트가 필요합니다. 모든 점을 저장하는 것은 무겁고 느립니다.

  • 비유: 길고 구불구불한 밧줄이 있다고 상상해 보세요. 밧줄의 모든 인치 위치를 정확히 저장하는 대신, 몇 가지 간단한 파동 (화음과 같은) 으로 묘사합니다.
  • 이 모델은 경로를 몇 개의 "파동"으로 압축하기 위해 이산 코사인 변환 (Discrete Cosine Transform, DCT) 이라는 수학적 도구를 사용합니다. 이로 인해 컴퓨터가 더 빠르게 실행되며, 중요하지 않은 미세한 잡음 떨림은 무시하고 매끄러운 실제 움직임에만 집중합니다.

4. "지시 가능한" 기능 (놀라움)

이 논문의 가장 놀라운 부분은 연구자들이 명시적으로 가르치지 않았음에도 불구하고 모델이 지시를 받아들일 수 있다는 것입니다.

  • 실험: 연구자들은 자동차에 대한 모델의 예측을 가져와서 경로의 끝을 수동으로 변경하여 "이 특정 지점으로 가라" (목표 기반 지시) 고 했습니다.
  • 결과: 모델은 새로운 경로를 맹목적으로 따르지 않았습니다. 대신 새로운 지시를 보고 "알겠어, 자동차가 저곳으로 가려면 더 일찍 방향을 틀어야 했겠군"이라고 말하며 교통 규칙과 다른 자동차들과 조화되도록 전체 경로를 조정했습니다.
  • "좌회전" 테스트: 그들은 심지어 자동차를 반대 차선으로 "좌회전"하게 하려고 시도했습니다 (불법입니다). 모델은 지시를 보고 그것이 위험하다고 인식하며 "아니, 그렇게 할 수 없어"라고 말하고, 차선을 유지하도록 자동차의 경로를 조정했습니다.
  • 교훈: 단순히 교통 예측에 능하도록 모델을 훈련시킴으로써, 모델은 우연히 명령을 듣고 이를 현실 세계에 적응시키는 법을 배웠습니다.

요약

RetroMotion은 다음과 같은 교통 예측 시스템입니다:

  1. 큰 문제를 작은 솔로 계획으로 나누고, 이를 그룹 계획으로 혼합합니다.
  2. 시작을 수정하기 위해 끝을 이용하는 "뒤에서 바라보는" 트릭을 사용하여 그룹 계획을 더 똑똑하게 만듭니다.
  3. 경직된 모양 대신 유연한 "구름"을 사용하여 불확실성을 예측합니다.
  4. 데이터를 압축하여 빠르게 실행합니다.
  5. 놀랍게도, 명령을 따르는 방법을 명시적으로 가르치지 않았음에도 인간의 지시를 듣고 이를 현장에 적응시키는 법을 배웠습니다.

저자들은 이 모델을 실제 주행 데이터 (Waymo, Argoverse, V2X) 로 테스트한 결과, 이전 방법들보다 교통을 더 잘 예측하며 복잡한 상호작용을 매우 잘 처리한다는 것을 발견했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →