← 최신 논문
💻 computer science

Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning

Discrete-WAM은 공유된 이산 확산 과정을 통해 세계의 역학(world dynamics)과 의사결정 정책을 공동으로 모델링함으로써, 비전 및 액션 토큰을 정렬하여 자율 주행을 위한 구성적 인과 추론, 제어 가능한 생성, 그리고 반사실적 계획을 가능하게 하는 통합된 이산 잠재 프레임워크를 도입한다.

원저자: Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

게시일 2026-06-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 자동차 운전법을 가르치고 있다고 상상해 보세요. 현재 대부분의 방식은 숙련된 운전자의 영상을 보여주며 "보는 대로 똑같이 따라 해"라고 말하며 학생에게 운전을 가르치는 것과 같습니다. 로봇은 움직임을 모방하는 법을 배우지만, 왜 운전자가 핸들을 돌렸는지, 혹은 그 회전이 다음에 어떤 변화를 일으키는지에 대한 '이유'는 이해하지 못합니다. 그저 패턴을 암기할 뿐입니다.

다른 방식들은 '세계 모델(world model)'—즉, 미래에 대한 정신적 시뮬레이션—을 구축하려고 시도합니다. 하지만 이 방식들은 종종 흐릿하고 연속적인 데이터 구름을 이용해 날씨를 예측하려는 것과 같습니다. "내가 왼쪽으로 꺾으면 옆 차가 오른쪽으로 움직일 것이다"와 같이 특정하고 논리적인 단계로 이 구름을 쪼개기가 매우 어렵기 때문입니다.

Discrete-WAM(샤오미 개발)은 이 두 가지 문제를 해결하고자 하는 새로운 접근 방식입니다. 이 기술이 어떻게 작동하는지 쉽게 설명해 드리겠습니다.

1. "레고" 방식 (이산적 토큰)

Discrete-WAM은 세상을 매끄럽고 흐릿한 영상이나 복잡한 수학 방정식으로 보는 대신, 모든 것을 레고 블록('이산적 토큰'이라 불림)으로 분해합니다.

  • 시각 정보: 카메라 이미지의 모든 부분은 특정한 레고 브릭으로 변환됩니다.
  • 행동: 자동차가 하는 모든 움직임(가속, 회전 등) 또한 특정한 레고 브릭이 됩니다.
  • 마법 같은 점: 시각 정보와 행동이 모두 동일한 종류의 레고 브릭으로 만들어졌기 때문에, AI는 이들을 쉽게 섞고 조합할 수 있습니다. AI는 도로의 사진을 보고, '왼쪽으로 회전'이라는 브릭을 집어 들어 사진 위에 딱 붙임으로써 미래의 모습이 어떻게 변할지 확인할 수 있습니다.

2. "편집" 버튼 (통합 생성)

이 AI를 단순히 미래를 예측하는 기계가 아니라, '찾기 및 바꾸기' 도구를 가진 편집자라고 생각해보세요.

  • 과정: AI는 미래에 대한 초안(도로와 자동차 경로에 대한 흐릿한 추측)에서 시작합니다.
  • 반복적 정교화: 그 후, 마치 작가가 글을 수정하듯 이 초안을 여러 번 반복해서 다듬습니다. 각 단계에서 AI는 잘못되었거나 불확실해 보이는 "레고 브릭"을 찾아내어 더 나은 것으로 교체합니다.
  • 도움이 되는 이유: 이를 통해 AI는 다양한 "만약에(what-if)" 시나리오를 시도해 볼 수 있습니다. "여기서 왼쪽으로 꺾는다면?"이라고 물어보고, 즉시 미래의 이미지를 편집하여 그 결과를 확인한 뒤, 다시 "오른쪽으로 꺾는다면?"이라고 묻고 그 결과 역시 편집할 수 있습니다. 즉, 하나의 경로에 즉시 결정을 내릴 필요가 없습니다.

3. "선장과 선원" (계층적 계획)

이 논문은 의사결정을 내리는 스마트한 방법으로 역할을 두 개로 나눕니다.

  • 선장 (상위 수준의 결정): 이 부분의 AI는 "차선을 변경한다" 또는 "멈춘다"와 같은 크고 단순한 선택을 내립니다. 마치 선장이 일반적인 명령을 외치는 것과 같습니다.
  • 선원 (하위 수준의 행동): 선장이 명령을 내리면, 선원들은 그 명령을 실행하기 위한 부드럽고 세밀한 움직임을 결정합니다. 이들은 구체적인 조향과 속도 조절을 담당합니다.
  • 이점: 이 방식은 AI가 혼란에 빠지는 것을 방지합니다. 만약 AI가 모든 미세한 바퀴 움직임을 한꺼번에 파악하려 한다면 길을 잃을 수 있습니다. '큰 아이디어'와 '세부 사항'을 분리함으로써, AI는 안정성과 안전성을 유지할 수 있습니다.

4. "안전 시뮬레이터" (역사실적 추론)

AI는 미래를 매우 쉽게 편집할 수 있기 때문에, 자동차를 위한 비행 시뮬레이터 역할을 수행합니다.

  • AI는 자동차가 정상적으로 주행하는 시뮬레이션을 실행하여 안전한지 확인할 수 있습니다.
  • 그런 다음, 시뮬레이션을 "편집"하여 다음과 같은 질문을 던질 수 있습니다: "만약 저 보행자가 발을 내디딘다면?" 또는 "만약 내가 너무 늦게 브레이크를 밟는다면?"
  • 만약 시뮬레이션에서 충돌(AI가 예상하지 못한 '놀라운 사건')이 발생한다면, 시스템은 그 경로가 위험하다는 것을 알게 됩니다. 이는 AI가 머릿속에서 먼저 위험한 시나리오를 테스트함으로써 사고를 미연에 방지하도록 돕습니다.

결과

이 시스템은 방대한 실제 주행 데이터셋을 통해 테스트되었습니다.

  • 성능: 현재의 최고 수준 시스템들과 대등하거나 그 이상의 성능을 보여주었습니다.
  • 안전성: 충돌을 피하고 교통 법규를 준수하는 데 있어 더 뛰어난 모습을 보였습니다.
  • 창의성: 단순히 본 것을 복제하는 다른 시스템들과 달리, 이 시스템은 본 적 없는 새로운 안전한 주행 경로를 생성해 낼 수 있었으며, 이는 실제로 도로의 규칙을 이해하고 있음을 증명했습니다.

요약하자면: Discrete-WAM은 자율주행 자동차에게 "레고 블록"으로 생각하는 법을 가르칩니다. 이를 통해 AI는 비디오 편집자처럼 미래를 편집하고, 큰 결정과 작은 세부 사항을 분리하며, 실제 움직이기 전에 그 움직임이 안전한지 머릿속 시뮬레이션을 통해 확인할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →