← 최신 논문
💻 computer science

WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation

WorldVLN 은 실행 가능한 웨이포인트 동작을 직접 디코딩하기 위해 단시간 지평 세계 상태 전이를 예측하는 최초의 자동회귀 세계 동작 모델을 항공 비전 - 언어 내비게이션에 도입하여, Action-aware GRPO 를 활용한 새로운 2 단계 훈련 프레임워크를 통해 벤치마크에서 우수한 성능을 달성하고 제로샷 실세계 드론 배포를 실현합니다.

원저자: Baining Zhao, Jiacheng Xu, Weicheng Feng, Xin Zhang, Zhaolu Wang, Haoyang Wang, Shilong Ji, Ziyou Wang, Jianjie Fang, Zhiheng Zheng, Weichen Zhang, Yu Shang, Wei Wu, Chen Gao, Xinlei Chen, Yong Li

게시일 2026-05-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Baining Zhao, Jiacheng Xu, Weicheng Feng, Xin Zhang, Zhaolu Wang, Haoyang Wang, Shilong Ji, Ziyou Wang, Jianjie Fang, Zhiheng Zheng, Weichen Zhang, Yu Shang, Wei Wu, Chen Gao, Xinlei Chen, Yong Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

드론이 도시나 집 안을 날아다니는 것을 당신의 목소리만 듣고 가르친다고 상상해 보세요. "빨간 건물로 날아가서, 그 다음 나무를 한 바퀴 돌라"고 말하면, 드론은 그 작업을 수행하기 위해 모터를 어떻게 움직여야 하는지 정확히 파악해야 합니다.

이 논문은 드론에게 이러한 기술을 가르치는 새로운 방법인 WorldVLN을 소개합니다. 작동 원리를 간단히 설명하면 다음과 같습니다:

구식 방식: "추측과 확인"

대부분의 현재 드론 조종사 (AI 모델) 는 눈가리개를 쓴 채 도로의 현재 모습만 보여주는 이미지로만 운전하는 사람처럼 작동합니다. 그들은 현재 이미지와 지시를 보고 다음 움직임을 추측합니다.

  • 문제점: 그들은 인과관계를 제대로 이해하지 못합니다. "지금 왼쪽으로 꺾으면 2 초 뒤에 저 벽에 충돌할 것이다"라는 사실을 알지 못합니다. 그들은 단순히 현재 순간에 반응할 뿐이며, 상황이 복잡해지면 종종 실수를 저지릅니다.

새로운 방식: "공상하는 드론"

이 논문의 저자들은 드론이 잘 날아다니기 위해서는 공상가가 되어야 한다고 주장합니다. 움직이기 전에 움직인 후 세상이 어떻게 보일지 상상해야 합니다.

WorldVLN은 "세계 행동 모델 (World Action Model)"입니다. 조종사가 눈을 잠시 감고 비행의 다음 몇 초를 시각화한 후 결정하는 것과 같습니다: "좋아, 앞으로 날아가면 문을 보게 될 거야. 왼쪽으로 날아가면 벽에 부딪힐 거야. 그러니 앞으로 날아가겠어."

WorldVLN 이 이를 수행하는 단계별 과정은 다음과 같습니다:

1. "시간 여행"하는 뇌

WorldVLN 은 현재 비디오 피드만 보는 것이 아니라, 미래를 예측할 수 있는 특수한 뇌 (비디오 생성 기술 기반) 를 사용합니다.

  • 비유: 영화를 보고 있다고 상상해 보세요. 일반적인 AI 는 현재 프레임만 봅니다. WorldVLN 은 영화를 멈추고 "캐릭터가 절벽에서 뛰어내리면 다음 5 프레임이 어떻게 보일까?"라고 묻습니다. 그런 다음 미래 장면의 짧고 흐릿한 "꿈"을 생성합니다.

2. 꿈을 움직임으로 전환하기

드론이 미래에 대한 이 "꿈"을 갖게 되면, 단순히 그것을 지켜보기만 하지 않습니다. 대신 질문합니다: "이 꿈이 내가 하라고 들은 내용과 일치하는가?"

  • 꿈이 추락을 보여준다면, 그 움직임이 나쁘다는 것을 알 수 있습니다.
  • 꿈이 목표에 안전하게 접근하는 모습을 보여준다면, 그 꿈을 실제 모터 명령 (경유지) 으로 변환합니다.
  • 핵심 차이점: 단순히 "이미지 -> 움직임"을 매핑하는 것이 아니라, "지시 -> 미래의 꿈 -> 움직임"을 매핑합니다.

3. "폐쇄 루프" 교정

이 부분이 가장 중요합니다. 드론이 실제로 움직임을 수행한 후, 눈을 떠서 실제로 일어난 일을 확인합니다.

  • 비유: 체스 선수와 같습니다. 그들은 수를 계획하고, 그 수를 두며, 그 다음 수를 계획하기 전에 새로운 현실로 정신적 보드를 즉시 업데이트합니다.
  • WorldVLN 은 드론 카메라의 실제 새로운 시야를 가져와서 그 "꿈꾸는" 뇌에 다시 입력합니다. 이는 드론이 길을 잃거나 시간이 지남에 따라 점점 더 나빠지는 실수를 저지르는 것을 막아줍니다.

어떻게 가르쳤는지 (학습 과정)

연구자들은 드론이 무작위로 날아다니게 하지 않았습니다. 대신 두 단계의 학습 방법을 사용했습니다:

  1. 1 단계: 학생 (지도 학습): 그들은 드론에게 수천 개의 인간이 드론을 조종하는 예시를 보여주었습니다. 드론은 비디오와 지시를 보고 비행의 다음 몇 초를 "꿈꾸는" 법을 배우고, 마지막으로 인간의 움직임을 모방했습니다. 이를 통해 드론은 세상이 어떻게 움직이는지에 대한 기초를 배웠습니다.
  2. 2 단계: 코치 (강화 학습): 여기서 Action-aware GRPO라는 새로운 방법이 도입되었습니다.
    • 비유: 게임이 끝난 후 "잘했다"거나 "나쁘다"고만 말하는 코치가 아니라, 플레이어가 하는 모든 움직임을 지켜보는 코치를 상상해 보세요. 플레이어가 나중에 승리로 이어지는 움직임을 만들면 코치는 큰 보상을 줍니다. 나중에 추락으로 이어지는 움직임을 만들면 코치는 패널티를 줍니다.
    • 이는 드론에게 미리 생각하도록 가르쳤습니다: "지금 이 작은 회전을 하면 나중에 목표에 도달하는 데 도움이 될 거야."

결과

연구자들은 이 방법을 야외 및 실내 드론 벤치마크에서 테스트했습니다.

  • 점수: WorldVLN 은 이전의 모든 "추측과 확인" 모델보다 압도적인 차이 (성공적인 비행이 12% 이상 증가) 로 앞섰습니다.
  • 실제 세계 테스트: 그들은 컴퓨터 시뮬레이션에서만 훈련된 드론을 실제 세계로 가져가 추가 훈련 없이 날렸습니다. 드론은 실내 공간과 야외 지역 모두에서 "지붕으로 날아가라"거나 "의자를 한 바퀴 돌라"는 지시를 성공적으로 따랐습니다.

요약

WorldVLN은 단순히 지금 보이는 것에 반응하는 드론 조종사가 아닙니다. 그것은 다음에 무슨 일이 일어날지 상상하고, 그 미래가 좋은지 확인한 후 행동합니다. 만약 잘못되면 실제 결과에서 배우고 다음 단계에 대한 상상을 업데이트합니다. 이는 이전 방법들보다 복잡한 3 차원 공간을 항해하는 데 훨씬 더 뛰어납니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →