← 최신 논문
💻 computer science

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

VEGA는 레이블이 없는 1인칭 시점 비디오로부터 국소 장면 기하 구조를 재구성하여 감독을 위한 장애물 인지 궤적을 생성함으로써, 기존 베이스라인에 비해 충돌 회피 및 성공률에서 상당한 개선을 달착하는 내비게이션 시각-언어-행동 모델 학습 방법을 소개한다.

원저자: Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Dinesh Manocha

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Dinesh Manocha

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 사람이 붐비는 방을 지나가면서 의자나 사람, 테이블에 부딪히지 않고 걷는 법을 가르치고 싶다고 상상해 보세요. 보통 로봇에게 이를 가르치려면 다음 두 가지 방법 중 하나가 필요합니다:

  1. 로봇이 지켜보는 동안 인간이 그 방을 똑같이 걸어가는 모습을 기록하거나,
  2. 특정 장애물을 피하도록 로봇을 수동으로 프로그래밍하는 것입니다.

이 방법들은 느리고, 비용이 많이 들며, 확장하기 어렵습니다. 세상의 모든 가능한 방을 통과하며 걷는 인간을 일일이 기록할 수는 없기 때문입니다.

VEGA를 소개합니다.

이 논문의 연구자들은 인터넷에서 발견되는 수십억 개의 "현장(in-the-wild)" 영상(사람들이 집 안을 걷거나, 하이킹 코스를 가거나, 번화한 거리를 다니는 영상 등)을 사용하여 로봇에게 길 찾기를 가르치는 영리한 방법을 고안해 냈습니다. 이러한 영상들은 실제의 무질서하고 복잡한 환경을 잘 보여주지만, 한 가지 큰 문제가 있습니다. 바로 로봇에게 어디로 가야 하는지, 혹은 어떻게 가구를 피해야 하는지를 알려주지 않는다는 점입니다. 이 영상들은 그저 "행동 정보가 없는(action-free)" 영상들입니다.

VEGA가 어떻게 이 무작위적인 영상들을 내비게이션 선생님으로 바꾸는지, 몇 가지 창의적인 단계를 통해 설명하겠습니다.

1. "정신적 지도" 기법

먼저, VEGA는 영상의 단일 프레임을 보고 특수한 AI를 사용하여 방의 3D 정신적 지도를 구축합니다. 바닥이 어디인지, 벽이 어디에 있는지, 그리고 장애물(예: 커피 테이블이나 강아지)이 어디에 서 있는지 파악합니다. 이를 통해 걸어 다닐 수 있는 공간이 정확히 얼마나 되는지를 아는 "안전 지도"를 만듭니다.

2. "만약에?" 게임

지도가 구축되면, VEGA는 "만약에?" 게임을 수행합니다.

  • 만약 로봇이 저 빨간 의자로 가고 싶다면?
  • 만 만약 문 쪽으로 가고 싶다면?
  • 만약 그냥 카펫 위의 빈 공간으로 걷고 싶다면?

모든 가능한 목적지에 대해, VE가 수학적 플래너를 사용하여 아무것도 부딪히지 않고 목적지에 도달할 수 있는 완벽하고 안전한 경로를 계산합니다. 이렇게 수백만 번을 반복하여 "목표 + 안전한 경로" 쌍으로 이루어진 거대한 라이브러리를 생성합니다.

3. "학생" 로봇

이제, VEGA는 로봇의 뇌(VLA 또는 시각-언어-행동 모델이라고 불림)를 훈련시킵니다. 이 학생 로봇은 원래의 영상을 관찰하면서 VEGA가 계산한 "안전한 경로"를 함께 봅니다.

  • 수업 내용: "여기 네가 보는 것(영상)이 있고, 여기 네가 가고자 하는 곳(목표)이 있으며, 여기 네가 따라야 할 안전한 경로가 있다."
  • 결과: 로봇은 장면을 보고, 목표(예: "주방으로 가라" 또는 "저 사진 앞으로 가라")를 이해하고, 카메라 피드만 보고도 즉시 안전한 경로를 찾아내는 법을 배웁니다. 훈련이 끝나면 더 이상 3D 지도가 필요하지 않습니다. 오직 눈과 뇌만을 사용하면 됩니다.

이것이 왜 대단한 일인가요?

운전을 배우는 과정에 비유해 보겠습니다.

  • 기존 방식: 특정 차를 타고 특정 거리에서 운전 강사가 옆에 앉아 언제 회전해야 하는지 정확히 알려주는 방식으로만 운전을 배웁니다.
  • VEGA 방식: 전 세계의 수많은 블랙박스 영상을 시청합니다. 컴퓨터를 사용하여 각 영상 속의 가능한 모든 목적지에 대한 "완벽한 주행 라인"을 찾아냅니다. 그런 다음, 그 완벽한 라인을 모방하도록 당신의 뇌를 훈련시킵니다.

결과

연구진은 복잡하고 어지러운 방과 움직이는 장애물이 있는 환경에서 실제 로봇을 대상으로 테스트를 진행했습니다. 다른 최고 수준의 로봇 내비게이터들과 비교했을 때:

  • 성공률: 로봇이 목적지에 훨씬 더 자주 도달했습니다 (최소 150% 더 나은 성능).
  • 안전성: 충돌 횟수가 66% 감소했습니다.
  • 공간 활용: 로봇이 스스로 움직일 수 있는 여유 공간을 더 많이 확보하여, 좁은 구간을 통과할 때 충돌을 60% 더 적게 피했습니다.

또한, 그들은 자신들의 방식이 충돌 회피와 특정 목표 도달 측면에서 경쟁 모델보다 뛰어나다는 것을 증명하기 위해 VEGA-Bench(25만 개의 장면과 500만 개의 목표 포함)라는 거대한 테스트를 만들었습니다.

요약하자면: VEGA는 인터넷의 혼란스러운 영상 라이브러리를 기하학을 이용한 구조화된 "안전 매뉴얼"로 변환하여, 로봇이 값비싼 수동 훈련 세션 없이도 현실 세계를 항해할 수 있도록 가르칩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →