← 최신 논문
💻 computer science

LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

LightNav-0는 통합된 토큰 인터페이스를 활용하여 사전 학습된 시각-언어 모델의 공간 지능을 로봇 제어와 유도 및 정렬함으로써, 작업별 예측 헤드 없이도 다양한 작업, 환경 및 형태에 걸쳐 최첨단 성능과 제로샷 일반화를 달성하는 소형 범용 임바디드 내비게이션 모델이다.

원저자: Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pa
게시일 2026-09-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 오랫동안 인간만큼 쉽게 세상을 이동하는 데 어려움을 겪어왔습니다. 사람은 방 안으로 걸어 들어가 파란색 의자를 발견하고, 테이블을 피해 이동하면서 음성 명령을 들을 수 있지만, 로봇은 종종 그저 혼란스러운 픽셀과 소리의 덩어리만을 보게 됩니다. 이 간극을 메우기 위해 과학자들은 보는 것, 생각하는 것, 그리고 움직이는 것을 별개의 작업으로 취급하는 특화된 시스템을 구축하는 데 수년을 보냈습니다. 소프트웨어의 한 부분은 사물을 인식하고, 다른 부분은 지도를 그리며, 또 다른 부분은 어느 방향으로 회전할지 결정할 수 있습니다. 이러한 방식은 통제된 환경에서는 잘 작동하지만, 로봇이 새로운 방이나 다른 종류의 기계, 혹은 복잡한 명령을 마주할 때는 종종 실패합니다. 과제는 장면을 이해하고, 어디로 갈지 추론하며, 그곳에 도달하기 위해 몸을 제어하는 것을 동시에 수행할 수 있는 하나의 마음을 만드는 것이었습니다.

연구진은 이제 로봇에게 사진을 보고, 가고자 하는 곳을 가리킨 다음, 움직이는 방식으로 인간처럼 생각하도록 가르치는 'LightNav-0'라는 새로운 시스템을 선보였습니다. 모든 작업에 별도의 도구를 만드는 대신, 연구진은 이미 언어와 이미지를 이해하고 있는 거대한 사전 학습된 컴퓨터 모델을 가져와 이를 항해(navigation)에 활용하도록 가르쳤습니다. 이 모델은 새로운 로봇이나 새로운 방에 맞춰 매번 재프로그래밍될 필요가 없습니다. 그저 보이는 것을 보고, 명령을 듣고, 경로를 결정할 뿐입니다. 그 결과, 이 시스템은 바퀴 달린 카트에서부터 네 발 달린 로봇에 이르기까지 어떤 종류의 기계에서도 특별한 조정 없이 명령을 따르고, 특정 물체를 찾고, 심지어 움직이는 대상을 추적할 수 있는 콤팩트한 시스템이 되었습니다.

이 시스템의 핵심은 로봇의 생각을 행동으로 변환하는 영리한 방법입니다. 로봇이 복도 사진을 보고 있는 화면을 보고 있다고 상상해 보십시오. 로봇이 "석조 건물 옆에 있는 파란색 음식 메뉴 표지판 쪽으로 걸어가라"는 명령을 들었을 때, 즉시 바퀴를 돌리기 시작하지는 않습니다. 먼저, 로봇은 내부적인 추론을 통해 화면상의 두 특정 지점을 가리킵니다. 한 점은 열린 바닥 공간처럼 안전하게 이동할 수 있는 곳을 나타내고, 다른 한 점은 실제 목표물인 파란색 표지판을 식별합니다. 이 '가리키기(pointing)' 행위는 로봇의 뇌와 몸 사이의 명확하고 공유된 언어 역할을 합니다. 이 지점들이 설정되면, 로봇은 그 지점에 도달하기 위한 10단계의 짧은 경로를 예측합니다. 그런 다음 이 경로를 실행하고, 새로운 시야를 확인하며, 과정을 반복합니다. 여정을 이러한 작고 추론된 단계들로 나눔으로써, 로봇은 길을 잃거나 혼란에 빠지지 않고 복잡한 환경을 다룰 수 있습니다.

이 기술을 가르치기 위해 연구진은 단순히 몇 가지 예시만을 보여준 것이 아닙니다. 그들은 2,000개 이상의 서로 다른 장면과 4,000시간 이상의 항해 데이터를 포함하는 거대한 훈련 라이브러리를 구축했습니다. 이 라이브러리에는 물체를 찾는 법, 사람을 따라가는 법, 그리고 실내외 공간을 이동하는 법에 대한 명령이 포함되었습니다. 훈련 과정은 단계별로 진행되었습니다. 먼저, 모델은 공간적 관계를 이해하고 이미지 속의 사물과 위치를 정확하게 가리키도록 학습되었습니다. 그다음, 이 가리키기 능력을 실제 항해에 필요한 이동 명령과 결합하는 법을 배웠습니다. 마지막으로, 시스템은 시행착오 과정을 통해 스스로 실수를 바로잡고 경로 계획을 개선하며 정교해졌습니다. 이러한 엄격한 훈련을 통해 모델은 일반화될 수 있었으며, 이는 훈련 데이터에서 배운 것을 한 번도 본 적 없는 완전히 새로운 상황에도 적용할 수 있음을 의미합니다.

이 연구의 결과는 매우 유의미합니다. 왜냐하면 단 하나의 상대적으로 작은 컴퓨터 모델이 여러 개의 서로 다른 특화된 부품에 의존하는 훨씬 더 크고 복잡한 시스템보다 더 뛰어난 성능을 보였기 때문입니다. 10개의 서로 다른 시뮬레이션 환경에서 실시된 테스트에서, 이 새로운 시스템은 단일 카메라 뷰만을 허용하고 깊이 센서나 미리 만들어진 지도에 접근할 수 없는 상황에서도 명령 수행 및 물체 찾기에서 가장 높은 성공률을 달しまいました. 이 시스템은 실내 방, 야외 지역, 심지어 시각적 스타일이 완전히 다른 게임 세계에서도 잘 작동했습니다. 더욱 인상적인 것은, 연구진이 동일한 소프트웨어를 휴머노이드 로봇, 네 발 달린 로봇, 비행 드론, 그리고 바퀴 달린 차량이라는 네 가지 매우 다른 물리적 로봇에 테스트했다는 점입니다. 단 한 줄의 코드도 바꾸거나 모델을 재학습시키지 않고도, 시스템은 이 네 가지 유형의 기계가 사람을 따라가거나 특정 물체를 찾는 등의 실제 작업을 수행하도록 성공적으로 안내했습니다.

이 접근 방식은 로봇에게 새로운 작업이나 몸체마다 고유한 뇌가 필요하다는 기존의 관념에 도전합니다. 로봇이 목표를 가리키고 짧은 경로를 계획하는 통합된 방법을 사용함으로써, 연구진은 단 하나의 콤팩트한 시스템이 다양한 항해 작업을 처리할 수 있음을 보여주었습니다. 이 시스템은 마법이나 복잡하고 숨겨진 계산에 의존하지 않습니다. 그저 세상을 보고, 명령을 이해하며, 나아갈 길을 가리킬 뿐입니다. 이 작업은 주로 시뮬레이션과 통제된 실제 환경에서 테스트되었지만, 이 기술을 서로 다른 로봇과 환경으로 전이할 수 있는 능력은 로봇을 광범적한 재프로그래밍 없이 새로운 장소에 배치하고 새로운 작업을 부여할 수 있는 미래를 암시합니다. LightNav-0의 성공은 더 유능하고 적응력 있는 로봇을 향한 길이 더 크고 전문화된 기계를 만드는 것이 아니라, 인간이 매일 사용하는 것과 같은 단순함과 유연함으로 생각하고 가리키는 법을 가르치는 데 있음을 나타냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →