← 최신 논문
💻 computer science

GoalVLM: VLM-driven Object Goal Navigation for Multi-Agent System

GoalVLM 는 비전 - 언어 모델 (VLM), SAM3, SpaceOM 을 통합하여 재학습 없이도 자유로운 언어 명령을 이해하고 개방형 어휘의 객체 목표를 탐색할 수 있는 제로샷 다중 에이전트 협업 내비게이션 프레임워크를 제안합니다.

원저자: MoniJesu James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

게시일 2026-03-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: MoniJesu James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"GoalVLM"**이라는 새로운 로봇 팀을 소개합니다. 이 팀은 복잡한 집이나 건물을 돌아다니며, 우리가 말로만 설명하는 "보이지 않는 물건"을 찾아내는 임무를 수행합니다.

기존의 로봇들은 "의자", "책상"처럼 미리 정해진 물건 이름만 알 수 있었지만, GoalVLM 은 "새로운 물건이 뭐야?"라고 물어보면 그 즉시 이해하고 찾아낼 수 있는 초능력을 가졌습니다.

이 기술을 쉽게 이해할 수 있도록 세 명의 탐정이 등장하는 이야기를 통해 설명해 보겠습니다.


🕵️‍♂️ GoalVLM: "말만 하면 찾아주는 로봇 탐정 팀"

1. 기존 로봇 vs GoalVLM 팀의 차이

  • 기존 로봇 (외계인): "빨간 사과를 찾아줘"라고 하면 사과를 찾지만, "내 친구가 잃어버린 노란색 우산을 찾아줘"라고 하면 "우산? 그런 건 내 사전에 없어요"라고 답하며 멈춰 섭니다. 로봇이 학습한 물건 목록에 없으면 무조건 실패합니다.
  • GoalVLM 팀 (현명한 탐정들): "노란 우산"이라고만 말해도, "아! 우산은 비가 올 때 쓰거나, 옷장이나 현관에 있을 거야!"라고 추측합니다. 사전에 없어도 상식과 언어 능력을 통해 그 물건을 찾아냅니다.

2. 팀의 구성원: 2 대의 드론 (로봇)

이 팀은 보통 **두 대의 로봇 (드론)**으로 이루어져 있습니다. 마치 탐정 영화에서 한 명은 현장을 수색하고, 다른 한 명은 지도를 보며 협력하는 것처럼요.

  • 협력의 마법: 한 로봇이 방을 비추고, 다른 로봇이 복도를 수색합니다. 그들이 본 정보는 실시간으로 공유되어 하나의 거대한 지도가 됩니다. 덕분에 "어? 너도 그 방 봤어? 그럼 내가 다른 곳 가볼게"라며 중복 수색을 하지 않아 훨씬 빠릅니다.

3. 핵심 기술 3 가지 (비유로 설명)

① 눈과 뇌의 결합 (SAM3 & VLM)

  • 눈 (SAM3): 로봇은 카메라로 주변을 보며, "여기 저기 뭐가 보이네?"라고 생각합니다. 이때 SAM3라는 AI 가 "이건 가방이야, 저건 장난감이야"라고 텍스트로만 지시받아도 즉시 찾아냅니다. 마치 "내 사진 속의 고양이 찾아줘"라고 말하면 사진에서 고양이를 딱 잡아주는 마법 같은 눈입니다.
  • 뇌 (SpaceOM): 로봇은 단순히 눈만 쓰는 게 아니라 상식도 씁니다. "냉장고를 찾아줘"라고 하면, 로봇은 "냉장고는 부엌에 있을 확률이 높지"라고 추측합니다. SpaceOM이라는 AI 가 "부엌은 어디지?"라고 생각하며 탐색 방향을 잡아줍니다.

② 3D 지도 그리기 (Goal Projector)

  • 로봇이 카메라로 물체를 발견하면, 그 위치를 2D 사진에서 3D 공간으로 옮겨 그립니다.
  • 비유: 마치 비행기에서 땅을 내려다보며 "저기 빨간 차가 있네"라고 표시하는 것처럼, 로봇은 자신이 본 물체의 위치를 **새끼손가락 크기의 지도 (BEV 맵)**에 정확히 찍어둡니다. 이렇게 하면 물체가 벽 뒤에 숨겨져 있더라도, 로봇은 "아, 저기 벽 뒤쪽에 있구나"라고 알 수 있습니다.

③ 미로 찾기 전략 (프론티어 탐색)

  • 로봇은 막힌 길 (벽) 과 아직 가보지 않은 길 (미지의 영역) 의 경계선을 **'프론티어'**라고 부릅니다.
  • GoalVLM 은 이 경계선 중 어디로 가야 할지 고민합니다. "이쪽은 거실 같으니 TV 가 있을지도 모르고, 저쪽은 부엌 같으니 컵이 있을지도 몰라."라고 AI 가 상식으로 판단하여 가장 유력한 곳으로 이동합니다.

4. 실제 실험 결과: 얼마나 잘할까?

연구진은 이 로봇들을 가상 현실 (시뮬레이션) 과 실제 실험실 (실제 드론) 에서 테스트했습니다.

  • 성공률: 100 번의 미션 중 약 56 번은 성공적으로 물건을 찾았습니다. (기존 기술들은 30% 미만이었으니 엄청난 발전입니다!)
  • 특이점: 로봇이 학습한 적이 없는 새로운 물건이나 복잡한 문장으로도 잘 작동했습니다.
  • 약점: 거울이나 유리처럼 반사되는 물체, 혹은 아주 작은 물건 (사진, 책) 은 찾기가 조금 어렵습니다. 거울에 비친 모습이 실제 물체처럼 보여 로봇이 혼란을 겪기 때문입니다.

5. 왜 이 기술이 중요한가요?

이 기술의 가장 큰 장점은 **"학습이 필요 없다"**는 것입니다.

  • 기존 로봇은 새로운 집이나 새로운 물건을 만나면 다시 수천 번을 학습시켜야 했습니다.
  • 하지만 GoalVLM 은 출발하자마자 새로운 환경에서도 "내 새 신발을 찾아줘"라고 말하면 바로 찾아냅니다. 마치 언어를 배우지 않은 아기가 아니라, 언어를 배운 성인이 새로운 도시를 여행하듯 유연하게 대처합니다.

📝 한 줄 요약

GoalVLM은 두 대의 로봇이 서로 협력하며, **사람의 말 (언어) 과 상식 (AI)**을 이용해 미리 정해진 목록 없이도 어떤 물건이든 찾아내는 똑똑한 탐정 팀입니다.

이 기술이 발전하면, 앞으로는 "내 잃어버린 열쇠 찾아줘"라고 말하면 로봇이 집 구석구석을 찾아주거나, 재해 현장에서 "구조가 필요한 사람 찾아줘"라고 명령하면 로봇이 자동으로 탐색하는 세상이 올 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →