← 최신 논문
💻 computer science

AnchorVLN: Geometry-Anchored Vision-Language Grounding Reasoning for Open-Vocabulary Navigation

이 논문은 시각-언어 모델이 의미론적 추론을 담당하는 동안 기하학적 도구가 독립적으로 미터법 수치를 결정하도록 하는 엄격한 분리를 강제하기 위해 모델 컨텍스트 프로토콜(MCP) 서버를 활용함으로써, 직접적인 좌표 추정 방식과 비교하여 미지의 환경에서 지시 이행 정확도와 객체 위치 결정 정밀도를 크게 향상시킨 개방형 어휘 시각-언어 내비게이션 시스템인 AnchorVLN을 소개한다.

원저자: Long Giang Vu, Chengkai Yao, Yuxin Liu, FNU Aryan, Rajath Chandrashekar Aralikatti

게시일 2026-09-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Long Giang Vu, Chengkai Yao, Yuxin Liu, FNU Aryan, Rajath Chandrashekar Aralikatti

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 한 번도 본 적 없는 방에 들어가서 "그림 아래에 있는 스툴"과 같은 구체적인 음성 설명에 따라 특정 물체를 찾는 상황을 상상해 보십시오. 수십 년 동안 로봇은 레이저와 카메라를 사용하여 세계의 정밀한 수학적 지도를 구축함으로써 이 문제를 해결해 왔습니다. 그리고 그 지도에서 미리 프로그래밍된 물체 이름을 검색했습니다. 이 방식은 "의자"나 "탁자"를 찾는 데는 효과적이었지만, "창가 근처의 빨간 의자"와 같이 창의적이거나 구체적인 지시가 내려지면 실패했습니다. 로봇의 어휘는 고정되어 있었고, 새로운 설명을 이해할 수 없었습니다. 최근 몇 년 사이, 이미지를 보고 인간이 제시할 수 있는 거의 모든 설명을 이해할 수 있는 강력한 인공지능 모델들이 등장했습니다. 그러나 이 모델들은 언어에는 뛰어나지만 수학에는 매우 서툽니다. 그들은 물체가 무엇인지는 말할 수 있지만, 얼마나 멀리 있는지 또는 도달하기 위해 정확히 어디로 이동해야 하는지에 대해서는 엉뚱한 추측을 하는 경우가 많습니다. 만약 로봇이 전적으로 이러한 모델에 의존하여 주행한다면, 모델이 존재하지 않는 거리를 지어냈기 때문에 존재하지 않는 지점을 향해 자신 있게 달려갈 수도 있습니다.

AnchorVLV라고 알려진 이 연구의 연구진들은 로봇이 알고 있는 것과 어떻게 움직이는지를 엄격하게 분리하는 방식으로 이 문제를 해결했습니다. 그들은 인공지능이 언어와 물체의 식별을 담당하게 하고, 로봇의 물리적 센서가 거리와 방향을 처리하게 하는 것이 최선의 접근 방식임을 깨달았습니다. 그들은 AI가 무엇을 찾아야 하는지 가리키는 가이드 역할을 하되, 결코 얼마나 멀리 가야 하는지는 말하지 않도록 하는 시스템을 구축했습니다. 대신, 이 시스템은 AI의 설명을 실제 로 l 데이터(laser data)를 사용하여 물리적 좌표로 변환하는 디지털 도구 세트를 사용합니다. 이를 통해 로봇이 가짜 숫자에 기반하여 행동하는 일을 방지합니다. 이 시스템은 15개의 서로 다른 실내 장면이 포함된 챌린지에서 테스트되었으며, 로봇은 30개의 복잡한 지시를 따르고 45개의 질문에 답해야 했습니다. 결과에 따르면, 시스템이 이 역할 분담을 사용했을 때 지시를 64.4%의 확률로 성공적으로 수행했습니다. 연구진이 물리적 거리를 확인하는 부분을 제거했을 때 성공률은 크게 떨어졌습니다. 또한, 물체의 정확한 위치를 가리키라는 요청을 받았을 때, 실제 센서 데이터를 사용하는 시스템은 위치를 추측하려는 시스템보다 훨씬 더 정확했으며, 물체의 중심을 찾는 평균 오차를 3미터 이상에서 2.5미터 미만으로 줄였습니다.

이 성과의 핵심은 로봇의 뇌와 몸을 연결하는 새로운 방식에 있습니다. 연구진은 인공지능이 구절과 이름으로만 말할 수 있고 절대 숫자로 말할 수 없는 통신 프로토콜을 설계했습니다. 로봇이 방의 사진을 볼 때, AI는 "스툴"을 식별하고 "물체 7"과 같은 임시 이름을 부여할 수 있습니다. 그런 다음 AI는 시스템에 스툴을 찾으라고 요청합니다. 시스템은 AI에게 스툴이 얼마나 멀리 있는지 묻지 않습니다. 대신, 시스템은 바닥과 벽까지의 실제 거리를 측정하는 로봇 자체의 레이저 스캐너를 살펴봅니다. 시스템은 레이저 데이터에서 스툴을 찾아 실제 거리를 계산하고, 로봇에게 그 특정 지점을 향해 이동하라고 명령합니다. 만약 AI가 거리를 추측하려고 하면, 시스템은 그 숫자를 받도록 프로그래밍되어 있지 않기 때문에 단순히 무시합니다. 이는 마치 사람이 친구의 방향 지시를 들으면서 거리를 판단하기 위해 자신의 눈에 의존하는 것처럼, 로봇이 움직임을 위해 자신의 감각에 의존하도록 강제하는 것입니다. 로봇은 "TV와 가장 가까운 의자로 가라"와 같은 복잡한 지시를 여전히 이해할 수 있는데, 이는 시스템이 AI에게 계산을 요청하는 대신 자신이 본 모든 의자의 실제 거리를 TV와 비교할 수 있기 때문입니다.

이러한 접근 방식은 로봇이 갇히거나 빈 공간을 향해 움직이는 문제도 해결합니다. 만약 AI가 물체를 찾을 수 없다다면, 시스템은 로봇에게 억지로 추측하도록 강요하지 않습니다. 대신, 더 나은 시야를 확보할 수 있는 새로운 장소로 이동하라고 지시합니다. 그러면 로봇은 구역을 다시 스캔하고, 시스템은 내부의 물체 목록을 업데이트합니다. 이 목록은 로봇이 보는 모든 물체가 실제 크기와 위치와 함께 기록되는, 점점 커지는 방의 기억과 같습니다. 만약 로가 동일한 물체를 다른 각도에서 보게 되면, 시스템은 새로운 혼란스러운 항목을 만드는 대신 형태를 더 정확하게 만들기 위해 기록을 업데이트합니다. 이를 통해 로봇은 처음에 지도나 방에 대한 사전 지식이 없더라도, 시간이 지남에 따라 공간에 대한 신뢰할 수 있는 이해를 구축할 수 있습니다. 연구진은 이 방법이 로봇이 매번 새로운 방이나 새로운 유형의 물체에 맞춰 재프로그래밍될 필요 없이, 방문한 적 없는 환경에서도 성공적으로 탐색할 수 있게 해준다는 것을 발견했습니다.

이 연구는 로봇이 세상과 상호작용하는 방식의 근본적인 변화를 강조합니다. 단일 인공지능 모델이 언어 이해부터 물리 법칙 계산까지 모든 것을 수행하도록 만드는 대신, 연구진은 각 부분이 가장 잘하는 일을 하도록 하는 팀을 구축했습니다. 인공지능은 창의성과 언어를 담당하고, 로봇의 센서는 정밀도와 움직임을 담당합니다. 이러한 직무 분리는 로봇이 확신에 찬 추측으로 인해 위험한 실수를 저지르는 것을 방지합니다. 챌린지의 결과는 이 방법이 단순한 이론적 아이디어가 아니라, 실제 시나리오에서 작동하는 실질적인 해결책임을 보여줍니다. 언어와 수학을 분리함으로써, 로봇은 단일 모델에 의존하는 시스템으로는 이전에는 불가능했던 수준의 정확도로 복잡한 지시를 따르고 물체를 찾을 수 있습니다. 이 연구는 로봇이 예측 불가능한 인간의 세계를 진정으로 항해하기 위해서는, 인공지능이 말로 안내하게 두되 어려운 숫자들에 대해서는 자신의 감각을 믿어야 한다는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →