AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness
AgenticNav는 VLM-환경 상호작용을 도구 호출 하네스로 재구상하여, 학습된 웨이포인트 예측기 없이도 최첨단 성능을 달성하기 위해 직접적인 픽셀 기반 행동 선택, 온디맨드 깊이 쿼리, 그리고 선택적 메모리 검색을 가능하게 하는 경량화된 제로샷 시각-언어 내비게이션 프레임워크를 도입합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 새로운 집을 탐색하는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 "주방으로 가서, 오른쪽으로 꺾은 뒤, 소파 옆에 멈춰라"라는 간단한 명령을 내립니다. 이것이 바로 **시각-언어 탐색(Vision-and-Language Navigation, VLN)**의 세계입니다. 이는 에이전트가 한 번도 본 적 없는 3D 공간을 이동하기 위해 인간의 음성과 시각적 단서를 이해해야 하는 로봇 공학의 한 분야입니다. 오랫동안 로봇은 움직이는 법을 배우기 위해 수천 채의 특정 집들을 학습해야 했으며, 이는 로봇을 다른 건물로 데려갔을 때 길을 잃게 만드는 원인이 되었습니다. 하지만 최근 우리는 "대규모 시각-언어 모델(Large Vision-Language Models, VLMs)"을 개발했습니다. 이들은 매번 새로운 작업을 위해 재학습할 필요 없이 이미 사진과 단어를 이해할 수 있는 매우 똑똑한 AI 두뇌입니다. 과학자들의 큰 과제는 이것입니다: 어떻게 이 똑똑한 두뇌를 로봇의 다리에 연결할 것인가? AI가 복잡하고 연속적인 현실 세계에서 혼란을 겪지 않고 정확히 어디로 발을 내디딜지 어떻게 결정하게 할 것인가?
여기서 AgenticNav라는 논문이 등장합니다. 저자들은 기존의 AI와 로봇을 연결하는 방식이 운전자에게 단 세 개의 미리 그려진 도로 중 하나를 선택하도록 하는 지도와 같다고 주장합니다. 만약 목적지가 그 세 개의 도로 중 하나에 없다면 운전자는 꼼짝달싹 못 하게 됩니다. 새로운 방법인 AgenticNav는 게임의 판도를 완전히 바꿉니다. AI에게 제한된 목록의 승인된 움직임을 고르도록 강요하는 대신, AI가 필요할 때마다 호출할 수 있는 일련의 "도구"를 제공합니다. AI를 추리 게임 속의 탐정이라고 생각해 보세요. 게임이 탐정에게 "왼쪽으로 가기", "오른쪽으로 가기", 또는 "직진하기" 중 하나를 선택하도록 강요하는 대신, 이제 탐정은 "저 벽의 특정 픽셀의 깊이를 확인해야겠다", "내가 지나온 경로의 지도를 보여줘", 또는 "내가 보고 있는 저 의지로 직접 걸어가고 싶다"라고 말할 수 있습니다.
이 논문은 "하네스(harness)" 또는 제어판 역할을 하는 AgenticNav라는 시스템을 소개합니다. 연구진은 AI에게 세 가지 특정 도구를 제공함으로써, 추가 학습 없이도 AI가 이전에 보지 못한 환경을 훨씬 더 잘 탐색할 수 있다는 것을 발견했습니다. 첫 번째 도구는 **액션 도구(Action Tool)**입니다. 제안된 몇몇 지점 중에서 선택하는 대신, AI는 카메라 시야의 어떤 픽셀이든 직접 가리키며 "거기로 가"라고 말할 수 있습니다. 그러면 시스템은 그 픽셀을 안전한 보행 경로로 바꾸기 위한 수학적 계산을 수행합니다. 두 번째 도구는 **깊이 도구(Depth Tool)**입니다. 때때로 AI는 어떤 물체가 얼마나 멀리 떨어져 있는지 정확히 알아야 합니다. AI에게 거대하고 혼란스러운 3D 깊이 지도를 보여주는 대신, 이 도구는 AI가 "이 특정 지점의 벽까지의 거리는 얼마인가?"라고 묻고 정밀한 수치를 얻을 수 있게 해줍니다. 세 번째 도구는 **메모리 도구(Memory Tool)**입니다. 로봇이 이동함에 따라 압축된 지도를 구축합니다. 만약 로봇이 혼란에 빠지거나 이전에 보았던 표지판을 기억해야 한다면, 전체 여정의 모든 프레임을 기억하려고 애쓰며 뇌에 과부하를 주는 대신, 시스템에 특정 순간을 "회상"해 달라고 요청할 수 있습니다.
저자들은 Habitat 시뮬레이터를 사용한 R2R-CE 컴퓨터 시뮬레이션과 실제 로봇을 통해 이 시스템을 테스트했습니다. 실제 환경 검증에는 실험실, 사무실, 야외 마당 장면을 아우르는 30개의 특정 에피소드가 포함되었으며, 표지판 읽기, 장거리 탐색, 정밀한 목표 도착과 같은 과업을 강조했습니다. 연구 결과, 강력한 AI 두뇌(GPT-5.5)를 사용할 때 이 새로운 방법은 목표 도달에 있어 55%의 성공률을 기록했으며, 이는 이전의 최고 방법이었던 SmartWay가 기록한 **44%**에서 크게 향상된 수치입니다. 효율성 측면(성공과 짧은 경로 사이의 균형)에서도 **35.04%**에서 **48.41%**로 개선되었습니다. 논문은 병목 현상이 단순히 AI 두뇌의 지능 문제가 아니라, 우리가 AI에게 세상을 상호작용할 도구를 얼마나 잘 제공하느냐에 달려 있다고 시사합니다. AI가 스스로 목표를 정하고 특정 정보를 요청할 수 있게 함으로써, AI는 한 번도 방문하지 않은 곳에서도 훨씬 더 능숙하게 탐색할 수 있게 됩니다. 연구진은 또한 이 접근 방식이 다양한 유형의 AI 두뇌와 잘 작동한다는 점을 언급하며, 이러한 "도구 호출(tool-calling)" 방식이 우리가 복잡한 세상을 진정으로 이해하고 움직이는 로봇을 만들기 위한 유망한 방향임을 시사했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.