← 최신 논문
💻 computer science

HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness

HarnessVLN은 에이전트 하네스(Agent Harness)를 사용하여 구조화된 도구 인터페이스를 통해 인지, 기억 및 행동 검증을 조정함으로써 체화된 내비게이션(embodied navigation)을 통합하고, 작업별 학습 없이도 여러 벤치마크에서 최첨단 성능을 달래는 제로샷, 트레이닝 프리(training-free) 프레임워크를 도입합니다.

원저자: Yang Chen, Lirong Che, Zhenyu Huang, Wenbo Fu, Chuang Wang, Xu Cao, Daqi Liu, Yuzhe Yang, Jian Su, Lan-Zhe Guo

게시일 2026-09-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yang Chen, Lirong Che, Zhenyu Huang, Wenbo Fu, Chuang Wang, Xu Cao, Daqi Liu, Yuzhe Yang, Jian Su, Lan-Zhe Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

스스로 세상을 움직일 수 있는 로봇은 오랫동안 공상 과학의 꿈이었지만, 엔지니어들에게 그것은 훨씬 더 실질적인 도전 과제입니다. 로봇이 길을 찾기 위해서는 세 가지 일을 동시에 수행해야 합니다: 자신이 보는 것을 이해하고, 자신이 어디에 있었는지 기억하며, 다음에 무엇을 할지 결정하는 것입니다. 수년 동안 연구자들은 로봇에게 성공적인 여정의 사례를 수천 개 보여주며 기계가 그 패턴을 학습하기를 바랐습니다. 그러나 이러한 방식은 로봇이 새로운 방에 마주하거나 약간 다른 지시를 받았을 때 종종 실패하곤 했습니다. 최근의 아이디어는 로봇에게 이야기를 쓰거나 질문에 답할 수 있는 거대 인공지능 모델과 유사한 강력한 언어 뇌를 부여하는 것이었습니다. 희망 사항은 이러한 모델들이 특정 훈련 없이도 건물 안을 추론하며 나아갈 수 있다는 것이었습니다. 하지만 간극은 여전히 존재했습니다. 이러한 모델들은 계획에 대해 말할 수는 있었지만, 그 계획이 실제로 물리적 세계에서 가능한지 확인하는 데 어려움을 겪어 혼란에 빠지거나 갇히는 일이 빈번했습니다.

한 연구팀은 이 간극을 메우는 'HarnessVLN'이라는 새로운 시스템을 선보였습니다. 단일 모델이 모든 것을 수행하도록 하는 대신, 그들은 로봇의 뇌를 엄격하게 감독하는 중앙 관리자, 즉 '하네스(harness)'를 구축했습니다. 이 관리자는 로봇이 단순히 추측하게 두지 않습니다. 대신 로봇이 보고 기억하는 실제 정보와 대조하여 제안된 모든 움직임을 끊임없이 점검합니다. 이 시스템은 복잡한 디지털 환경과 실제 크기의 휴머노이드 로봇에서 테스트되었습니다. 이 테스트에서 로봇은 구체적인 사물을 찾거나 특정 위치에 도달하라는 상세한 언어 지시를 성공적으로 수행했으며, 특정 작업에 대한 별도의 훈련이 필요하지 않은 기존 방식들을 뛰어넘는 성공률을 달enc했습니다. 핵심적인 발견은 로봇이 움직이기 전에 목표물이 가시적이고 도달 가능한지를 증명해야 하는 '검증 단계'를 추가함으로써, 순수한 추측만으로는 도달할 수 없는 신뢰성을 가지고 낯선 공간을 탐색할 수 있다는 점입니다.

이 새로운 접근 방식의 핵심은 로봇이 다양한 유형의 내비게이션 작업을 처리할 수 있는 통일된 방법을 가져야 한다는 아이디어입니다. 목표가 "주방으로 가서 오른쪽으로 돌아라"이든, 단순히 "식기세척기를 찾아라"이든, 로봇은 동일한 근본적인 문제에 직면합니다. 바로 단어를 물리적 공간과 연결해야 한다는 것입니다. 연구진은 중앙 컨트롤러인 '하네스'가 로봇의 모든 도구를 조정하는 프레임워크를 설계했습니다. 여기에는 이미지를 포착하는 로봇의 눈, 본 것을 저장하는 기억, 그리고 로봇을 앞으로 움직이게 하는 다리가 포함됩니다. 로봇의 언어 뇌가 움직임을 제안하면, 하네스는 이를 검증하기 위해 동작을 일시 중단합니다. 하네스는 다음과 같이 묻습니다. "이에 대한 증거가 있는가? 경로가 확보되었는가? 이것이 현재의 목표와 일치하는가?" 만약 대답이 '아니오'라면, 로봇은 맹목적으로 움직이지 않고 다시 고려하거나 더 많은 정보를 찾도록 보내집니다.

이 검증 과정은 두 가지 서로 다른 유형의 메모리가 함께 작동하는 것에 의존합니다. 첫 번째는 로봇의 즉각적인 이력, 즉 완료한 하위 목표와 최근에 실패한 지점 등을 추적하는 '사건 기록'입니다. 두 번째는 로봇이 방문한 장소와 관찰한 사물, 그리고 관찰 시간과 위치를 기록하는 '환경의 지속적인 지도'입니다. 이 지도는 로봇이 신선한 정보와 오래되어 쓸모없어진 아이디어를 구분할 수 있게 해줍니다. 예를 들어, 로봇이 이전에 문을 통과하려다 잠겨 있는 것을 발견했다면, 이 시스템은 그 실패를 기억하여 로봇이 동일한 불가능한 경로를 다시 시도하지 않도록 방지합니다. 로봇의 추론과 물리적 행동 사이를 명확히 분리함으로써, 시스템은 모든 단계가 현실에 기반하도록 보장합니다.

연구진은 이 시스템을 네 가지 벤치마크, 즉 내비게이션 기술을 측정하는 데 사용되는 표준 과제 세트에서 테스트했습니다. 로봇이 말로 설명된 경로를 따라가야 하는 테스트에서, 한 주요 테스트에서는 60.8%, 다른 테스트에서는 53.9%의 성공률을 기록했습니다. 과제가 의자나 침대 같은 특정 사물을 찾는 것이었을 때, 시스템은 한 환경에서 76.0%, 다른 환경에서 59.3%의 성공률을 보였습니다. 이 수치들은 특정 훈련 데이터를 사용하지 않는 다른 방법들에 비해 유의미한 개선을 나타냅니다. 연구진은 시스템이 언어 모델의 확신만을 신뢰하는 것이 아니라, 행동을 실행하기 전에 목표가 도달 가능하다는 물리적 증거를 요구했기 때문에 더 나은 성능을 보였다고 언급했습니다.

이 시스템이 컴퓨터 시뮬레이션 외부에서도 작동함을 증명하기 위해, 팀은 1.74미터 높이의 실제 휴머노이드 로봇에 이를 배치했습니다. 카메라와 센서를 갖춘 이 로봇은 실제 건물을 탐색하는 임무를 맡았습니다 교차로로 가서 왼쪽으로 돌고, 정수기 근처의 쓰레기통 앞에서 멈춘 다음 냉장고를 찾으라는 지시를 받았습니다. 또 다른 실험에서는 빨간색 소화기를 찾아야 했는데, 로봇은 그것이 정확히 어떻게 생겼는지 미리 알지 못했습니다. 로봇은 동일한 하네스 시스템을 사용하여 각 단계에서 시각적 증거를 확인하며 작업을 관리했습니다. 로봇은 실제로 본 것을 바탕으로 진행 상황을 추적하고, 랜드마크를 식별하며, 정지 지점을 검증하는 데 성공했습니다. 동일한 소프트웨어가 복잡한 경로를 안내하고, 이후 미지의 물체를 검색하는 과정에서 재프로그래밍 없이도 작동했다는 사실은 이 접근 방식의 유연성을 입증했습니다.

HarnessVLN의 성공은 로봇 내비게이션의 미래가 기계에게 가능한 모든 경로를 가르치는 것이 아니라, 자신의 작업을 스스로 점검할 수 있는 신뢰할 수 있는 방법을 주는 데 있을 수 있음을 시사합니다. 로봇의 행동을 하나의 연속적인 추측이 아닌, 검증된 단계들의 연속으로 취급함으로써 시스템은 길을 잃거나 실수를 반복하는 흔한 함정을 피합니다. 연구진은 강력한 언어 플래너와 엄격하고 증거 기반인 관리자의 결합을 통해 로봇이 한 번도 본 적 없는 과제를 처리할 수 있음을 발견했습니다. 비록 시스템이 메모리를 확인하고 업데이트하는 방식에 있어 사전 정의된 규칙에 여전히 의존하고 있지만, 결과는 이러한 조정 방식이 인간의 세상에서 실제로 움직이고 작업할 수 있는 로봇을 향한 실질적인 단계임을 보여줍니다. 이 프로젝트는 계속 발전할 수 있도록 열려 있으며, 연구팀은 개방된 환경에서의 상호작용을 통해 시스템이 더욱 학습하고 적응할 수 있는 방법을 탐구할 계획입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →