VLN on the Fly: An Onboard Vision-Language Navigation Stack for Aerial Robots
이 논문은 높은 성공률과 안전성을 달성하면서도 낮은 계산 오버헤드를 유지하기 위해 그라운딩(grounding), 계획(planning), 제어(control)를 별도의 단계로 분리한 항공 로봇용 모듈형 온보드 시각-언어 내비게이션 스택인 "VLN on the Fly"를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
창고의 조용한 웅성거림이나 집안의 어수선한 구석 안에서, 새로운 종류의 로봇이 듣는 법을 배우고 있습니다. 수년 동안 과학자들은 기계가 인간의 언어를 이해하고 그에 따라 행동하도록 가르치기 위해 노력해 왔으며, 이 분야는 시각-언어 내비게이션(vision-language navigation)으로 알려져 있습니다. 아이디어는 간단합니다. 사람이 "빨간 의자로 가"라고 말하면, 로봇은 그 의자가 어디에 있는지 파악하여 그곳으로 날아가거나 이동하는 것입니다. 이것은 통제된 컴퓨터 시뮬레이션에서는 잘 작동하지만, 실제 비행 로봇에서 이를 구현하는 것은 다른 이야기입니다. 로봇은 자신의 컴퓨터와 배터리를 직접 싣고 있는 상태에서 세상을 보고, 말을 이해하며, 공중을 통해 안전한 경로를 계획하고, 모터를 제어해야 합니다. 만약 로봇이 단어를 이해하는 데 실수를 하거나 회전을 잘못 계산한다면, 추락할 수도 있습니다. 과제는 인간의 지속적인 감독 없이도 안전하게 비행할 수 있을 만큼 충분히 똑똑하면서도, 지시를 따를 수 있는 시스템을 구축하는 것입니다.
상파울루 대학교의 연구진은 이 문제를 해결하기 위해 "VLN on the Fly"라고 불리는 시스템을 구축했습니다. 하나의 거대한 컴퓨터 프로그램이 모든 것을 한꺼번에 수행하도록 가르치는 대신, 그들은 이 작업을 서로 협력하는 세 가지 명확한 단계로 나누었습니다. 이는 마치 계주 경기와 같습니다. 첫째, 특화된 언어 모델이 카메라 피드와 음성 명령을 살펴보고 대상 물체가 있을 법한 일반적인 영역을 찾습니다. 둘째, 계획 시스템이 그 일반적인 영역을 가져와 깊이(depth) 정보를 사용하여 공중을 통과하는 매끄럽고 안전한 3차원 경로를 계산합니다. 셋째, 훈련된 제어 정책이 그 경로를 받아 드론의 모터에 직접 명령을 내려 경로를 따르게 합니다. 이러한 단계별 접근 방식은 연구자들이 프로세스의 각 부분을 점검할 수 있게 해주며, 한 단계에서 실패하더라도 시스템이 정확히 어디에서 문제가 발생했는지 파악하여 충돌 전에 멈출 수 있도록 보장합니다.
연구진은 카메라와 소형 온보드 컴퓨터를 장착한 작은 쿼드 로터 드론으로 이 시스템을 테스트했습니다. 그들은 방 안에 쓰레기통, 의자, 소화기와 같은 일상적인 물건들을 배치하고 드론에게 음성 명령에 따라 그 물건들로 날아가도록 요청했습니다. 15번의 개별 비행 중 드론은 13번의 비행에서 목표물에 도달하는 데 성공했습니다. 도착했을 때, 드론은 평균적으로 의도한 지점에서 6센티미터 미만의 거리에 있었습니다. 이 시스템은 드론이 장애물을 피해 항행해야 할 때도 잘 작동했으며, 복잡한 환경에서 충돌을 피하는 경로를 성공적으로 계획했습니다. 전체 과정은 드론 자체에서 실행되었으며, 온보드 컴퓨터 전력의 약 39퍼센트를 사용하였기에 다른 작업을 수행할 수 있는 충분한 여유를 남겨두었습니다.
이 프로젝트의 가장 중요한 발견 중 하나는 시스템이 불확실성을 처리하는 방식이었습니다. 언어 모델은 오류가 발생하기 쉬운 방식인 대상의 정확한 픽셀을 특정하려고 하지 않습니다. 대신, 카메라 뷰를 단순한 그리드로 나누고 대상이 있을 가능성이 높은 일반적인 셀을 선택합니다. 이러한 거친(coarse) 접근 방식이 훨씬 더 신뢰할 수 있는 것으로 증명되었습니다. 드론이 장애물로 가득 찬 방에서 테스트되었을 때, 대부분의 시도에서 충돌을 성공적으로 피했습니다. 목표에 도달하지 못한 몇몇 경우에는 드론이 제어력을 잃은 것이 아니라, 물체가 카메라 시야에서 벗어났거나 깊이 센서가 충분히 멀리까지 감지하지 못했기 때문이었습니다. 또한 연구진은 시스템이 서로 다른 물체를 구별할 수 있다는 것을 발견했는데, 의자를 요청했을 때는 의자를, 쓰레기통을 요청했을 때는 쓰레기통을 동일한 방 안에 있더라도 정확히 식별해 냈습니다.
이 프로젝트의 성공은 자율 로봇이 구축되는 방식의 변화를 강조합니다. 모든 것을 한꺼번에 학습하려는 단일하고 복잡한 신경망에 의존하기보다, 이해, 계획, 제어의 과업을 분리하는 것이 더 안전하고 신뢰할 수 있는 결과를 낳는다는 것을 이 연구는 보여줍니다. 단계들을 별도로 유지함으로써, 연구진은 드론이 단순히 추측하는 것이 아니라, 말로 된 명령으로부터 물리적 움직임에 이르기까지 논리적인 경로를 실제로 따르고 있음을 검증할 수 있었습니다. 비록 물체를 찾기 위해 시야 확보가 필요하고 깊이 센서의 범위에 의존해야 하는 등의 한계는 여전히 존재하지만, 이 시스템은 비행 로봇이 곧 단순한 인간의 언어를 사용하여 복잡한 실내 공간을 항행할 수 있음을 보여주며, 점검, 배송, 수색 및 구조와 같은 미래 응용 분야를 위한 문을 열어주고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.