← 최신 논문
💻 computer science

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

이 논문은 음향적으로 풍부한 실내 환경에서 다중 목표 미션으로 에이전트에게 도전 과제를 부여하는 장기 시계 오디오-시각-언어 내비게이션을 위한 새로운 벤치마크인 LH-AVLN을 소개하며, 탐색을 위해 양이(binaural) 오디오를 효과적으로 활용하면서 목표 완수를 위해 시각-의미론적 검증에 의존하는 학습이 필요 없는 에이전트인 PAG-Nav를 제안한다.

원저자: Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

게시일 2026-07-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 궁극의 집 탐정(house detective)이 되는 법을 가르치고 있다고 상상해 보세요. 보통 우리는 로봇에게 움직이는 법을 가르칠 때, "빨간 공을 찾아라"와 같은 단순한 임무를 줍니다. 로봇은 카메라 눈으로 주변을 둘러보고, 자신이 지나온 곳을 기억하며, 물체를 발견할 때까지 걸어갑니다. 이 과학 분야는 로봇이 실제 세상을 돌아다니며 과제를 해결하는 방법을 배우는 "체화된 내비게이션(embodied navigation)"이라고 불립니다. 하지만 여기에는 함정이 있습니다. 대부분의 이러한 훈련 게임은 완전히 정적입니다. 로봇은 오직 자신의 렌즈 바로 앞에 보이는 것만 볼 수 있습니다. 만약 공이 닫힌 문 뒤에 있거나 어두운 구석에 숨겨져 있다면, 로봇은 눈앞의 상황 외에는 아무것도 볼 수 없는 '눈먼' 상태가 되어 갇혀버리게 됩니다.

이제 그 로봇에게 초능력을 준다고 상상해 보세요. 바로 '귀'입니다. 현실 세계에서 소리는 단순히 직선으로만 이동하지 않습니다. 소리는 모퉁이를 돌아 흐르고 틈새로 스며듭니다. 좋은 귀를 가진 로봇은 옆 방에서 짖는 개 소리나 벽 너머에서 물이 떨어지는 수도꼭지 소리를 들을 수 있고, 이는 물체를 아직 보지 못했을 때도 어디로 가야 할지에 대한 힌트를 줄 수 있습니다. 이 논문은 이 두 가지 초능력—보는 것과 듣는 것—을 결합하되, 미션을 훨씬 더 어렵게 만든다면 어떤 일이 벌어질지라는 매우 까다로운 질문을 던집니다. 단 하나의 물건을 찾는 대신, 만약 로봇이 단어로 설명된 것, 사진으로 된 것, 그리고 이름만 있는 것 등 다양한 목록을 찾아야 하며, 퍼즐을 푸는 동안 집 안의 소리가 계속해서 변한다면 어떨까요?

이 연구를 이끄는 홍콩 과학기술대학교와 길림대학교의 천루펑(Rufeng Chen)과 동료들은 LH-AVLN이라는 새로운 도전 과제를 구축했습니다. 이것을 로봇을 위한 고난도의 멀티 레벨 비디오 게임이라고 생각하면 됩니다. 이 게임에서 로봇은 3D 집 안에 투입되며 두 개에서 네 개의 서로 다른 목표가 포함된 "글로벌 미션"을 부여받습니다. 이 목표들은 까다롭습니다. 하나는 "소파를 찾아라"(카테고리)일 수 있고, 다른 하나는 "얇은 커튼 옆에 있는 밝은 회색 소파를 찾아라"(설명)일 수 있으며, 세 번째는 "이 특정 침대 사진을 찾아라"(이미지 참조)일 수 있습니다.

하지만 진짜 반전은 소리에 있습니다. 이 게임에서는 로봇이 찾고 있는 모든 물건이 소리를 냅니다. 그러나 여기서 주의할 점은, 이 소리들이 고정된 타겟이 아니라는 것입니다. 로봇이 하나의 목표를 찾아 완료할 때마다 그 물건의 소리는 멈춥니다. 반면에 아직 찾지 못한 물건들은 여전히 소리를 내며, 번갈아 가며 가장 크게 들리도록 합니다. 이는 혼란스러운 상황을 만듭니다. 만약 로봇이 소파를 찾고 있는데 변기 물 내려가는 소리가 들린다면(변기를 아직 찾지 못했기 때문에), 그 소리는 방해 요소가 됩니다. 로봇은 다음과 같이 판단해야 합니다. "이 소리가 나의 현재 목표를 찾는 데 도움이 되는 것인가, 아니면 내가 아직 완료하지 못한 다른 작업으로 나를 유인하는 레드 헤링(red herring, 엉뚱한 단서)인가?"

이를 테스트하기 위해 저자들은 로봇이 시끄럽고 다중 목표가 있는 미션을 수행해야 하는 15만 개 이상의 에피소드를 담은 거대한 데이터셋을 만들었습니다. 그들은 기존의 로봇들, 즉 지시 사항을 잘 따르거나 시각적 지도를 잘 기억하는 똑똑한 로봇들조차 처참하게 고전한다는 것을 발견했습니다. 소리가 혼란스러워지거나 미션이 길어지면, 이 로봇들은 길을 잃거나 포기해 버립니다. 이들은 도움이 되는 단서와 방해되는 소음을 구분하지 못합니다.

이것이 얼마나 어려운지 보여주기 위해, 팀은 자신들만의 로봇 에이전트인 PAG-Nav를 구축했습니다. 이 로봇은 복잡한 훈련을 통해 배우는 대신 영리한 전략을 사용합니다. 로봇은 집 전체의 정신적 지도를 유지하며, 자신이 어디를 지나왔는지, 무엇을 보았는지, 그리고 소리가 어디서 오는지 추적합니다. 로봇은 시각적으로 아무것도 볼 수 없을 때 소리를 사용하여 탐색을 안내하지만, 그것이 정말 맞는 물건인지 확인하기 위해 확실하고 선명하게 관찰하기 전까지는 "찾았다!"라고 말하기를 거부합니다. 이러한 스마트한 전략에도 불구하고, 이 로봇은 순서가 있는 미션에서는 약 23%, 순서가 없는 미션에서는 약 35%의 성공률만을 보였습니다.

이 논문의 주요 발견은 소리를 추가하는 것이 현재의 기술에 있어 문제를 더 쉽게 만드는 것이 아니라 훨씬 더 어렵게 만든다는 것입니다. 저자들은 소리가 보이지 않는 곳에 있는 물건을 찾는 강력한 도구이지만, 로봇이 어떤 소리가 어떤 작업에 속하는지 파악하지 못한다면 악몽이 될 수 있다고 주장합니다. 그들은 미래의 로봇 내비게이션이 단순히 더 잘 보고 더 잘 듣는 것이 아니라, 소음을 무시하고 적절한 시기에 적절한 단서에 집중하는 법을 배우는 것에 달려 있다고 주장합니다. 논문은 우리가 이 퍼즐을 풀기에는 아직 멀었으며, 이는 소음이 많은 다중 작업의 세계를 진정으로 항해할 수 있는 로봇을 만들 수 있는 미래의 발명가들에게 많은 기회를 남겨두고 있다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →