← 최신 논문
💻 computer science

Joint On-and-Off Policy Learning for Vision-and-Language Navigation

이 논문은 시각-언어 내비게이션 벤치마크에서 최첨단 성능을 달ことを 위해 오프-폴리시 모방 학습과 온-폴리시 탐색을 3단계 훈련 파이프라인을 통해 시너지 효과를 내도록 통합한 새로운 프레임워크인 JOP-VLN을 소개한다.

원저자: Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin

게시일 2026-07-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 당신의 개인 투어 가이드가 되도록 가르치고 있다고 상상해 보세요. 당신은 "주방으로 걸어가서, 파란 화병에서 왼쪽으로 꺾은 다음, 냉장고 앞에 멈춰 서"와 같은 음성 명령을 내리고, 로봇이 벽에 부딪히거나 길을 잃지 않고 실제로 그 동작을 수행하기를 원합니다. 이것이 바로 **시각-언어 내비게이션(Vision-and-Language Navigation, VLN)**의 세계입니다. 이는 '체화된 에이전트'(몸체와 눈을 가진 로봇)가 카메라를 통해 복잡한 현실 세계를 이해하고, 인간의 말을 이해하여 움직여야 하는 로봇 공학의 한 분야입니다.

여기에는 큰 난관이 있습니다. 로봇은 자신의 실수로부터 배우는 데 매우 서툽니다. 만약 당신이 로봇에게 걷는 법에 대한 완벽한 영상들을 보여주며 가르친다면, 로봇은 그 영상들을 그대로 모방하는 법을 배울 것입니다. 하지만 막상 새로운 방에 들어서거나 의자가 다른 위치에 있는 것을 보게 되면, 로로봇은 무언가 잘못되었을 때 어떻게 회복해야 하는지를 배우지 못했기 때문에 당황하게 됩니다. 이는 마치 연습 문제의 정답을 암기했지만, 선생님이 숫자를 바꾸자 얼어붙어 버리는 학생과 같습니다. 이를 해결하기 위해 과학자들은 보통 두 가지 다른 방법을 시도합니다. 즉, 로봇에게 완벽한 경로의 예시를 더 많이 보여주거나(모방 학습, Imitation Learning), 로봇이 스스로 돌아다니게 하면서 목표에 가까워질 때마다 "간식"(보상)을 주는 방식(강화 학습, Reinforcement Learning)입니다. 오랫동안 이 두 방법은 서로 대화조차 나누지 않는 별개의 학교처럼 분리되어 있었습니다.

여기에, 이 두 학교를 위한 합동 파티를 열기로 결정한 새로운 프레임워크인 JOP-VLN이 등장했습니다. 연구진은 전문가를 따라 하는 안전함과 스스로 탐험하는 용기를 결합하여, 로봇을 세 단계로 가르치는 시스템을 구축했습니다. 이것은 마치 로봇이 먼저 마스터 코치로부터 기초를 배우고, 그다음에는 넘어졌을 때 잡아주는 안전망이 있는 "보조 바퀴" 버전의 세상에서 연습하며, 마지막으로 야생으로 나가 탐험하되 특별한 규칙을 따르는 훈련 캠프와 같습니다. 즉, 자신이 혼란스러웠던 순간이나 실수를 저질렀던 순간에만 집중하여 더 똑똑해지는 방식입니다.

이 논문은 로봇이 새로운 상황을 맞닥뜨렸을 때 갇혀버리는 문제를 해결하기 위해 이 3단계 파이프라인을 소개합니다. 첫 번째 단계에서 로봇은 알파벳을 배우고 문장을 쓰는 법을 배우는 학생처럼, 기본적인 내비게이션 기술과 자신이 보는 것을 요약하는 법을 배웁니다. 두 번째 단계에서 로봇은 내비게이션을 시도하며, 경로에서 벗어나기 시작할 때마다 "신의 모드(god-mode)" 안전 시스템(오라클)이 개입하여 경로를 바로잡아 줍니다. 로봇은 이렇게 교정된 경로로부터 학습하며, 효과적으로 실수로부터 회복하는 법을 연습합니다. 이것이 로봇 자신의 시도와 안전망의 교정이 혼합된 데이터로부터 학습하는 "오프 폴리시(off-policy)" 부분입니다.

마법은 세 번째 단계에서 일어납니다. 연구진은 로봇을 무작위로 탐색하게 내버려 두면, 로봇이 제자리에서 뱅뱅 돌거나 나쁜 습관에 너무 확신을 가질 수 있다는 점을 깨달았습니다. 그래서 그들은 영리한 필터를 추가했습니다. 로봇이 정말로 불확실하거나 "엔트로피가 높은(high-entropy)" 상황(쉽게 말해 무작정 추측하고 있는 상태)에서만 학습하도록 제한한 것입니다. 이는 로봇이 이미 알고 있는 쉬운 작업에 시간을 낭비하는 것을 방지하고, 어려운 과제에 집중하도록 강제합니다. 또한, 연구진은 로봇이 이전에 실패했던 특정 경로를 가장 많이 연습하도록 데이터를 분류하여, 스스로의 실수를 바로잡는 법을 확실히 배우게 했습니다.

결과는 인상적입니다. J-OP-VLN은 표준 내비게이션 벤치마크 테스트에서 R2R 데이터셋에서 69.9%, RxR 데이터셋에서 **68.0%**의 성공률을 달관했습니다. 이 수치들은 이전의 단일 학습 방식들을 능가하는 새로운 최첨단(state-of-the-art) 성능을 의미합니다. 연구진은 또한 네 발 달린 로봇 개를 사용하여 실내 사무실과 실외 정원이라는 실제 환경에서도 테스트를 진행했습니다. 조명과 질감이 복잡한 실제 환경에서도 로봇은 복잡한 지시를 수행할 수 있었으며, 이는 이 "결합된" 학습 방식이 이전보다 더 나은 일반화 능력을 갖추고 있음을 증명했습니다. 이 논문은 전문가의 지도와 스마트한 오류 중심 탐색을 신중하게 혼합함으로써, 단순히 규칙을 잘 따르는 것을 넘어 실제 세계의 예상치 못한 변화에도 회복 탄력성을 갖춘 로봇을 만들 수 있다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →