← 최신 논문
🤖 AI

UESF-Bench: Benchmarking and Probing for Unified Embodied Seeking and Following

이 논문은 에이전트가 언어로 묘사된 대상을 먼저 찾아낸 후 지속적으로 추적하도록 요구함으로써 기존 평가 방식의 한계를 해결하는 통합된 체화된 인간 탐색 및 추적을 위한 대규모 벤치마크인 UESF-Bench를 소개하며, 이 두 단계 사이의 전환을 효과적으로 관리하기 위한 SeekFollow-VLA 프레임워크를 제안한다.

원저자: Kun Yu, Jianhua Yang, Yixiang Chen, Changwei Wang, Hongyuan Yu, Yan Huang, Fushuo Huo, Ya Jing, Zhumin Chen, Keji He

게시일 2026-07-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kun Yu, Jianhua Yang, Yixiang Chen, Changwei Wang, Hongyuan Yu, Yan Huang, Fushuo Huo, Ya Jing, Zhumin Chen, Keji He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 궁극의 조수가 되는 법을 가르치고 있다고 상상해 보세요. 로봇 공학의 세계에는 단순히 "보는 것"과 "이해하는 것" 사이에는 큰 차이가 있습니다. 로봇이 진정으로 도움이 되기 위해서는, 단순히 화면을 응시하는 것이 아니라 실제 세상을 돌아다니며 움직일 수 있는 몸 안에 깃든 뇌, 즉 **Embodied AI(체화된 인공지능)**가 필요합니다. 또한 로봇은 Vision-Language-Action(시각-언어-행동) 기술, 즉 일어나는 일을 보고, 당신의 말을 듣고, 그에 따라 무언가를 하기 위해 물리적으로 움직여야 한다는 것을 배워야 합니다. 이것을 "빨간 재킷을 입은 남자를 찾아라"라는 단서를 듣고, 집 안을 뛰어다니며 그를 찾은 다음, 그와 부딪히지 않고 근처에 바짝 붙어 있어야 하는 숨바꼭질 게임이라고 생각해 보세요. 이것이 왜 중요할까요? 왜냐бо 실제 생활에서 사람들은 항상 로봇 바로 앞에 서서 따라오기를 기다려주지 않기 때문입니다. 종종 사람들은 다른 방에 숨어 있거나, 로봇이 그들을 놓칠 수도 있습니다. 만약 로봇이 이미 눈에 보이는 사람만을 따라갈 수 있다면, 그것은 별로 유용하지 않습니다. 로봇은 먼저 그들을 찾아내기 위해 추적해야 하며, 그 후에 추적 모드로 전환하여, 심지어 붐비는 방 안에서도 누가 누구인지 파악하며 따라가야 합니다.

이 논문은 정확히 그 문제를 해결하기 위한 새로운 도전 과제와 솔루션을 소개합니다. 다양한 대학과 기업의 연구진으로 구성된 저자들은 기존의 로봇 추적 테스트들이 너무 쉽다는 점을 깨달았습니다. 기존 테스트들은 대상 인물이 처음부터 눈앞에 보이고 있다는 것을 가정했습니다. 그들은 이것이 가장 중요한 부분인 '탐색(search)'을 놓치고 있다고 주장합니다. 이를 해결하기 위해 그들은 UESF-Bench(Unified Embodied Seeking and Following Benchmark)라는 거대한 새로운 놀이터를 만들었습니다. 이것은 143만 개 이상의 서로 다른 시나리오, 4,800개 이상의 고유한 디지털 인물, 그리고 770개 이상의 서로 다른 환경을 특징으로 하는 거대한 비디오 게임 레벨과 같습니다. 이 벤치마크에서 로봇은 "주방에 있는 갈색 머리의 키 작은 남자를 찾아 따라가라"와 같은 단일 지시를 받으며, 두 가지 일을 수행해야 합니다. 첫째, 대상이 보이지 않을 때 능동적으로 탐색해야 하고, 둘째, 일단 찾고 나면 그가 다시 군중 속에서 사라지더라도 매끄럽게 추적으로 전환해야 합니다.

연구진은 로봇에게 단순히 "두 가지를 모두 하라"고 말하는 것만으로는 충분하지 않으며, 로봇이 혼란을 겪는다는 것을 발견했습니다. 그들은 로봇의 뇌를 구축하는 세 가지 방법을 테스트했습니다. 첫 번째는 "Single Head(단일 헤드)" 방식으로, 로봇이 탐색과 추적 모두에 하나의 뇌를 사용하도록 하는 것입니다. 두 번째는 기본적인 스위치가 있는 "Dual Head(이중 헤드)" 방식입니다. 세 번째는 더 똑똑한 시스템인 "Task-Driven Router(작업 주도형 라우터)"로, 이는 교통 경찰처럼 작동하여 로봇이 무엇을 보느냐에 따라 언제 탐색을 멈추고 추적을 시작할지를 명시적으로 알려줍니다. 결과는 "Single Head" 방식이 처참했다는 것을 보여주었는데, 단일 인물 테스트에서 성공률이 단 **4%**에 불과했습니다. 기본적인 "Dual Head"조차도 **5%**에 머물며 고전했습니다. 그러나 "Task-Driven Router"(그들이 SeekFollow-VLA라고 부르는 것)는 게임 체인저였습니다. 단일 인물 테스트에서 **35%**의 성공률을 보였으며, 가짜 사람들이 로봇을 속이기 위해 숨어 있는 훨씬 어려운 다인(multi-person) 테스트에서도 여전히 **20%**의 성공률을 기록하며 다른 방식들을 압도했습니다.

이 논문은 성공의 열쇠가 단순히 더 좋은 카메라나 더 빠른 뇌를 갖는 것이 아니라, 작업이 '사냥'에서 '호위'로 바뀌었음을 아는 명확한 내부 신호를 갖는 데 있다고 제안합니다. 연구진은 그들의 스마트한 라우터가 마치 탐정처럼 행동하여 높은 강도로 방을 스캔하다가, 적절한 사람을 발견하는 즉시 충직한 경호원 모드로 전환하는 법을 배운다는 것을 보여주었습니다. 또한 그들은 이 새로운 방법이 찾고 따르는 데는 훨씬 뛰어나지만, 붐비는 방 안에서 물건에 조금 더 자주 부딪힌다는 점도 언급했는데, 이는 훌륭한 사냥꾼이 되는 것이 때로는 조금 서투르게 만들 수 있음을 시사합니다. 궁극적으로, 이 논문은 우리가 우리를 진정으로 도울 수 있는 로봇을 만들기 위해서는, 정적이고 쉬운 과제를 테스트하는 것을 넘어, 누군가가 숨어 있는 것을 찾고 혼돈 속에서도 그 곁을 지키는 복잡하고 혼란스러운 현실에 도전해야 한다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →