← 최신 논문
💻 computer science

Retrospective Open-Vocabulary Memory for Long-Term Object Search

이 논문은 탐지 기회를 추론하고 검색 효율성을 향상시키기 위해 회고적 개방형 어휘 메모리(retrospective open-vocabulary memory)를 활용하는 장기 객체 탐색 방법인 ECROM을 소개하며, 이는 기존 메모리 시스템보다 상당한 성능 향상을 보여주는 새로운 벤치마크를 통해 검증되었습니다.

원저자: Jiaming Wang, Zhiwei Xue, Chen Jizhuo, Peng Shiqi, Harold Soh

게시일 2026-10-05
📖 5 분 읽기🧠 심층 분석

원저자: Jiaming Wang, Zhiwei Xue, Chen Jizhuo, Peng Shiqi, Harold Soh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

세상을 움직이며 돌아다니는 로봇들은 보는 능력은 점점 좋아지고 있지만, 사물이 보통 어디에 있는지 기억하는 데에는 여전히 서툽니다. 로봇이 여러 번 방문했던 집에서 잃어버린 열쇠 한 세트를 찾는 임무를 맡았다고 상상해 보십시오. 만약 로봇이 열쇠를 마지막으로 본 아주 최근의 순간만을 기억한다면, 만약 어제 열쇠가 옮겨졌을 경우 엉뚱한 곳을 찾게 될 수도 있습니다. 만약 로봇이 특정 장소에서 열쇠를 본 횟수만을 단순히 센다면, 자신의 운 나쁜 경험에 속아 넘어갈 수도 있습니다. 예를 들어, 로봇이 주방 식탁 옆을 백 번 지나갔지만 정작 식탁을 내려다보지는 않았는데, 거실 소파는 단 한 번 스치듯 지나가며 열쇠를 발견했을 수도 있습니다. 단순한 횟수 계산은 로봇이 실제로는 식탁이 열쇠가 가장 자주 머무는 곳임에도 불구하고, 소파가 가장 좋은 탐색 장소라고 생각하게 만들 수 있습니다. 이것이 바로 장기 객체 탐색(long-term object search)의 핵심 문제입니다. 즉, 물체가 실제로 존재하는 곳과 로봇이 우연히 보게 된 곳을 구분하는 것입니다.

이를 해결하기 위해 싱가포르 국립대학교의 연구진은 로봇이 환경에 대한 기억을 구축하는 새로운 방법을 개발했습니다. 그들은 이 시스템을 ECROM, 즉 노출 보정 회고적 오픈 보캐블러리 메모리(Exposure-Calibrated Retrospective Open-Vocabulary Memory)라고 부릅니다. 연구팀은 10개의 서로 다른 디지털 홈을 배경으로 통제된 시뮬레이션 시리즈를 통해 이 시스템을 테스트했습니다. 이 과정에서 물체들은 숨겨진 패턴에 따라 이동되었고, 로봇의 경로는 어떤 표면은 자주 보이고 어떤 표면은 드물게 보이도록 의도적으로 다양하게 설정되었습니다. 연구진은 로봇이 본 것을 해당 표면을 실제로 볼 기회가 얼마나 있었는지와 대조하여 신중하게 가중치를 부여함으로써, 로봇이 물체의 진정한 습성을 학습할 수 있다는 것을 발견했습니다. 이전에 찾아보라고 지시받지 않은 물체를 찾아달라는 요청을 받았을 때, 이 새로운 메모리 시스템은 이전 방식들보다 훨씬 더 빠르고 안정적으로 목표물을 찾도록 도왔습니다.

연구진이 다룬 과제는 로봇이 움직이는 현실의 무질서함에 뿌리를 두고 있습니다. 실제 가정에서 로봇은 모든 방의 모든 인치를 완벽하게 선명하게 스캔하며 지나가지 않습니다. 로봇은 천장을 보면서 주방을 지나갈 수도 있고, 의자에 의해 일부가 가려진 식탁 옆을 지나갈 수도 있습니다. 만약 로로봇이 테이블 위의 '밀짚모자'를 감지한 횟수를 아일랜드 식탁(island)에 대한 감지와 단순히 비교한다면, 만약 로봇이 아일랜드 식탁 쪽을 더 오래 보았다면 답을 틀릴 수 있습니다. 모자가 테이블 위에 절반의 시간 동안 놓여 있었더라도, 로봇이 아일랜드 식탁만 계속 바라봤다면 단순한 횟수 계산은 아일랜드 식탁이 모자의 집이라고 제안할 것입니다. 연구진은 물체가 보통 발생하는 위치를 배우기 위해서는, 물체의 존재에 대한 증거와 그것을 볼 수 있었던 기회를 분리해야 한다는 점을 깨달았습니다. 감지 실패는 로봇이 실제로 올바른 방향을 보고 있었을 때만 의미가 있습니다. 만약 로봇이 다른 곳을 보고 있었다면, 감지되지 않았다는 사실은 아무런 정보도 주지 못합니다.

이 아이디어를 테스트하기 위해 연구팀은 10개의 현실적인 가정 환경으로 구성된 LOOP-Bench라는 벤치마크를 만들었습니다. 이 시뮬레이션에서는 컵, 가위, 모자 같은 물체들을 다양한 표면에 숨겨진 확률 분포에 따라 배치했습니다. 어떤 물체는 항상 같은 테이블 위에 있었고, 어떤 것은 몇 군데를 옮겨 다니며 나타났으며, 어떤 것은 아주 드물게 나타나기도 했습니다. 결정적으로, 로봇의 경로는 물체가 배치된 위치와는 독립적으로 생성되었습니다. 이는 로봇이 테이블 옆을 열 번 지나가면서도 표면을 명확히 보지 못할 수도 있는 반면, 주방 아일랜드 식탁을 단 한 번만 지나가면서도 완벽한 시야를 확보할 수도 있음을 의미했습니다. 이러한 설정은 메모리 시스템이 로봇 자신의 움직임 패턴에 속지 않고 물체의 실제 위치를 파악하도록 강제했습니다.

새로운 시스템인 ECROM은 로봇의 이력을 표면, 즉 '지지체(supports)'의 지도로 조직하고, 매 통과 시마다 각 표면이 얼마나 노출되었는지를 정확하게 기록합니다. 이후 사람이 특정 아이템을 찾아달라고 요청하면, 시스템은 과거의 모든 여정을 살펴봅니다. 단순히 감지 횟수를 세는 것이 아니라, 표면이 카메라에 얼마나 노출되었는지를 기준으로 확률을 계산합니다. 만약 로봇이 표면을 명확히 보았음에도 물체를 발견하지 못했다면, 시스템은 그곳에 물체가 있다는 믿음을 강력하게 낮춥니다. 하지만 만약 로봇이 표면을 살짝 훑었거나 시야가 가려졌다면, 시스템은 감지되지 않은 것을 중립적으로 처리하여 해당 지점을 불이익을 주지 않습니다. 이를 통해 로봇은 물체가 관찰된 적이 있는 유일한 표면이라면, 비록 그 표면을 거의 보지 못했더라도 그곳에 물체가 있을 가능성이 높다고 학습할 수 있습니다.

시뮬레이션 결과는 명확했습니다. 연구진이 로봇에게 명시적으로 찾아보라고 말하지 않은 물체를 찾도록 요청했을 때, 새로운 시스템은 테스트한 다른 모든 방법보다 뛰어난 성능을 보였습니다. 이 시스템은 예측 정확도를 크게 향상시켰으며, 더 중요한 것은 능동적인 탐색 중에 물체를 훨씬 더 빠르게 찾아냈다는 점입니다. 시뮬레이션에서 ECROM을 사용하는 로봇은 약 59%의 시도에서 목표물을 찾은 반면, 차순위 방법은 약 53%를 기록했습니다. 더욱 놀라운 점은 논문에 제시된 특정 사례 연구에서, 로봇이 이동해야 하는 거리가 17.8미터에서 단 3.2미터로 줄어들었다는 것입니다. 이러한 효율성은 로봇이 이미 제외한 곳을 배회하거나 목적 없이 헤매는 대신, 어떤 표면을 먼저 확인해야 할지 정확히 알았기 때문에 가능했습니다.

이것이 단지 디지털상의 눈속임이 아님을 확인하기 위해, 연구팀은 실제 사무실 환경에서 Hello Robot Stretch 3라는 물리적 로봇을 사용하여 시스템을 테스트했습니다. 그들은 빨간 컵, 가위, 통조림 캔 같은 실제 물체들을 가지고 동일한 유형의 탐색 과제를 수행했습니다. 로봇은 책상과 선반 사이를 이동하며 500제곱미터의 공간을 탐색해야 했습니다. 결과는 시뮬레이션과 일치했습니다. 새로운 메모리 시스템을 사용하는 로봇은 15번의 시도 중 14번을 성공한 반면, 다른 방법들은 10번 또는 11번만 성공했습니다. 물리적 로봇 또한 이동 거리가 현저히 짧았는데, 다른 접근 방식들이 평균 29미터를 이동한 것에 비해 평균 19.4미터만을 이동했습니다. 이는 관찰 기회와 물체의 존재를 분리하는 논리가 예측 불가능한 조명이나 잡동사니가 있는 실제 세계에서도 작동한다는 것을 입증했습니다.

연구진은 또한 시스템의 핵심 부분을 제거했을 때 어떤 일이 일어나는지도 탐구했습니다. 로봇에게 모든 표면을 완전히 보았다고 가정하게 만들자(실제로는 그렇지 않았음에도), 로봇의 성능이 떨어졌습니다. 로봇은 감지되지 않은 것을 물체가 없다는 증거로 취급하기 시작했고, 이로 인해 올바른 위치를 무시하게 되었습니다. 마찬가지로, 시각적 증거의 강도를 무시하고 단순히 물체가 보였는지 여부만 보도록 시스템을 단순화했을 때, 로봇은 정밀도가 떨어졌습니다. 이러한 테스트는 시스템의 성공이 두 가지 구체적인 요소, 즉 실제로 얼마나 많은 표면이 노출되었는지에 대한 세심한 계산과 시각적 증거가 얼마나 강력한지에 대한 미묘한 해석에 달려 있음을 확인시켜 주었습니다.

이 연구는 변화하는 역동적인 환경에서 장기간 작동해야 하는 로봇을 위한 발전 방향을 제시합니다. 단순히 마지막으로 본 것을 기억하거나 단순한 목격 횟수를 기록하는 대신, 이 로봇들은 주변 세계의 습성을 학습할 수 있습니다. 로봇은 커피 머그잔을 최근에 카운터에서 보지 못했다고 해서 머그잔이 거기 없다는 뜻이 아니라, 단지 그 카운터를 한동안 보지 못했을 뿐이라는 것을 이해할 수 있습니다. 자신의 시각적 한계를 존중하는 기억을 구축함으로써, 로봇은 자신의 시야가 변하는 세상 속에서도 물체를 더 잘 찾을 수 있는, 보다 신뢰할 수 있는 파트너가 될 수 있습니다. 연구진은 자신들의 코드와 벤치마크 데이터를 공개하여 다른 이들이 이 토대 위에서 더 똑똑하고 관찰력 있는 기계를 만들 수 있도록 할 계획입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →