← 최신 논문
💻 computer science

MessyMem: Learning-from-Doing Memory for Mobile Manipulation

MessyMem은 상호작용에서 유도된 지식으로 보강된 공간적으로 접지된 3D 장면 그래프를 유지함으로써, 로봇이 경험으로부터 학습하고 장기 과업 전반에 걸쳐 과거의 발견을 재사용하여 기존 베이스라인을 크게 능가할 수 있게 하는 모바일 매니퓰레이터를 위한 지속성 메모리 시스템입니다.

원저자: Anuva Banwasi, William Muckelroy III, Priya Sundaresan, Linfeng Zhao, Jeannette Bohg, Cherie Ho

게시일 2026-09-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anuva Banwasi, William Muckelroy III, Priya Sundaresan, Linfeng Zhao, Jeannette Bohg, Cherie Ho

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

우리 집과 사무실을 돌아다니는 로봇들이 점점 더 흔해지고 있지만, 그들은 여전히 인간의 근본적인 기술인 '배운 것을 기억하는 것'에 어려움을 겪고 있습니다. 오늘날의 가정용 로봇은 종면에 새로운 요청을 받을 때마다 마치 그 방에 처음 들어온 것처럼 취급하곤 합니다. 만약 로봇이 찬장을 열었는데 비어 있는 것을 발견했다면, 다음 날 아침이 되면 그 사실을 잊어버릴 수도 있습니다. 만약 서랍이 잠겨 있다는 것을 발견했다면, 미래의 작업에서도 계속해서 그것을 억지로 열려고 시도할 수도 있습니다. 이러한 지속적인 기억의 결여는 로봇이 끊임없이 처음부터 다시 시작하게 만들어 시간과 에너지를 낭비하게 합니다. 실제 가정에서 효과적으로 기능하기 위해서, 기계는 단순히 물건이 어디에 있는지에 대한 지도 이상의 것이 필요합니다. 즉, 촉각과 행동을 통해 발견한 것에 대한 기록과, 몇 시간 또는 며칠 전의 구체적인 시각적 세부 사항을 회상할 수 있는 방법이 필요합니다.

스탠퍼드 대학교의 연구진은 이 문제를 해결하기 위해 MessyMem이라고 불리는 시스템을 개발했습니다. 이 시스템은 이동형 로봇을 위한 장기 기억 역할을 하며, 로봇이 서로 다른 방과 긴 시간에 걸쳐 지식을 운반할 수 있도록 해줍니다. 단순한 물체 목록이나 검색하기에 너무 큰 연속적인 비디오 피드에 의존하는 대신, MessyMem은 상호작용할 때마다 더 똑똑해지는 구조화된 세계 지도를 구축합니다. 이 시스템은 세 가지 뚜렷한 유형의 정보를 결합합니다: 물체가 위치한 곳에 대한 공간 지도, 로집이 물리적으로 만지거나 움직임으로써 배운 것에 대한 기록, 그리고 핵심적인 순간에 찍은 특정 사진 라이브러리입니다. 이 세 가지 요소를 연결함으로써, 로봇은 집 전체를 다시 탐색할 필요 없이 "가위를 어디서 봤지?" 또는 "어떤 찬장이 잠겨 있지?"와 같은 복잡한 질문에 답할 수 있습니다.

이 시스템의 핵심은 3D 씬 그래프(scene graph)로, 이는 로봇이 본 모든 물체와 그것이 세계 어디에 위치해 있는지를 나열하는 일종의 디지털 지도입니다. 기하학적 구조만을 기록하는 일반적인 지도와 달리, 이 시스템은 각 아이템에 상세한 프로필을 부착합니다. 로봇이 서랍을 열려고 시도하거나 컵을 집어 드는 것과 같이 물체와 상호작용할 때, 특수 소프트웨어 구성 요소가 그 결과를 분석합니다. 그것은 서랍이 잠겨 있었는지, 컵이 비어 있었는지, 혹은 로봇이 미끄러져서 동작이 실패했는지 등을 결정합니다. 이 정보는 해당 물체의 디지털 프로필에 직접 기록됩니다. 따라서 만약 로봇이 찬장을 열려고 시도했다가 잠겨 있는 것을 발견하면, 그 사실이 저장됩니다. 나중에 무언가를 찾으라는 요청을 받으면, 로봇은 자신의 기억을 확인하여 '잠김' 메모를 보고 해당 찬장을 통째로 건너뛰고 곧바로 열려 있는 다른 찬장으로 이동합니다.

하지만 단순히 찬장이 잠겨 있다는 것을 아는 것만으로는 충분하지 않을 때가 있습니다. 때때로 로봇은 컵에 붙은 특정 스티커나 병의 라벨처럼 단순한 텍이트 메모로는 포착할 수 없는 미세한 세부 사항을 기억해야 합니다. 이를 처리하기 위해 MessyMem은 '키프레임(keyframes)'이라 불리는 선택된 사진들을 저장하고, 이를 지도의 물체들과 직접 연결합니다. 이 사진들은 단순한 무작위 영상 스트림이 아닙니다. 로봇이 물체를 잡기 직전의 모습이나, 서랍을 연 후의 내부 모습과 같이 신중하게 선택된 순간들입니다. 로봇은 새로운 과제에 직면했을 때, 자신의 기억에서 가장 관련 있는 사진들을 검색합니다. 예를 들어, 커피 용기가 마지막으로 보였던 정확한 선반을 보여주는 사진을 찾거나, 특정 패턴이 있는 양말의 사진을 찾아볼 수 있습니다. 이를 통해 로직은 과거에 수집한 시각적 증거를 바탕으로 똑같이 생긴 두 물체를 구별할 수 있습니다.

연구진은 컴퓨터 시뮬레이션과 실제 물리적 환경을 움직이는 실제 로봇 모두에서 이 시스템을 테스트했습니다. 3시간 이상에 걸친 25개의 서로 다른 가사 과제 시퀀스를 포함하는 시뮬레이션에서, Messy-Mem을 사용하는 로봇은 과제의 80%를 성공적으로 완료했습니다. 이는 다른 방법들에 비해 상당한 개선입니다. 상호작용 메모 없이 공간 지도에만 의존하는 로봇이나, 메모는 있지만 사진은 없는 로봇들은 훨씬 낮은 성능을 보였습니다. 예를 들어, 어수선한 찬장 안에 숨겨진 특정 아이템을 찾으라는 요청을 받았을 때, 전체 시스템은 정확한 시각적 배치를 회상할 수 있었지만, 다른 시스템들은 유사한 물체를 대상과 구별하지 못해 실패했습니다. 여러 개의 서랍이 있는 사무실 책상을 이용한 실제 테스트에서, 로봇은 이전 단계에서 수집한 지식을 재사용하여 가위를 찾고, '존(John)'이라는 사람의 특정 컵을 식별하며, 게임 컨트롤러를 성공적으로 찾아냈습니다.

실험 결과, 시스템은 세 가지 구성 요소가 모두 존재할 때 가장 잘 작동하는 것으로 나타났습니다. 공간 지도는 위치를 제공하고, 상호작용 메모는 세계의 상태(잠겼는지 또는 비어 있는지 등)를 제공하며, 사진은 어려운 구별에 필요한 시각적 증거를 제공합니다. 상호작용 메모가 없으면 로봇은 잠긴 서랍을 열려고 시도하며 시간을 낭비했습니다. 사진이 없으면 두 개의 비슷한 병을 구별할 수 없었습니다. 또한 시스템은 효율적이었습니다. 수천 장의 사진을 저장하고 몇 시간 동안 실행된 후에도, 특정 과제를 수행하는 데 필요한 구체적인 증거를 빠르게 찾아내어 과거 한 시간 동안의 활동을 되돌아보며 결정을 내릴 수 있었습니다.

이 연구는 로봇이 우리 일상생활에서 진정한 조수가 되기 위해서는 자신의 행동으로부터 배우고 그 교훈을 기억할 수 있어야 함을 시사합니다. MessyMem 시스템은 지도, 상호작용 로그, 그리고 핵심 이미지 라이브러리를 결합함으로써, 로봇이 모든 과제를 새로운 발견으로 취급하는 것을 멈추고 자신의 경험에 대한 연속적인 역사를 구축할 수 있음을 보여줍니다. 현재 시스템은 인식할 수 있는 정의된 물체 목록을 사용하지만, 연구진은 향후 버전에서 더 다양한 품목을 인식하고 심지어 인간의 행동으로부터도 배울 수 있도록 확장될 수 있다고 언급했습니다. 현재로서는, 자신이 만지고 본 것을 기억하는 로봇이 우리가 도움을 요청할 때마다 처음부터 다시 시작하지 않고 마침내 우리와 함께 일할 수 있는 길을 명확히 보여주고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →