← 최신 논문
💻 computer science

MS-MEM: Multi-Skill Manipulation-Enhanced Mapping via Uncertainty- and Disturbance-Aware Action Selection

이 논문은 복잡한 환경에서 불필요한 장면 변화를 최소화하면서 매핑 정확도를 향상시키기 위해 능동적 시점 선택, 물체 밀기, 그리고 잡기 기능을 부수적 방해 제약 조건과 통합한 증거 기반 프레임워크인 MS-MEM을 제안한다.

원저자: Yitian Shi, Jesper Mücke, Nils Dengler, Sicong Pan, Rania Rayyes, Maren Bennewitz

게시일 2026-09-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yitian Shi, Jesper Mücke, Nils Dengler, Sicong Pan, Rania Rayyes, Maren Bennewitz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

우리 집이나 창고에서 일하는 로봇들은 매우 단순해 보이지만 교묘한 문제에 직면해 있습니다. 바로 모든 것을 볼 수는 없다는 점입니다. 어질러진 방 안에서는 물체들이 서로의 뒤에 숨어 있어 로봇의 센서를 혼란스럽게 만드는 사각지대를 만듭니다. 특정 물건을 찾기 위해 로봇은 단순히 바라보는 것 이상의 일을 해야 합니다. 뒤에 무엇이 있는지 보기 위해 상자를 옆으로 밀거나, 더 나은 시야를 확보하기 위해 새로운 각도로 이동해야 할 수도 있습니다. 능동적 지각(active perception)이라고 알려진 이 연구 분야는 로봇이 단순히 쳐다보는 것이 아니라, 사물을 만지고 움직임으로써 가장 잘 배운다는 아이디어에 기반합니다. 하지만 함정이 있습니다. 로봇이 물체를 밀 때마다 장면이 변한다는 것입니다. 너무 세게 혹은 너무 자주 밀면, 정교하게 배열된 선반을 흩뜨려 놓아 나중에 구조를 파악하기 더 어렵게 만들 수도 있습니다. 엔지니어들의 과제는 로봇에게 숨겨진 것을 찾을 만큼 충분히 호기심을 갖게 하면서도, 그 과정에서 엉망을 만들지 않을 만큼 충분히 조심스럽도록 가르치는 것입니다.

카를스루에 공과대학교, 본 대학교, 그리고 다름슈타트 공과대학교의 연구진은 이러한 균형 잡기 문제를 해결하기 위한 새로운 시스템을 개발했습니다. 그들은 이를 MS-MEM이라고 부르며, 이는 로봇이 선반과 같이 좁고 어질러진 공간을 최대한 방해하지 않으면서 지도를 그릴 수 있도록 설계된 프레임워크입니다. 이 시스템은 로봇이 더 많이 보기 위해 새로운 관점으로 이동하거나, 숨겨진 것을 드러내기 위해 물체를 밀거나, 시야를 가로막는 물체를 집어 들어 제거하는 세 가지 다른 유형의 행동 중 하나를 선택할 수 있게 해줍니다. 핵심적인 혁신은 로봇이 단순히 가장 많은 정보를 드러내는 행동을 선택하는 것이 아니라, 그 행동의 비용 또한 계산한다는 점입니다. 로봇은 스스로에게 묻습니다. "내가 이 상자를 밀면, 선반의 나머지 부분을 얼마나 방해하게 될까?" 그리고 "새롭게 얻은 정보가 내가 만들 혼란만큼의 가치가 있을까?"

연구진은 불확정성을 토대로 이 시스템을 구축했습니다. 방의 지도를 고정된 그림으로 취급하는 대신, 로봇은 위치에 대한 '믿음(belief)'을 유지하며, 그와 함께 자신이 얼마나 확신이 없는지에 대한 척도도 함께 관리합니다. 로봇은 특정 구역에 대해 확신이 높을 때는 그곳을 건드리지 말아야 한다는 것을 압니다. 반면 확신이 없을 때는 조사가 필요하다는 것을 압니다. 이러한 결정을 내리기 위해 연구진은 로봇이 파지(grasping)를 이해하는 새로운 방법을 도입했습니다. 기존 시스템들은 시야가 부분적이거나 물체가 좁은 곳에 있을 때 로봇의 그리퍼가 물체와 어떻게 상호작용할지 예측하는 데 어려움을 겪곤 했습니다. 이 새로운 시스템은 로봇에게 어디를 잡아야 하는지뿐만 아니라, 그 잡기가 얼마나 확신 있는 것인지, 그리고 물체의 방향이 얼마나 불확실한지를 추정하도록 가르칩니다. 이를 통해 로봇은 여러 각도에서 얻은 정보를 결합하여, 물체 주변을 움직임에 따라 시간이 흐름에 따라 파지에 대한 이해를 정교하게 다듬을 수 있습니다.

실험에서 연구진은 무작위로 배치된 물체들로 가득 찬 실제 세계의 선반을 모사한 시뮬레이션 환경에서 이 시스템을 테스트했습니다. 그들은 이 새로운 다중 기술 접근 방식을 밀기만 하거나 집기만 하는 것과 같은 단일 유형의 행동에 의존하는 기존 방식들과 비교했습니다. 결과는 여러 기술을 결합하는 것이 훨씬 더 효과적이라는 것을 보여주었습니다. 물체를 분리하고 공간을 만들기 위해 밀기를 사용하고, 그 후 특정 차단물을 제거하기 위해 집기를 사용함으로써, 로봇은 장면의 더 정확한 지도를 구축할 수 있었습니다. 그러나 가장 중요한 발견은 장면의 방해를 제한하는 능력에서 나왔습니다. 연구진이 로봇의 의사결정 과정에 특정 제약 조건, 즉 장면의 불필요한 변화에 벌점을 주는 규칙을 추가했을 때, 로봇은 훨씬 더 조심스러워졌습니다. 로봇은 여전히 숨겨진 물체들을 찾아냈지만, 장면을 방해하지 않는 규칙이 없는 시스템들에 비해 훨씬 적은 수의 물체를 움직였습니다. 시뮬레이션에서 이 새로운 시스템은 장면의 방해를 무시하는 방법들에 비해 물체가 이동한 총 거리를 상당한 차이로 줄이면서도, 선반을 매핑하는 데 높은 정확도를 달외 달성했습니다.

연구진은 카메라와 그리퍼가 장착된 물리적 로봇 팔을 사용하여 실제 세계에서도 이 시스템을 테스트했습니다. 그들은 다섯 가지 도전적인 설정에 걸쳐 69개의 물체가 담긴 선반 앞에 로봇을 배치했습니다. 로봇은 가능한 한 많은 물체를 찾고 식별해야 했습니다. 밀기, 집기, 그리고 주의 깊은 움직임을 결합한 시스템은 단 하나의 기술만을 사용한 시스템들보다 더 많은 물체를 찾아냈습니다. 이 시스템은 44개의 물체를 성공적으로 식별했는데, 이는 밀기 전용 시스템의 40개, 집기 전용 시스템의 38개와 비교됩니다. 결정적으로, 이 시스템은 선반 위 물체들의 물리적 변위를 덜 일으키면서도 이를 수행했습니다. 집기 전용 시스템은 물체를 가장 적게 움직였지만, 너무 보수적이어서 많은 숨겨진 아이템을 찾는 데 실패했습니다. 밀기 전용 시스템은 많은 아이템을 찾았지만 선반을 크게 흩뜨려 놓았습니다. 새로운 시스템은 가장 많은 물체를 찾으면서도 장면을 비교적 질서 있게 유지하며 최선의 균als(균형)을 맞추었습니다.

이 연구는 로봇이 인간의 공간에서 효과적으로 작동하기 위해서는 자신의 행동의 결과를 추론할 수 있어야 함을 보여줍니다. 단순히 물건을 집거나 밀 수 있는 것만으로는 부족합니다. 로봇은 자신이 얻는 정보의 가치와 자신이 만드는 변화의 비용 사이를 저울질할 수 있어야 합니다. 로봇에게 이러한 요소들을 따져보도록 가르침으로써, 연구진은 인간이 사용하는 것과 같은 주의 깊음과 적응력을 가지고 복잡한 세상을 항해할 수 있는 기계로 나아가는 한 걸음을 내디뎠습니다. 이 시스템은 단순히 세상을 보는 것이 아니라, 도움이 되는 상호작용과 방해가 되는 상호작용의 차이를 이해하며, 자신이 지도를 그리려는 바로 그 질서를 파괴하지 않고 환경에 대해 학습할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →