← 최신 논문
💻 computer science

M3-Tele: A Unified Multimodal Teleoperational Framework for Compliant Whole-Body Mobile Manipulation

이 논문은 시각, 촉각, 힘, 그리고 고유 수용성 감각을 통합하여 순응형 전신 모바일 조작을 가능하게 함으로써 접촉이 빈번한 작업 성능을 크게 향면시키고, 다운스트림 정책 학습을 위한 결합된 촉각-힘 감지의 가치를 입증하는 통합 멀티모달 텔레오퍼레이션 프레임워크인 M3-Tele를 소개한다.

원저자: Hengxiang Chen, Shenwen Deng, Yujian Ma, Gan Ma, Qiang Li, Nutan Chen

게시일 2026-09-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hengxiang Chen, Shenwen Deng, Yujian Ma, Gan Ma, Qiang Li, Nutan Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

집 안을 돌아다니며 물건을 집어 올릴 수 있는 로봇은 오랫동안 공상 과학의 꿈이었지만, 그 꿈을 현실로 바꾸기 위해서는 어려운 물리적 퍼즐을 풀어야 합니다. 진정으로 유용해지기 위해서 로봇은 두 가지 일을 동시에 수행해야 합니다: 어질러진 방을 항해하는 것과 물건을 깨뜨리지 않고 부드럽게 조작하는 것입니다. 이를 위해서는 몸을 움직이는 것과 자신이 접촉하는 세상을 느끼는 것 사이의 섬세한 균형이 필요합니다. 만약 로봇이 너무 세게 밀면 꽃병을 넘어뜨릴 수 있고, 너무 딱딱하게 움직이면 서랍을 열거나 표면을 닦아낼 수 없습니다. 로봇이 인간으로부터 이러한 기술을 배우기 위해서는, 인간이 자연스럽게 느껴지는 수준의 민감도로 로봇을 안내할 수 있어야 하며, 동시에 로봇은 자신의 센서에 귀를 기울이고 움켜쥐는 힘과 압력을 실시간으로 조정할 수 있어야 합니다. 이러한 감각과 적응 능력이 없다면, 로봇을 가르치기 위해 수집되는 데이터는 종종 서투르고 일관성이 없게 되어, 나중에 기계가 복잡한 과업을 학습하는 것을 어렵게 만듭니다.

선전 기술 대학교(Shenzhen Technology University)의 연구진은 이 문제를 해결하기 위해 M3-Tele라고 불리는 새로운 시스템을 개발했습니다. 그들은 인간이 스마트폰을 사용하여 이동형 로봇 팔을 제어할 수 있는 프레임워크를 구축했지만, 여기에는 결정적인 반전이 있습니다. 바로 시스템이 로봇과 세상 사이의 접촉을 느낄 수 있도록 설계되었다는 점입니다. 로봇은 손가락의 부드러운 패드가 물체에 닿을 때 얼마나 찌그러지는지를 볼 수 있는 특수 센서와, 손목을 밀어내는 힘을 측정하는 센서를 갖추고 있습니다. 인간 작업자가 화이트보드를 닦거나 서랍을 열기 위해 로봇을 안내할 때, 시스템은 단순히 손의 경로를 맹목적으로 따르지 않습니다. 대신, 시스템은 압력과 그리퍼의 찌그러짐을 지속적으로 확인하며, 접촉이 부드럽고 안정적으로 유지되도록 로봇의 움직임을 자동으로 조정합니다. 이는 로봇이 경직된 기계가 아니라 순응적인 파트너처럼 행동하게 하여 매끄럽고 반응성이 좋은 경험을 만들어냅니다.

연구팀은 단순한 것부터 어려운 것까지 네 가지 서로 다른 과업에 대해 이 시스템을 테스트했습니다. 그들은 자원봉사자들에게 이 시스템을 사용하여 블록을 집고, 막대를 회전시키고, 서랍을 당겨 열고, 화이트보드를 닦도록 요청했습니다. 결과에 따르면, 새로운 시스템은 물체를 놓치거나 너무 많은 힘을 가하지 않고 물체와의 접촉을 유지하는 데 훨씬 더 뛰어난 성능을 보였습니다. 연구진이 힘 감지 조정을 사용하지 않는 기존 방식과 비교했을 때 그 차이는 극명했습니다. 새로운 컨트롤러는 원하는 힘을 추적하는 오차를 4뉴턴 이상에서 0.35뉴턴 미만으로 줄였습니다. 실질적인 관점에서 이는 로봇이 표면에 대해 훨씬 더 정밀하게 일정한 압력을 유지할 수 있음을 의미합니다. 또한, 이 시스템은 로봇이 실수로 물체와의 접촉을 잃는 것을 방지하여, 움켜쥐기가 미끄러지는 횟수를 시도당 거의 2.5회에서 거의 0회로 줄였습니다.

연구는 또한 이 시스템이 인간이 사용하기에 얼마나 쉬운지도 살펴보았습니다. 연구진은 작업자에게 로봇의 촉각에 대한 피드백을 제공하는 것이 과업을 훨씬 더 직관적으로 만든다는 것을 발견했습니다. 사용자들은 피드백 기능이 있는 인터페이스의 사용 용이성을 표준 제어 방식보다 현저히 높게 평가했는데, 기본 버전의 점수인 5.8점에 비해 약 8.4점을 기록했습니다. 이는 인간이 컨트롤러를 통해 로봇이 느끼는 것을 "느낄" 수 있을 때, 로봇을 더 효과적으로 안내할 수 있음을 시사합니다. 시스템은 모든 다양한 과업에서 잘 작동하여, 도전적인 닦기 과업은 80%의 성공률을, 더 단순한 과업은 최대 94%의 성공률을 기록했습니다. 이러한 신뢰성은 로봇이 일관되게 학습에 사용할 수 있을 만큼 고품질의 시연 데이터를 수집할 수 있다는 점에서 필수적입니다.

마지막으로, 연구진은 이 시스템에 의해 수집된 데이터를 사용하여 확산 정책(diffusion policy)이라고 알려진 학습 방법을 통해 로봇이 스스로 화이트보드를 닦는 법을 가르쳤습니다. 그들은 로봇이 카메라 뷰, 힘 측정값, 촉각 찌그러짐 데이터라는 세 가지 종류의 정보 모두에 접근할 수 있을 때 더 잘 학습하는지, 아니면 카메라만으로도 충분한지를 테스트했습니다. 실험 결과, 로봇은 세 가지 유형의 정보를 결합했을 때 가장 효과적인 닦기 동작을 학습했습니다. 심지어 연구진이 학습 알고리즘에 아주 적은 양의 데이터만 제공하더라도, 촉각과 힘 센서의 조합은 시각 정보만 있을 때보다 로봇이 과업을 더 잘 이해하도록 도왔습니다. 이는 로봇이 물리적 접촉이 포함된 과업을 숙달하기 위해서는, 단순히 로봇이 무엇을 보느냐뿐만 아니라 세상이 어떻게 느껴지는지를 정확히 포착하는 데이터로 교육받아야 함을 확인시켜 줍니다. 이 연구는 이러한 감각들을 제어 시스템에 통합함으로써, 우리가 집 안을 이동할 수 있을 뿐만 아니라 그 안의 물건들과 상호작용할 수 있을 만큼 부드럽고 정밀한 로봇을 구축할 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →