← 최신 논문
💻 computer science

ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction

ReTouch는 촉각-패치 인코더(Tactile-Patch Encoder)와 고주파 액션 모듈을 사용하여 촉각 상태와 액션을 공동으로 예측하고 온라인으로 정교화함으로써 접촉이 풍부한 숙련된 조작을 향상시키는 시각-언어-행동 모델로, 새롭게 도입된 XHT-데이터셋에서 베이스라인보다 현저히 높은 성공률을 달성한다.

원저자: Shiqi Zhang, Xin Zhang, Yedong Shen, Jiajun Deng, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Yao Li, Yanyong Zhang

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Shiqi Zhang, Xin Zhang, Yedong Shen, Jiajun Deng, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Yao Li, Yanyong Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 젠가 블록을 쌓으려는 서투른 유아처럼 행동하는 세상을 상상해 보세요. 로봇은 눈(카메라)과 뇌(인공지능)를 가지고 있어 "빨간색 블록을 집어라"와 같은 지시를 이해할 수 있습니다. 하지만 문제는 눈은 느낄 수 없다는 점입니다. 만약 블록이 미끄럽거나, 로봇의 움켜쥐는 힘이 너무 강해 블록을 으깨버리거나, 혹은 블록이 미끄러지기 시작한다면, 로봇의 눈은 너무 늦기 전까지는 이를 알아차리지 못할 수도 있습니다. 이것이 바로 "정교한 조작(dexterous manipulation)"—즉, 로봇이 섬세하고 촉각이 중요한 작업을 수행하는 것—에서 발생하는 큰 문제입니다. 과학자들은 로봇에게 촉각을 부여하기 위해 노력해 왔지만, 이는 매우 까다로운 일입니다. 단순히 로봇의 뇌에 "느낌" 센서를 추가하는 것만으로는 충분하지 않은데, 왜냐하면 로봇은 단순히 물건을 떨어뜨린 후에 반응하는 것이 아니라, 다음에 어떤 일이 일어날지 예측하고 즉각적으로 움켜쥐는 힘을 조절해야 하기 때문입니다.

여기서 ReTouch라고 불리는 새로운 아이디어가 등장합니다. 이것은 로봇에게 단순한 촉각을 주는 것을 넘어, 자신의 손가락이 다음 찰나에 어떻게 느껴질지 추측하고, 현실이 예측과 다를 경우 즉시 그 예측을 수정할 수 있는 "육감"을 부여하는 것이라고 생각하면 됩니다. 연구진은 이 시스템을 로봇의 손과 뇌 사이의 살아있는 대화처럼 구축했습니다. 단순히 손이 물체를 잡고 있는 사진을 보는 대신, ReTouch는 각 손가락 끝의 느낌을 아주 구체적인 "패치(patch)" 단위로 나눕니다. 마치 고해definition 압력 지도처럼 말이죠. 그런 다음 로봇이 움직이는 동안 이 지도를 끊임없이 업데이트하며, 물체가 미끄러지거나 위치가 바뀌면 실시간으로 예측을 수정합니다. 그 결과, 로봇은 피펫의 버튼을 누르거나 화이트보드를 닦는 것과 같이 까다롭고 촉각이 중요한 작업을 이전보다 훨씬 더 잘 수행할 수 있게 되었습니다.

문제점: 눈은 느낄 수 없고, 예측은 낡은 정보가 된다

로봇은 지시를 따르는 데 매우 능숙해지고 있습니다. 만약 당신이 로봇에게 "컵을 집어라"라고 말하면, 카메라는 컵을 보고 뇌는 팔을 어떻게 움직일지 계산합니다. 하지만 로봇의 손가락이 실제로 컵에 닿는 순간, 상황은 복잡해집니다. 컵이 미끄러운가? 컵이 미끄러지고 있는가? 로봇이 너무 세게 쥐고 있는가? 카메라는 접촉점에서 일어나는 보이지 않는 힘을 볼 수 없습니다.

과학자들은 로봇에게 손가락에 "촉각 센서(tactile sensors)"를 달아줌으로써 이 문제를 해결하려 했습니다. 어떤 로봇은 촉각 데이터를 보고 반사적으로 반응합니다. 다른 로봇들은 미래에 촉각이 어떻게 느껴질지 예측하려고 시도합니다. 하지만 이러한 시스템들에는 결함이 있습니다. 공을 잡으려고 노력하는 상황을 상상해 보세요. 당신은 1초 후에 공이 어디에 있을지 예측합니다. 하지만 바람이 바뀌거나 공이 이상하게 회전한다면, 당신의 예측은 틀리게 됩니다. 만약 당신이 공을 향해 손을 뻗는 동안 예측을 업데이트하지 않는다면, 당신은 공을 놓칠 수도 있습니다.

본 논문은 많은 현재의 로봇 시스템이 이 실수를 저지르고 있다고 주장합니다. 그들은 움직임이 시작될 때 손가락이 어떻게 느껴질지에 대해 예측을 내리고, 설령 물체가 미끄러지기 시작하더라도 그 계획을 고수합니다. 로봇이 물체가 움직이고 있다는 것을 깨달았을 때는 이미 늦은 상태입니다. 예측이 "낡은 정보(stale)"가 되어버린 것입니다.

해결책: ReTouch와 "패치" 시스템

연구진은 두 가지 주요 방법을 통해 이 문제를 해결하는 새로운 시스템인 ReTouch를 도입했습니다. 즉, 촉각 데이터를 더 잘 조직하고, 예측을 끊임없이 업데이트하는 것입니다.

1. 촉각 패치 인코더: 손가락 지도
먼저, ReTouch는 로봇이 촉각 센서를 "읽는" 방식을 바꿉니다. 대부분의 로봇은 모든 촉각 데이터를 크고 무질서한 더미로 쏟아붓습니다. 하지만 ReTouch는 각 손가락을 하나의 작은 지도로 취급합니다. 각 손가락의 표면을 다섯 개의 특정 "패치"(예: 끝, 중앙, 밑부분, 왼쪽 측면, 오른쪽 측면)로 나눕니다.

이것을 기상 지도에 비유해 볼 수 있습니다. 기상 지도는 단순히 "비가 온다"라고 말하는 대신, 정확히 어디에 비가 오고 얼마나 세게 내리는지를 알려줍니다. ReTouch는 촉각에 대해 이와 똑같이 수행합니다. 로bot에게 이렇게 알려주는 것입니다: "검지 손가락 끝은 강하게 누르고 있지만, 중지 손가락의 옆면은 거의 닿지 않고 있다." 이는 로봇이 미끄러운 포도를 으깨지 않고 조절하는 것처럼, 아주 미세하고 정밀한 조정을 할 수 있도록 돕습니다.

2. "선견지명(Foresight)"과 "회상(Hindsight)" 전문가
두 번째이자 가장 중요한 부분은 ReTouch가 미래를 예측하는 방식입니다. 이 시스템은 촉각으로부터 학습하기 위해 두 명의 "전문가"(AI 모델)를 사용합니다.

  • 회상 전문가 (Hindsight Expert): 이 모델은 선생님 역할을 합니다. 훈련 과정에서, 이 모델은 실제로 일어난 미래의 촉각 데이터를 살펴보고 로봇이 무엇을 예측했어야 했는지를 배웁니다.
  • 선견지명 전문가 (Foresight Expert): 이 모델은 학생 역할을 합니다. 이 모델은 지금 당장 보이는 것을 바탕으로 미래의 촉각을 예측하려고 노력합니다.

여기서 마법 같은 기술이 등장합니다. 선견지명 전문가는 단 한 번의 예측을 하고 그것을 고수하지 않습니다. 이 모델은 매우 빠른 속도(초당 36회)로 작동합니다. 로봇의 손가락으로부터 새로운 촉각 데이터를 받을 때마다, 이 모델은 "잠깐, 내 예측이 약간 틀렸어. 다시 업데이트하자!"라고 말합니다. 그런 다음 이 신선하고 업데이트된 예측을 사용하여 로봇의 다음 움직임을 수정합니다.

이것은 마치 비디오 게임을 하면서 적의 새로운 위치를 확인하고 즉시 전략을 바꾸는 것과 같습니다. 만약 물체가 미끄러지면, 로봇은 다음 "차례"를 기다리는 것이 아니라, 즉시 움켜쥐는 힘을 재계산하여 물체를 구해냅니다.

연구 결과: 물건을 떨어뜨리지 않는 로봇

이를 테스트하기 위해 연구진은 UR7e 로봇 팔에 부착된 실제 로봇 손(XHand라고 불림)을 제작하였고, XHT-Dataset이라는 새로운 데이터셋을 만들었습니다. 그들은 로봇이 수행하는 일곱 가지 까다로운 작업(예: 피펫의 버튼 누르기, 다양한 무게의 물병 잡기, 스펀지로 화이트보드 닦기, 비커를 꺼내기 위해 캐비닛 서랍 열기 등)에 대한 900번의 실제 세계 시연을 기록했습니다.

그들은 ReTouch를 다른 스마트 로봇 시스템들과 비교했습니다. 결과는 인상적이었습니다. 일반적인 조건에서 ReTouch는 차세대 최고 성능의 로봇보다 18.4% 더 자주 성공했습니다. "도전적인" 조건(로봇이 미끄러운 물체, 다양한 높이, 또는 누군가 물체를 잡아당기는 상황을 다뤄야 하는 경우)에서 ReTouch는 23.8% 더 높은 성공률을 보였습니다.

예를 들어, "액체 이동(Liquid Transfer)" 작업(한 용기에서 다른 용기로 물을 옮기는 작업)에서 ReTouch는 기존 최고의 경쟁 모델보다 19% 더 뛰어났으며, "스펀지 닦기(Sponge Wipe)"에서는 25% 더 뛰어났습니다. 본 논문은 이러한 큰 개선이 ReTouch가 "접촉이 풍부한(contact-rich)" 작업—즉, 로봇이 물체와 끊임없이 접촉하고, 미끄러지고, 물체에 맞춰 조정해야 하는 작업—을 처리할 수 있기 때문이라고 설명합니다.

이것이 중요한 이유

본 논문은 로봇에게 촉각을 주는 것은 단순히 센서를 추가하는 문제가 아니라, 그 정보를 어떻게 사용하는가의 문제임을 보여줍니다. 만약 로봇이 촉각에 단순히 반응하기만 한다면 너무 느립니다. 만약 미래를 예측하지만 그 예측을 업데이트하지 않는다면, 로봇은 혼란에 빠질 것입니다. ReTouch는 섬세하고 촉각이 중요한 작업을 처리하는 최선의 방법이 예측을 계속하고, 동시에 계속 수정하는 것임을 증명합니다.

연구진은 "온라인 정교화(online refinement, 움직이는 동안 예측을 업데이트하는 것)"가 핵심이라는 것을 발견했습니다. 예측만 하고 업데이트하지 않는 버전의 로봇을 테스트했을 때 성공률이 현저히 떨어졌습니다. 이는 로봇이 수술, 요리, 또는 전자 부품 조립과 같은 작업을 진정으로 마스터하기 위해서는, 미래를 "느끼고" 현실이 변할 때 즉시 생각을 바꿀 수 있어야 한다는 것을 시사합니다. ReTouch는 로봇에게 그러한 정교함을 부여하기 위한 큰 진전입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →