지금까지 로봇의 손(센서)은 마치 '눈을 가린 채 물건을 만지는 사람' 혹은 **'손끝의 감각에만 의존해 어둠 속에서 물건을 찾는 사람'**과 같았습니다.
시각 센서만 있으면: 물건에 가까이 다가가 손을 뻗는 순간, 손가락이 물건을 가려버려서 물건이 어디 있는지 안 보이게 됩니다. (눈을 가리는 상황)
촉각 센서만 있으면: 물건에 닿기 전까지는 아무것도 알 수 없습니다. (어둠 속에서 더듬거리는 상황)
기존의 해결책: 어떤 로봇들은 눈을 떴다 감았다 하거나, 조명을 바꿨다 하며 모드를 전환했습니다. 하지만 이건 너무 느리고 번거로워서, 물건을 잡는 찰나의 순간에 대응하기가 어려웠죠.
2. TacThru의 혁신: "투명한 피부를 가진 초능력 손"
연구팀은 로봇의 손가락 끝에 **'투명한 피부(Transparent Elastomer)'**를 입혔습니다. 이게 왜 대단할까요?
투명한 안경 같은 피부: 손가락 끝이 투명하기 때문에, 로봇의 카메라가 손가락 너머로 물건을 계속 볼 수 있습니다. 물건에 손이 닿는 순간에도 "아, 지금 물건의 이 부분을 누르고 있구나!"라는 것을 눈으로 보면서 동시에 느낄 수 있는 거죠.
마법의 점선(Keyline Markers): 투명한 피부 위에 특수한 '이중 원형 점선'을 그려 넣었습니다. 이 점선은 피부가 눌릴 때 어떻게 움직이는지를 보여주는 지표가 됩니다. 마치 '투명한 고무판 위에 그려진 정교한 눈금' 같아서, 로봇은 이 눈금이 움직이는 걸 보고 "아, 지금 물건이 미끄러지고 있구나!" 혹은 "세게 눌리고 있구나!"라는 것을 아주 빠르게(1초에 120번!) 알아차립니다.
3. 이 기술로 무엇을 할 수 있나요? (실제 사례)
이 '투명한 피부'를 가진 로봇은 다음과 같은 까다로운 일들을 척척 해냅니다.
아주 얇고 부드러운 것 잡기 (휴지 뽑기): 일반적인 로봇은 휴지가 너무 얇아서 손에 닿았는지조차 모를 때가 많습니다. 하지만 TacThru 로봇은 눈으로 휴지가 눌리는 걸 직접 보기 때문에 "아, 휴지를 잡았구나!"라고 확신하며 부드럽게 뽑아냅니다.
색깔과 모양 구분하기 (나사 분류하기): 아주 작은 나사들은 멀리서 보면 다 똑같아 보입니다. 하지만 로봇은 손가락 끝에 아주 가까이 가져가서 '투명한 피부'를 통해 나사의 색깔과 머리 모양을 눈으로 직접 확인하고 정확히 분류합니다.
정밀한 조립 (병뚜껑 끼우기): 뚜껑을 끼울 때, 눈으로 위치를 맞추다가(시각) 만약 손에 가려져 안 보이면 즉시 손끝의 감각(촉각)으로 전환해서 "딱 맞게 들어갔는지"를 알아내어 조립을 완성합니다.
4. 요약하자면
이 논문은 로봇에게 **"눈을 뜨고 있으면서도 손끝의 미세한 떨림을 느낄 수 있는 투명한 피부"**를 선물한 것입니다.
이 기술 덕분에 로봇은 이제 단순히 물건을 집어 옮기는 수준을 넘어, 사람처럼 섬세하고, 상황에 맞춰 유연하게 대처하며, 아주 작은 물건도 실수 없이 다룰 수 있는 능력을 갖게 되었습니다.
[기술 요약] TacThru: 로봇의 정밀 조작을 위한 동시 촉각-시각 인지 시스템
1. 문제 정의 (Problem Statement)
로봇이 복잡한 실세계 작업을 수행하기 위해서는 접촉 전(Pre-contact)과 접촉 후(Post-contact)를 모두 아우르는 풍부한 멀티모달 인지가 필요합니다. 기존의 센서 기술은 다음과 같은 한계가 있습니다:
시각 센서(Vision): 전역적인 맥락은 잘 파악하지만, 물체를 잡는 과정에서 발생하는 폐쇄(Occlusion) 문제로 인해 정밀한 제어가 어렵습니다.
시각 기반 촉각 센서(VBTS): 높은 해상도의 접촉 정보를 제공하지만, 접촉 전 단계(근접 감지)에서는 정보를 제공하지 못하며, 기존의 'See-Through-Skin(STS)' 센서들은 촉각과 시각 모드를 전환(Switching)해야 하므로 제어 복잡도가 높고 지연이 발생합니다.
학습 프레임워크의 부재: 이러한 풍부한 멀티모달 신호를 현대적인 데이터 기반 학습(Imitation Learning) 파이프라인에 통합하는 연구가 부족했습니다.
2. 제안 방법론 (Methodology)
본 논문은 두 가지 핵심 요소인 TacThru 센서와 TacThru-UMI 학습 프레임워크를 제안합니다.
A. TacThru 센서 설계 (Hardware & Sensing) 동시적인 촉각-시각 인지를 위해 세 가지 설계 원칙을 적용했습니다:
완전 투명 엘라스토머(Fully Transparent Elastomer): 기존의 반투명 코팅 대신 완전 투명한 소재를 사용하여, 카메라가 촉각 신호(마커 변형)를 읽는 동시에 외부 환경과 물체를 명확하게 볼 수 있도록 했습니다.
지속적 조명(Persistent Illumination): 모드 전환 없이 항상 일정한 조명을 유지하여 시각과 촉각 정보를 동시에 획득합니다.
키라인 마커(Keyline Markers): 투명한 배경에서도 검출이 용이하도록 검은색 내측 원과 흰색 외측 원으로 구성된 이중 구조의 마커를 도입했습니다. 또한, **칼만 필터(Kalman Filter)**를 적용하여 환경 노이즈 속에서도 마커의 위치를 6.08ms라는 매우 빠른 속도로 안정적으로 추적합니다.
B. TacThru-UMI 프레임워크 (Learning Framework)
데이터 수집: UMI(Universal Manipulation Interface) 설계를 확장하여, 로봇 손가락에 TacThru 센서를 장착하고 시각, 촉각(마커 변위), 고유 수용 감각(Proprioception) 데이터를 동기화하여 수집합니다.
정책 학습(Policy Learning):Transformer 기반의 Diffusion Policy를 사용합니다. DINOv2 인코더를 통해 시각 정보를 토큰화하고, 마커 변위와 로봇 상태를 결합하여 멀티모달 신호에 동적으로 주의(Attention)를 기울이며 로봇의 동작을 생성합니다.
3. 주요 기여 (Key Contributions)
TacThru 센서 개발: 별도의 모드 전환 없이 고속(120Hz 가능)으로 시각과 촉각을 동시에 제공하는 새로운 STS 센서 구조를 제안했습니다.
강건한 마커 추적 알고리즘: 키라인 마커와 칼만 필터를 결합하여 복잡한 배경에서도 마커를 놓치지 않는 효율적인 추적 기술을 구현했습니다.
멀티모달 모방 학습 통합: 시각-촉각 신호를 Diffusion Policy에 통합하여, 정밀하고 접촉이 빈번한 작업에 최적화된 학습 시스템을 구축했습니다.
4. 실험 결과 (Results)
5가지 도전적인 작업(Pick-and-place, Tissue extraction, Bolt sorting, Scissors hanging, Cap insertion)을 통해 검증한 결과:
평균 성공률 85.5% 달성: 이는 시각 전용 정책(55.4%) 및 촉각 전용 정책(66.3%)보다 월등히 높은 수치입니다.
특수 시나리오 강점:
얇고 부드러운 물체(Tissue): 촉각 센서가 감지하기 어려운 얇은 휴지를 시각적 정보를 통해 성공적으로 추출했습니다.
시각적 식별(Bolt): 형태는 같지만 색상이 다른 볼트를 TacThru의 근접 시각 정보를 통해 정확히 분류했습니다.
적응형 전략(InsertCap): 물체가 보일 때는 시각 서보잉(Visual Servoing)을 사용하고, 가려질 때는 촉각 기반의 삽입 전략으로 **자동 전환(Fallback)**하는 지능적인 동작을 보였습니다.
5. 의의 (Significance)
본 연구는 **"동시적 멀티모달 인지"**가 로봇의 조작 능력을 어떻게 비약적으로 향상시킬 수 있는지를 입증했습니다. 특히, 기존의 복잡한 하드웨어 제어 없이도 표준적인 시각 기반 학습 파이프라인(DINOv2, Diffusion Policy 등)에 쉽게 통합될 수 있음을 보여줌으로써, 향후 정밀한 로봇 조작 연구에 실용적인 기반을 제공합니다.