이 논문은 로봇이 어떤 물체인지도 모르고, 어깨를 맞대고 부딪히며 빠르게 움직일 때, 그 물체를 어떻게 실시간으로 정확히 쫓아갈 수 있는지에 대한 해결책을 제시합니다.
기존의 로봇은 "눈 (카메라)"만 믿고 물체를 쫓았습니다. 하지만 물체가 벽에 부딪히거나 다른 손가락에 가려지면 (가려짐), 카메라는 망가진 영상을 보여줍니다. 이때 로봇은 "어디로 갔지?"라고 당황하며 물체를 잃어버립니다.
TwinTrack은 이 문제를 해결하기 위해 "눈 (Vision)"과 "촉감 (물리 법칙)"을 동시에 사용하는 새로운 시스템을 개발했습니다.
🧩 핵심 아이디어: "눈이 안 보일 때, 물리 법칙으로 추측하자!"
이 시스템은 두 명의 팀원처럼 작동합니다.
1. 리얼 투 심 (Real2Sim): "현실의 물체를 가상 세계에 완벽하게 복제하는 아티스트"
역할: 카메라로 찍은 흐릿한 영상을 바탕으로 물체의 **모양 (기하학)**과 무게, 마찰력 같은 물성을 추정합니다.
비유: 마치 조각가가 흙더미 (카메라 영상) 를 보고 점토로 물체를 빚는 과정과 같습니다. 하지만 흙더미가 흐릿해서 모양이 제대로 나오지 않죠.
특이점: 조각가는 단순히 모양만 만드는 게 아니라, **"이 물체가 바닥에 떨어지면 어떻게 튕길까?"**를 시뮬레이션해 봅니다. 만약 시뮬레이션 결과와 실제 영상이 다르면, "아, 모양이 조금 더 둥글어야겠구나" 혹은 **"무게가 더 가벼워야겠다"**라고 수정합니다.
핵심 기술: 시각적 정보 (눈) 와 접촉 물리 (촉감) 를 결합하여, 카메라로 볼 수 없는 부분까지 물체의 정확한 모양과 성질을 찾아냅니다.
2. 심 투 리얼 (Sim2Real): "가상 세계의 지식을 현실로 가져오는 전도사"
역할: 위에서 만든 완벽한 가상 모델을 이용해, 실시간으로 물체의 위치를 예측합니다.
비유:예측형 내비게이션과 같습니다. 카메라가 "앞이 안 보여요!"라고 외칠 때, 내비게이션은 "아까 본 지도와 물리 법칙을 보면, 저기서 튕겨서 오른쪽으로 갔을 거야"라고 말합니다.
작동 방식:
카메라가 잘 보일 때: 카메라 영상을 주로 믿습니다.
카메라가 가려지거나 흔들릴 때: 물리 법칙 시뮬레이션 결과를 믿고 "물체가 이렇게 움직였을 거야"라고 추측합니다.
이 두 가지 정보를 적응형으로 섞어서 (적응적 융합) 가장 정확한 위치를 찾아냅니다.
🌟 왜 이것이 혁신적인가요? (일상적인 예시)
상황: 당신이 어두운 방에서 공을 던졌습니다. 공이 벽에 부딪히고, 다시 바닥에 튕겨 나옵니다.
기존 로봇 (눈만 가진 로봇): 공이 벽에 부딪히는 순간, 공이 어디로 튕겨 나갔는지 카메라가 잡지 못하면, 공이 사라진 줄 알고 추적을 포기합니다.
TwinTrack 로봇 (눈 + 촉감을 가진 로봇):
공이 벽에 부딪히는 순간, 카메라는 흐릿해지지만 로봇은 **"벽에 부딪혔으니 반사 법칙에 따라 저 방향으로 튕겨야 해"**라고 계산합니다.
또한, **"이 공은 고무로 만들어져서 튕기는 힘이 세겠지"**라고 물리 성질을 미리 학습해 둡니다.
그래서 카메라가 공을 다시 잡기 전까지, 로봇은 물리 법칙을 믿고 공의 경로를 정확히 예측하며 따라갑니다.
🚀 주요 성과
실시간성: 초당 20 회 이상 (20Hz) 의 속도로 물체를 쫓아갑니다. 이는 사람이 눈을 깜빡이는 속도보다 훨씬 빠릅니다.
강인함: 물체가 완전히 가려지거나 (Occlusion), 빠르게 움직여서 영상이 흐려져도 (Motion Blur) 추적하지 않습니다.
알 수 없는 물체: 사전에 물체의 모양을 알려주지 않아도, 처음 보는 물체라도 부딪히는 과정을 통해 그 모양과 성질을 스스로 배워냅니다.
🛠️ 어떻게 작동하나요? (간단한 기술 설명)
GPU 가속: 복잡한 물리 계산을 그래픽 카드 (GPU) 를 이용해 매우 빠르게 수행합니다.
잔차 학습 (Residual Learning): 카메라로 본 모양이 완벽하지 않다면, "오류 부분"을 찾아내어 수정하는 기술을 사용합니다. 마치 초상화를 그릴 때, 처음 그린 그림의 틀린 부분만 지우고 다시 그리는 것과 같습니다.
샘플링 최적화: 물리 법칙은 부딪히는 순간이 불규칙해서 수학적으로 계산하기 어렵습니다. 그래서 무수히 많은 시뮬레이션을 빠르게 돌려서 가장 가능성 높은 답을 찾아냅니다.
💡 결론
TwinTrack은 로봇에게 **"눈이 안 보일 때, 머리로 (물리 법칙으로) 상상하는 능력"**을赋予了 (부여했습니다).
이 기술이 발전하면, 로봇은 공장에서 부품이 뒤섞여도, 혹은 우리 집 거실에서 장난감을 던져도, 물체가 어디로 튕겨 나가는지 정확히 예측하며 매우 민첩하고 똑똑하게 물체를 다룰 수 있게 될 것입니다. 마치 마법처럼 보이지 않는 물체도 손끝으로 느껴가며 쫓아내는 것입니다.
TwinTrack: 접촉이 풍부한 장면에서 미지의 물체를 실시간으로 추적하기 위한 비전과 접촉 물리학의 통합
이 논문은 TwinTrack이라는 새로운 물리 인식 (physics-aware) 퍼셉션 프레임워크를 제안합니다. 이 시스템은 로봇 손가락 조작 (in-hand manipulation) 과 같은 접촉이 빈번하고 동적인 환경에서, 이전에 보지 못한 (unknown) 물체의 6-DoF 포즈를 실시간으로 강인하게 추적하는 것을 목표로 합니다.
1. 문제 정의 (Problem Statement)
기존의 비전 기반 추적 방법은 다음과 같은 한계를 가지고 있습니다:
접촉이 풍부한 장면 (Contact-Rich Scenes): 물체와 로봇, 환경 간의 빈번한 상호작용으로 인해 물체의 운동이 급격하게 변하고 (점프), 이로 인해 **모션 블러 (motion blur)**와 **심한 가림 (heavy occlusion)**이 발생합니다.
비전만으로는 한계: 이러한 조건에서는 카메라 관측이 불완전하거나 열화되어, 순수 비전 기반 추적이 실패하거나 불안정해집니다.
실시간 제약: 미지의 물체의 기하학적 구조, 물리적 속성 (질량, 관성, 마찰 계수 등) 을 실시간으로 추정하면서 동시에 포즈를 추적하는 것은 고차원 최적화 문제로 인해 매우 어렵습니다.
2. 방법론 (Methodology)
TwinTrack 은 Real2Sim (백엔드) 과 Sim2Real (프론트엔드) 두 가지 핵심 구성 요소를 순환적으로 결합하여 문제를 해결합니다.
A. Real2Sim (백엔드: 학습 및 모델 업데이트)
비전 데이터와 접촉 역학을 결합하여 물체의 기하학적 구조와 물리적 속성을 학습하고 시뮬레이션 가능한 모델을 구축합니다.
비전 기반 기하학 재구성: RGB-D 키프레임 (Keyframes) 을 사용하여 가우시안 스플래팅 (Gaussian Splatting, GS) 으로 물체의 밀도 있는 기하학적 표현을 초기화합니다. 이를 신경망 SDF(Signed Distance Function) 로 변환합니다.
접촉 역학 정렬 및 잔차 학습:
초기 비전 기하학은 노이즈와 가림으로 인해 부정확할 수 있으므로, 이를 **기하학적 잔차 (Geometry Residual, δ)**를 학습하여 보정합니다.
물체의 질량, 관성, 마찰 계수 등 물리적 파라미터와 함께 잔차를 학습하여, 실제 접촉 역학 (Contact Dynamics) 과 시뮬레이션 결과를 일치시킵니다.
최적화: 접촉 역학의 비연속성 (non-smoothness) 으로 인해 그래디언트 기반 최적화가 어렵기 때문에, **샘플링 기반 최적화 (Cross-Entropy Method, CEM)**를 사용하여 GPU 병렬 처리를 통해 파라미터를 학습합니다.
MJX 엔진: 커스텀된 MJX 물리 엔진을 사용하여 신경망 SDF 기반의 충돌 감지 및 접촉 역학 계산을 가속화합니다.
B. Sim2Real (프론트엔드: 실시간 추적)
학습된 물리 모델을 활용하여 실시간으로 6-DoF 포즈를 추정합니다.
특징 기반 비전 추적: 현재 프레임과 최적화된 키프레임 사이의 특징점 매칭을 통해 비전 기반 포즈를 추정합니다.
접촉 역학 예측: 학습된 물리 모델을 사용하여 이전 상태로부터 현재 물체의 포즈를 시뮬레이션합니다.
적응형 융합 (Adaptive Fusion):
비전 추적 결과와 물리 시뮬레이션 예측 결과를 가중치 (wk) 를 두어 융합합니다.
가중치 조절: 특징점 매칭의 신뢰도 (매칭된 점의 수) 에 따라 가중치를 동적으로 조정합니다. 가림이나 모션 블러로 비전이 열악할 때는 물리 예측의 비중을 높이고, 비전이 명확할 때는 비전 추적을 더 신뢰합니다.
3. 주요 기여 (Key Contributions)
Real2Sim-Sim2Real 폐쇄 루프 아키텍처: 비전 관측을 기반으로 접촉 역학 시뮬레이터를 정렬하고 (Real2Sim), 이를 통해 강화된 물리 지식을 실시간 추적 (Sim2Real) 에 피드백하는 통합 프레임워크를 제안했습니다.
접촉 역학에 의한 기하학 정제: 비전으로 재구성된 기하학에 **학습 가능한 잔차 (Geometry Residual)**를 도입하여, 접촉 정보를 통해 기하학적 오차를 보정하고 물리적으로 타당한 모델을 생성했습니다.
실시간 최적화 및 구현: GPU 가속화된 커스텀 MJX 엔진과 샘플링 기반 최적화를 통해, 복잡한 접촉 역학 학습과 실시간 추적을 동시에 수행하며 20Hz 이상의 처리 속도를 달성했습니다.
4. 실험 결과 (Results)
논문은 두 가지 주요 시나리오 (물체 낙하, 다중 손가락 조작) 에서 다양한 물체 (스낵 박스, 병, 3D 프린팅 오리 등) 를 사용하여 실험을 수행했습니다.
정확도: TwinTrack 은 기존 비전 기반 추적기 (Baseline) 및 물리 정보를 포함하지 않은 변형 모델들보다 ADD (Average Distance) 및 ADD-S 지표에서 훨씬 우수한 정확도를 보였습니다. 특히 가림과 모션 블러가 심한 환경에서 강인함을 입증했습니다.
물리 파라미터 학습: 질량, 관성, 마찰 계수 등 물리 파라미터가 실제 값에 수렴하는 경향을 보였으며, 기하학적 잔차 (δ) 를 학습한 모델이 시각적 기하학만 사용한 모델보다 접촉 동작을 훨씬 정확하게 시뮬레이션했습니다.
실시간 성능: 시스템은 전체적으로 초당 20 프레임 (20Hz) 이상의 속도로 실행되어 실시간 로봇 제어에 적용 가능한 수준임을 확인했습니다.
5. 의의 및 결론 (Significance)
TwinTrack 은 비전과 접촉 물리학의 상호 보완적 강점을 활용하여, 기존 비전 기반 방법론이 실패하는 고동적 접촉 환경에서도 안정적인 물체 추적을 가능하게 합니다.
로봇 조작: 복잡한 손가락 조작 (dexterous manipulation) 과 같은 작업에서 물체의 상태를 정확히 파악하여 제어 성능을 향상시킵니다.
시뮬레이션 - 현실 간극 해소: 학습된 물리 모델을 통해 시뮬레이션과 현실의 차이를 줄이고, 이를 통해 더 정확한 예측과 추적을 가능하게 합니다.
미래 작업: 현재는 단일 강체 물체와 모노큘러 RGB-D 에 국한되어 있으나, 향후 다중 물체 추적, 변형 가능 물체, 그리고 공간적 변이를 고려한 정교한 기하학 보정으로 확장할 계획입니다.
이 연구는 로봇이 불확실하고 역동적인 실제 환경에서 물체를 안정적으로 인식하고 조작할 수 있는 새로운 패러다임을 제시한다는 점에서 중요한 의의를 가집니다.