← 최신 논문
💻 computer science

UniDex-ViTac: Learning Unified Visuo-Tactile Dexterous Manipulation Policy from Human Video Data

UniDex-ViTac는 인간의 비디오 시연을 활용하여 촉각 피드백이 풍부한 시뮬레이션 로봇 궤적을 생성함으로써, 실제 로봇 시연이나 미세 조정 없이도 본 적 있는 물체와 본 적 없는 물체 모두에서 시각 전용 베이스라인보다 현저히 높은 정교한 조작 성공률을 달성하는 통합 시각-촉각 정책 학습을 가능하게 하는 프레임워크이다.

원저자: Hyesung Lee, Si-Hwan Heo, Sungwook Yang

게시일 2026-09-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hyesung Lee, Si-Hwan Heo, Sungwook Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 오랫동안 공장에서 미리 프로그래밍된 경로를 따라 완벽한 정밀도로 움직이며 반복적인 작업을 수행하는 데 숙달되어 왔습니다. 하지만 로봇에게 깨지기 쉬운 달걀이나 미끄러운 병을 집을 수 있는 인간의 손과 같은 정교함을 부여하는 것은 현대 과학에서 여전히 가장 어려운 과제 중 하나입니다. 그 어려움은 단순히 물체를 보는 것뿐만 아니라, 그것을 '느끼는' 데 있습니다. 인간의 손은 우리가 무언가를 만질 때, 얼마나 세게 누르고 있는지, 그리고 움켜쥔 손이 미끄러지고 있는지 등을 즉각적으로 알려주는 센서들로 덮여 있습니다. 반면, 로봇은 자신이 보는 것을 적절한 힘으로 변환하는 데 종종 어려움을 겪으며, 잡으려는 물체를 자주 으깨버리거나 통째로 떨어뜨리곤 합니다. 로봇에게 이러한 기술을 가르치기 위해 과학자들은 대개 인간이 로봇을 물리적으로 제어하며 수집한 방대한 양의 데이터가 필요한데, 이는 느리고 비용이 많이 들며 확장하기 어려운 과정입니다. 더욱이, 사람들이 과업을 수행하는 모습을 담은 표준 비디오 영상에는 촉각이라는 결정적인 데이터가 결여되어 있어, 로봇이 보는 것과 느끼는 것 사이의 간극을 남깁니다.

한 연구팀은 이 간극을 메울 수 있는 새로운 방법을 개발하여, 로봇이 물체를 만지는 인간의 모습을 실제로 관찰하지 않고도 일반적인 인간 영상을 통해 복잡한 파지(grasping) 기술을 배울 수 있는 시스템을 만들어냈습니다. 'UniDex-ViTac'이라 불리는 이들의 접근 방식은 컴퓨터 시뮬레이션과 특정 유형의 학습을 영리하게 결组合하여 수천 번의 연습 시도를 생성합니다. 로봇의 동작을 직접 모방하려고 하는 대신, 이 시스템은 먼저 사람의 손 영상을 로봇을 위한 대략적인 가이드로 변환합니다. 그 다음, 이 가이드를 고속 가상 세계로 보내 로봇이 과업을 수행하도록 합니다. 만약 로봇이 실패하면, 특화된 학습 알고리즘이 성공할 때까지 로봇의 움직임을 미세하게 조정합니다. 결정적으로, 이 과정은 시뮬레이션 내에서 이루어지기 때문에 시스템은 로봇의 손가락 끝이 모든 성공적인 시도 동안 무엇을 느꼈는지 정확하게 기록할 수 있으며, 이를 통해 원래 영상에는 존재하지 않는 '촉각'의 데이터셋을 생성합니다. 이렇게 대량으로 수집된 시뮬레이션 경험은 단 하나의 다재다능한 로봇 두뇌를 훈련시키는 데 사용되며, 이 두뇌는 카메라와 자신의 촉각만을 사용하여 다양한 물체를 집고 들어 올릴 수 있습니다.

연구진은 이 방법을 무거운 전동 드릴부터 섬세한 머그컵에 이르기까지 열 가지의 서로 다른 물체를 대상으로 테스트했습니다. 그들은 이 물체들과 상호작용하는 사람들의 짧은 영상 50개로 시작했습니다. 이 영상들로부터 시스템은 로봇이 인간의 움직임을 자신의 기계적 신체에 맞게 적응시키는 과정을 담은 1만 개의 시뮬레이션 궤적, 즉 연습 실행을 생성했습니다. 그 결과, 각 물체에 대해 다시 훈련할 필요 없이 모든 물체를 다룰 수 있는 단 하나의 정책(policy), 즉 일련의 지침이 도출되었습니다. 가상 환경에서 이 촉각 인지 로봇은 물체를 들어 올리는 데 68.3%의 성공률을 보였습니다. 이는 시각 데이터에만 의존했던 버전의 로봇이 55.5%의 성공률을 보였던 것에 비해 유의미한 개선입니다. 이 차이는 단순히 물체를 보는 것만으로는 충분하지 않으며, 손가락이 언제 어디서 접촉하고 있는지를 아는 것이 안정적인 움켜쥐기에 필수적이라는 점을 강조합니다.

이것이 단순한 시뮬레이션의 결과물이 아님을 확인하기 위해, 연구팀은 훈련된 로봇을 실제 환경으로 가져갔습니다. 그들은 훈련 중에 보았던 6개의 물체와 한 번도 접해본 적 없는 5개의 새로운 물체를 대상으로 테스트를 진행했습니다. 추가적인 튜닝이나 실제 시연 없이도, 로봇은 110번의 물리적 시도 중 73번을 성공하여 66.4%의 성공률을 기록했습니다. 손가락 끝의 감각을 느낄 수 있는 버전의 로봇은 시각에만 의존하는 로봇보다 일관되게 더 나은 성능을 보였으며, 거의 12%포인트 더 높은 성공률을 달emat습니다. 이러한 격차는 새로운 물체에 대해서도 유효하게 나타났으며, 이는 로봇이 특정 움직임을 암기한 것이 아니라 일반적인 기술을 학습했음을 증명합니다. 시스템은 장면의 3D 뷰와 네 개의 손가락 끝 센서에서 오는 단순한 신호(각 센서가 무언가에 닿았는지 여부)를 결 조합하여 작동했습니다. 이 이진(binary) 정보는 로봇의 팔 위치에 대한 지식과 결합되어 성공적인 파지를 유도하는 데 충분했습니다.

이 연구는 시뮬레이션을 통해 누락된 촉각 데이터를 생성할 방법이 있다면, 인간의 영상만을 출발점으로 삼아 로봇에게 정교한 촉각 기술을 가르치는 것이 가능하다는 것을 시사합니다. 연구진은 현재 시스템이 상세한 압력 지도(pressure maps)가 아닌, 단순한 온-오프(on-or-off) 신호에 의존하는 매우 기초적인 형태의 촉각을 사용하고 있다고 언급했습니다. 또한 그들이 사용한 가상 세계가 현실과 완벽하게 일치하지는 않기 때문에 일부 물체가 잡기 더 어려웠다는 점도 지적했습니다. 그럼에도 불구하고, 이 연구는 명확한 방향을 제시합니다. 즉, 인간의 영상을 시뮬레이션을 유도하는 가이드로 사용함으로써 풍부한 감각 데이터를 생성한다면, 로봇은 매 시도마다 인간이 손을 잡아주지 않고도 이전에는 도달할 수 없었던 수준의 정교함으로 물리적 세계를 조작하는 법을 배울 수 있다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →