Vision-Force Admittance Learning for Peg Insertion into a Movable Hole
본 논문은 동적인 환경에서 움직이는 구멍에 대한 밀리미터 단위의 정밀한 펙-인-홀(peg-in-hole) 삽입을 가능하게 하기 위해, 파운데이션 모델으로부터의 비동기적 시각 피드백과 고주파력 제어를 융합하는 비전-포스 어드미턴스 학습(Vision-Force Admittance Learning, VFAL) 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
통제된 정적인 환경인 공장 바닥에서 로봇 팔은 정밀함의 경이로움이 될 수 있습니다. 구멍이 움직이지 않는다면, 로봇은 인간의 손으로는 따라갈 수 없는 안정성으로 나사를 집어 구멍에 박아 넣을 수 있습니다. 이것은 대상이 가만히 있는 정적 조작(static manipulation)의 영역이며, 여기서 로봇의 과제는 단순히 고정된 지점을 찾아가는 것입니다. 하지만 실제 세상은 결코 그렇게 정지해 있지 않습니다. 컨베이어 벨트를 따라 움직이는 자동차 부품이나, 울퉁불퉁한 지면 위를 달리는 차량에 장착된 로봇을 상상해 보십시오. 이러한 동적인 환경에서 대상은 움직이고 있으며, 로봇은 좁은 공간에 핀을 끼워 넣기 위해 요구되는 밀리미터 단위의 정확도를 유지하면서, 구멍을 찾는 것뿐만 아니라 그것을 추격해야 합니다. 이는 근본적인 충돌입니다. 즉, 극도의 정밀함에 대한 필요성이 움직이는 대상의 혼돈과 충돌하는 것입니다. 전통적인 로봇은 구멍이 어디에 있는지 보기 위한 느린 고수준 시각(vision)에 의존하거나, 접촉의 순간을 느끼기 위한 빠른 국소 촉각 센서(touch sensors) 중 하나에 의존하기 때문에 여기서 어려움을 겪습니다. 시각은 갑작스러운 변화에 반응하기에는 너무 느리고, 촉각만으로는 매끄러운 경로를 계획하기 위해 충분히 멀리 앞을 내다볼 수 없습니다.
뉴욕 대학교와 제너럴 모터스(GM)의 연구진은 이 문제를 해결할 새로운 방법을 개발하여, 로봇이 움직이는 구멍에 핀을 놀라운 성공률로 삽입할 수 있게 하는 시스템을 만들었습니다. 그들은 이 방법을 '비전-포스 어드미턴스 학습(Vision-Force Admittance Learning)'이라고 부릅니다. 이 시스템은 로봇이 시각과 촉각 중 하나를 선택하도록 강요하는 대신, 두 감각이 특정한 비동기적 리듬 속에서 함께 작동하도록 합니다. 로봇은 카메라를 사용하여 구멍이 어디에 있는지 추정하지만, 카메라가 느리기 때문에 이 정보는 엄격한 명령이라기보다 일반적인 가이드로 취급됩니다. 동시에 로봇은 손목에 장착된 힘 센서(force sensor)에 의존하며, 이 센서는 핀이 구멍에 닿을 때 발생하는 물리적 압력에 초당 수백 번씩 반응합니다. 혁신은 이 두 데이터 스트림이 결합되는 방식에 있습니다. 빠른 힘 센서는 핀의 정렬을 유지하는 데 필요한 즉각적이고 찰나적인 조정을 수행하고, 느린 카메라는 구멍의 전체적인 위치에 대한 로봇의 이해를 업데이트합니다. 이 시각적 업데이트는 로봇이 경로에서 너무 멀리 벗어나지 않도록 잡아주는 부드러운 교정 또는 정규화(regularizer) 역할을 하며, 그동안 힘 센서는 삽입 과정 중의 급격하고 혼란스러운 진동을 처리합니다.
이를 테스트하기 위해 연구팀은 핀을 든 로봇 팔과 움직일 수 있는 구멍이 있는 베이스를 포함한 실제 환경 실험을 구축했습니다. 그들은 산업용 조립에 흔히 쓰이는 유연한 핀이 달린 푸시너트(pushnut)라는 특수한 형태의 패스너를 사용했습니다. 설정에는 장면을 관찰하는 카메라와 접촉을 느끼는 힘 센서가 포함되었습니다. 연구진은 세 가지 시나리오, 즉 구멍이 정지해 있는 경우, 구멍이 직선으로 움직이는 경우, 그리고 모터 슬라이더 위에서 3차원으로 움직이는 경우를 테스트했습니다. 결과는 놀라웠습니다. 구멍이 움직일 때 시각에만 의존한 로봇은 대부분의 경우 핀 삽입에 실패했고, 힘 센서에만 의존한 로봇 역시 길을 잃거나 과도한 힘을 가하는 등 어려움을 겪었습니다. 그러나 두 감각을 융합한 이 새로운 시스템은 가장 까다로운 3차원 이동 시나리오에서 80%의 성공률을 달iet했습니다. 직선 이동 시나리오에서는 매번 성공했습니다.
연구진은 이러한 성공의 핵심이 단순히 두 센서를 갖는 것이 아니라, 그것들이 어떻게 타이밍을 맞추느냐에 있다는 것을 발견했습니다. 그들은 비전 데이터와 힘 데이터가 서로를 기다리도록 강제되어 전체적인 속도를 늦추는 버전과 자신들의 방식을 비교했습니다. 힘 센서가 움직임을 주도하게 하고 느린 비전 시스템이 배경에서 목표를 업데이트하게 함으로써, 로봇은 전역적인 방향 감각을 잃지 않으면서도 물리적 접촉에 즉각적으로 반응할 수 있었습니다. 또한 연구진은 시스템이 실수를 복구할 수 있다는 점도 발견했습니다. 만약 카메라가 구멍을 놓치면 로봇은 안전하게 뒤로 물러나 비전이 돌아오기를 기다립니다. 만약 핀이 걸리거나 힘 측정값이 좋지 않은 각도를 나타내면, 로봇은 핀을 들어 올렸다가 다시 시도할 수 있습니다. 이러한 적응 및 복구 능력은 움직이는 대상의 예측 불가능한 특성을 다룰 수 있을 만큼 시스템을 견고하게 만들었습니다.
이 연구는 또한 다양한 설정이 결과에 어떤 영향을 미치는지 탐구했습니다. 연구진은 카메라의 위치를 얼마나 신뢰할 것인지와 힘 센서의 피드백을 얼마나 신뢰할 것인지 사이의 균형이 결정적이라는 것을 발견했습니다. 만약 로봇이 카메라를 너무 많이 신뢰하면, 핀이 구멍의 측면에 부딪히는 물리적 현실을 무시하게 됩니다. 반대로 힘 센서를 너무 많이 신뢰하면, 구멍이 움직일 때 방향을 잃고 표류하게 됩니다. 중간 지점을 찾음으로써, 로봇은 카메라를 사용하여 올바른 경로를 유지하고 힘 센서를 사용하여 핀을 밀어 넣는 데 필요한 미세 조정을 수행하는 법을 배웠습니다. 이 접근 방식은 대상이 복잡하고 비선형적인 방식으로 움직일 때도 작동하여, 시스템이 단순하고 예측 가능한 움직임 이상을 처리할 수 있음을 입증했습니다.
궁극적으로 이 작업은 로봇이 완벽하게 정지해 있지 않은 환경에서도 섬세한 작업을 수행할 수 있도록 가르칠 수 있음을 보여줍니다. 카메라의 느리고 넓은 시야와 힘 센서의 빠르고 민감한 촉각을 결합함으로써, 연구진은 인간이 움직이는 물체를 다루는 방식, 즉 눈으로 갈 곳을 알고 손으로 길을 느끼는 방식을 모방하는 방법을 만들어냈습니다. 이 시스템은 로봇이 처음부터 완벽할 것을 요구하지 않습니다. 오히려 오류를 허용하고 실시간으로 이를 수정합니다. 현재 시스템은 로봇이 이미 핀을 집었다는 것을 가정하고 있지만, 움직이는 구멍에 핀을 삽입하는 능력은 조립 라인부터 이동 차량에 이르기까지, 환경이 로봇을 위해 멈춰 서기를 기다릴 필요 없이 역동적인 실제 환경에서 로봇이 인간과 함께 협업할 수 있는 중요한 단계입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.