Compliance for Free: Learning Identifiable Impedance via Bilateral Teleoperation
본 논문은 기존의 관절 토크 센서를 사용하여 운영자의 강성(stiffness)을 식별하고 기록하는 4채널 양방향 텔레오퍼레이션 방식을 제안하며, 이를 통해 접촉이 빈번한 작업에 대해 어노테이션 비용 없이 방향 의존적 순응성(compliance) 레이블을 생성하도록 시각-언어-행동 모델을 미세 조정할 수 있게 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 세상을 보고 다음에 어디로 움직일지 결정하는 데 있어 놀라울 정도로 능숙해졌습니다. 현대의 인공지한능력은 지저ged한 방의 사진을 보고 로봇 팔이 컵을 어떻게 집어 올리거나 서랍을 어떻게 열어야 하는지 정확히 알려줄 수 있습니다. 하지만 이러한 기계들이 종종 실수를 저지르는 마지막 결정적인 단계가 있습니다. 바로 무언가에 닿는 순간입니다. 로봇에게 어디로 가야 할지는 알려줄 수 있지만, 얼마나 세게 밀어야 하는지는 알기 어려워합니다. 화이트보드를 긁지 않고 닦거나, 좁은 구멍에 핀을 끼우는 것과 같이 부드러운 손길이 필요한 작업은 '컴플라이언스(compliance)'라고 불리는 특성에 의존합니다. 이는 제어된 방식으로 압력에 굴복하거나 저항하는 능력을 의미합니다. 오랫동안 로봇에게 이 기술을 가르치는 것은 어려웠는데, 인간이 로봇에게 하는 행동을 기록하는 표준적인 방식들이 로봇의 최종 위치만을 기록하기 때문입니다. 이 방식들은 인간이 가했던 보이지 않는 힘을 놓치기 때문에, 로봇은 자신이 딱딱하게 움직여야 할지 혹은 부드럽게 움직여야 할지를 추측해야만 하는 상황에 놓이게 됩니다.
바르셀로나의 한 연구팀은 값비싼 힘-토크 센서나 촉각 센서를 추가하지 않고도 이 누락된 정보를 해결할 수 있는 방법을 찾아냈습니다. 그들은 특정 유형의 원격 제어 설정을 사용함으로써, 로봇 팔에 이미 존재하는 관절 토크 센서만을 이용해 인간의 의도된 목표와 가해진 힘을 수학적으로 분리할 수 있다는 것을 발견했습니다. 실험에서 인간 작업자는 자신의 팔이 두 번째의 동일한 로봇 팔을 움직이는 시스템을 통해 로봇 팔을 제어했습니다. 연구진은 작업자의 팔이 어떻게 움직였는지와 로봇 팔이 실제로 어떻게 움직였는지를 비교 관찰함으로써, 매 순간 작업자가 로bot의 강성(stiffness)을 얼마나 단단하게 혹은 부드럽게 만들고 싶어 했는지를 계산할 수 있었습니다. 그들은 이 새로운 데이터를 사용하여, "이 자국을 강하게 닦아줘"와 같은 간단한 음성 명령을 받았을 때 단순히 위치로 이동하는 것이 아니라 스스로의 강성을 그에 맞춰 조절할 수 있는 인공지능 모델을 훈련시켰습니다.
연구진이 다룬 문제의 핵심은 인간을 관찰하며 로봇을 가르치려 할 때 발생하는 혼란입니다. 예를 들어, 사람이 로봇 팔을 벽에 밀고 있다고 가정해 봅시다. 만약 로봇이 특정 지점에 도달했다면, 우리는 인간이 딱딱한 스프링을 상대로 강하게 밀었는지 아니면 부드러운 스프링을 상대로 부드럽게 밀었는지 알 수 없습니다. 두 시나리오 모두 결과적으로 로봇을 정확히 같은 위치에 도달하게 할 수 있기 때문입니다. 표준적인 기록 장치들은 최종 위치만을 보기 때문에 이 차이를 구별할 수 없습니다. 이로 인해 로봇이 움직이는 경로를 보는 것만으로는 '강하게'와 '부드럽게'라는 개념을 가르치는 것이 불가능해집니다. 연구진은 이를 해결하기 위해, 로봇이 실제로 도달한 위치와는 별개로 인간이 '의도했던' 곳이 어디인지에 대한 두 번째의 독립적인 측정이 필요하다는 것을 깨달았습니다.
이를 해결하기 위해 그들은 4채널 양방향 텔레오퍼레이션(bilateral teleoperation) 시스템을 사용했습니다. 이 설정에서는 인간이 '리더(leader)' 로봇 팔을 잡고, '팔로워(follower)' 로봇 팔이 이를 복제하려고 시도합니다. 결정적으로, 이 시스템은 단순히 위치 명령만을 보내는 것이 아니라 힘 정보를 양방향으로 주고받습니다. 팔로워 팔이 장애물에 부딪히면, 인간은 자신의 손에서 그 저항을 느낍니다. 인간이 능동적으로 접촉을 느끼고 있기 때문에, 인간 자신의 팔의 움직임은 진정한 의도를 나타내는 반면, 팔로워의 움직임은 환경에 반응하는 로봇의 모습을 보여줍니다. 연구진은 리더의 경로와 팔로워의 경로를 비교함으로써, 인간이 원하는 위치와 로봇이 실제로 있는 위치 사이의 차이를 계산할 수 있었습니다. 이 차이는 로봇이 느낀 힘(로봇의 고유한 관절 토크 센서를 사용하여 추정됨)과 결합되어, 인간이 적용한 정확한 강성을 역으로 계산할 수 있게 해주었습니다.
이 방법을 사용하여 연구팀은 인간이 화이트보드를 닦는 일련의 시연 데이터를 수집했습니다. 그들은 인간에게 화이트보드의 자국을 "보통으로" 또는 "강하게" 닦으라고 지시했습니다. 새로운 계산법 덕분에, 그들은 로봇의 손목에 특별한 힘 센서가 필요 없이 매 순간의 움직임에 적용된 강성에 대한 정밀한 라벨을 추출할 수 있었습니다. 그런 다음 그들은 이미지와 텍스트를 이해하는 인공지능의 일종인 거대 시각-언어 모델(vision-language model)을 미세 조정(fine-tuning)했습니다. 그들은 이 모델이 단순히 목표 위치뿐만 아니라, 모든 움직임에 대한 목표 강성 값까지 출력하도록 가르쳤습니다.
결과는 의도한 대로 정확히 작동했습니다. 연구진이 새로운 로봇 정책을 테스트했을 때, 로봇이 언어 명령에 따라 접촉 압력을 실제로 변화시킬 수 있음을 확인했습니다. "강하게" 닦으라는 명령을 받았을 때, 로봇은 접촉력을 평균 9.1 뉴턴(N)으로 높였습니다. 반면 "보통으로" 닦으라는 명령을 받았을 때는 그 힘을 6.4 뉴턴으로 줄였습니다. 이 변화는 통계적으로 유의미하며 일관되었습니다. 대조적으로, 동일한 연구에서 테스트된 다른 로봇 정책들은 명령에 따라 행동을 바꾸지 못했습니다. 힘 데이터를 입력값으로 받은 일부 정책들은 여전히 너무 딱딱하게 움직였고, 고정된 규칙에 기반해 강성을 추측하려 했던 다른 정책들은 전혀 적응하지 못했습니다. 새로 추출된 라벨로 훈련된 정책만이 '강하게'라는 단어를 물리적인 압력 증가와 성공적으로 연결했습니다.
연구진은 또한 로봇이 선택적 강성을 학습했음을 검증했습니다. 로봇은 단순히 모든 방향으로 똑같이 딱딱해진 것이 아니라, 경로에서 벗어나지 않도록 닦는 방향으로는 강해지고 다른 방향으로는 부드럽게 유지되는 '이방성(anisotropic)' 행동, 즉 방향에 따라 달라지는 강성을 보여주었습니다. 이러한 행동은 인간의 손이 자연스럽게 과업에 적응하는 방식을 모방한 정교한 특성입니다. 로봇은 보드의 잉크를 제거하는 데 있어 50%의 성공률을 달성했는데, 이는 테스트된 5가지 정책 중 가장 높은 수치였으며, 과도한 힘으로 인한 안전 정지 발생 횟수도 더 적었습니다.
이러한 성과에도 불구하고, 연구는 몇 가지 한계를 인정하고 있습니다. 이 방법은 로봇이 관절의 토크를 측정하는 센서를 갖추고 있어야 하는데, 이는 연구용 로봇에는 흔하지만 저렴한 상용 모델에는 항상 있는 것은 아닙니다. 또한, 힘 계산의 정확성을 보장하기 위해 보정(calibration) 과정 동안 로봇이 특정 자세를 유지해야 했습니다. 나아가, 회전 강성(즉, 로봇이 비틀림에 저항하는 정도)은 닦는 동작이 명확한 데이터를 생성할 만큼의 비틀림 동작을 포함하지 않았기 때문에 정확하게 측정하기 어려웠습니다. 연구진은 자신들의 방법이 이 특정 작업에는 잘 작동하지만, 로봇이 마주칠 수 있는 모든 유형의 접촉에 대한 보편적인 해결책은 아니라고 언급했습니다.
이 연구의 의의는 로봇에게 촉각을 가르치기 위해 값비싼 전문 힘-토크 센서나 촉각 하드웨어를 사용할 필요를 우회했다는 점에 있습니다. 기존의 로봇 팔에 있는 관절 토크 센서를 사용하고, 인간의 의도를 해석하는 영리한 수학적 접근법을 활용함으로써, 연구진은 추가 비용 없이 컴플라이언스를 위한 고품질의 훈련 데이터를 생성하는 방법을 만들어냈습니다. 이는 미래에 로봇이 움직임과 저항감을 모두 포착하는 시스템을 통해 인간을 관찰함으로써, 훨씬 더 효과적으로 섬세하거나 가변적인 힘이 필요한 작업을 다룰 수 있음을 시사합니다. 이 연구는 더 나은 로봇의 촉각을 결정하는 핵심이 더 좋은 센서가 아니라, 우리가 이미 가지고 있는 신호를 더 잘 읽어내는 방법에 있다는 것을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.