UniReflex: Plug-and-Play Force Control for Pretrained Generative Policies via Fast-Slow Reflex
UniReflex는 사전 훈련된 생성 정책에 빠름-느림 반사 메커니즘을 통한 폐루프 가변 임피던스 제어를 결합하여, 네트워크 재학습 없이도 견고한 접촉 조절과 위치 및 힘 실행 간의 매끄러운 전환을 가능하게 하는 범용적이고 플러그 앤 플레이 방식의 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 인간의 움직임을 관찰하고 모방하는 데 매우 능숙해졌습니다. 수천 개의 비디오 시연을 학습함으로써, 현대의 인공지능 시스템은 물체를 집어 올리거나, 블록을 쌓거나, 테이블 위에서 도구를 옮기는 작업을 놀라운 정밀도로 수행하는 법을 배울 수 있습니다. 흔히 생성 정책(generative policies)이라 불리는 이 시스템들은 로봇의 손이 다음에 어디로 가야 할지를 결정하는 느리고 사려 깊은 계획가처럼 작동합니다. 그러나 빈 공중을 움직이는 것과 물리적 세계와 상호작용하는 것 사이에는 상당한 격차가 존재합니다. 로봇이 표면을 닦거나, 버튼을 누르거나, 무언가를 나사처럼 돌려 끼워야 할 때, 로봇은 자신이 가하는 힘을 관리해야 합니다. 만약 로봇이 너무 세게 밀면 물체를 부수거나 미끄러질 수 있고, 너무 약하게 밀면 작업을 완료하지 못할 수도 있습니다. 현재의 로봇들은 종종 여기서 어려움을 겪는데, 이는 그들이 세상을 마치 휘거나 저항하지 않는 유리로 만들어진 것처럼 취급하며 시각적인 경로를 완벽하게 따르도록 설계되었기 때문입니다. 그들은 저항을 느끼고 실시간으로 움켜쥐는 힘이나 압력을 조調整하는 능력이 부족하며, 이는 인간에게는 자연스럽지만 오직 보는 것에만 의존하는 기계에게는 가르치기 어려운 기술입니다.
칭화 대학교와 난양 공과대학교의 연구진은 로봇의 전체 두뇌를 재구축하지 않고도 이 격차를 메울 수 있는 '유니리플렉스(UniReflex)'라는 새로운 접근 방식을 개발했습니다. 기존의 거대하고 복잡한 AI 모델을 다시 학습시키려고 노력하는 대신, 그 위에 가볍고 빠르게 반응하는 층을 추가한 것입니다. 메인 AI를 경로와 목적지를 알고 있는 운전자라고 한다면, 이 새로운 추가 요소는 자동차가 요철을 지날 때 즉각적으로 스티어링 휠을 조절하는 반사 신경과 같은 역할을 한다고 생각하면 됩니다. 이 시스템은 로봇이 가고자 하는 곳에 대한 내부적인 생각(의도)을 경청하는 동시에, 로봇의 손목에 가해지는 힘을 동시에 관상합니다. 만약 로봇이 예상치 못한 저항에 부딪히면, 이 빠른 층이 아주 짧은 순간 동안 제어권을 가져와 접촉을 부드럽게 하거나 각도를 변경하여 접촉 상태가 안정적으로 유지되도록 합니다. 결정적으로, 이 새로운 층은 기존의 AI를 재학습하거나 수정할 필요가 없으므로, 기존의 다양한 로봇 두뇌에 즉시 연결하여 사용할 수 있습니다.
연구팀은 곡면을 닦거나, 메모지에서 스티커를 떼어내거나, 충전기를 포트에 삽착하는 것과 같이 지속적인 물리적 접촉이 필요한 다양한 어려운 작업들을 대상으로 이 방법을 테스트했습니다. 실험 과정에서 그들은 작은 모델부터 수십억 개의 매개변수를 가진 거대한 모델에 이르기까지 세 가지 유형의 사전 학습된 로봇 두뇌를 사용했습니다. 로봇이 원래의 계획 능력만 가지고 작동하도록 내버려 두었을 때, 로봇은 물체에 닿는 순간 미끄러지거나 너무 많은 압력을 가하며 자주 실패했습니다. 그러나 유니리플렉스 층이 활성화되었을 때, 이러한 접촉 중심의 작업에 대한 성공률은 극적으로 높아졌습니다. 예를 들어, 스티커를 떼어내는 작업에서 성공률은 낮은 기준치에서 거의 90%까지 향상되었습니다. 이 시스템은 특히 적절한 압력을 유지하는 데 효과적이었으며, 물체가 움직이거나 표면이 고르지 않은 상황에서도 로봇의 손을 안정적으로 유지했습니다.
이 연구의 핵심적인 발견은 이러한 개선이 로봇의 원래 목표 지점 이동 정확도를 희생하지 않으면서 이루어진다는 점입니다. 이 새로운 층은 메인 플래너(planner)가 작업을 수행하게 할 때와 미세한 조정을 위해 제어권을 가져올 때를 아는 스위치 역할을 합니다. 로봇이 무언가에 닿기 전에는 원래의 AI가 의도한 대로 정확하게 움직여 높은 수준의 계획 기술을 보존합니다. 접촉이 감지되는 순간, 빠른 반사 층이 개입하여 힘을 관리함으로써 로봇이 물체에 충돌하거나 움켜쥔 힘을 놓치지 않도록 합니다. 이러한 역할의 분리는 로봇이 움직임에서는 정밀하면서도 상호작용에서는 부드러울 수 있게 합니다. 연구진은 또한 이 방식이 매우 효율적이라는 것을 발견했습니다. 거대한 메인 AI는 그대로 둔 채 작은 빠른 반사 층만을 학습시켰기 때문에, 전체 로봇 두뇌를 처음부터 다시 학습시키려는 방식에 비해 학습 시간이 25배에서 66배까지 단축되었습니다.
또한 연구는 로봇이 표면을 닦는 동안 표면이 이동하거나 부품이 약간 어긋나 있는 것과 같은 예상치 못한 방해 요소들을 이 시스템이 얼마나 잘 처리하는지 탐구했습니다. 이러한 시나리오에서 표준 로봇 모델들은 접촉을 잃고 작업을 완전히 실패하곤 했습니다. 그러나 유니리플렉스로 강화된 로봇들은 빠르게 회복하여 1초 이내에 올바른 접촉력을 다시 확립할 수 있었습니다. 이러한 회복 탄력성은 이 시스템이 이전 방식들보다 현실 세계의 예측 불가능성에 더 잘 적응할 수 있음을 시사합니다. 연구진은 이 방법이 닦기나 누르기와 같은 지속적인 작업에는 매우 효과적이지만, 좁은 소켓에 플러그를 끼우는 것처럼 조정할 수 있는 시간적 여유가 극도로 짧은 매우 빠르고 짧은 동작에는 더 많은 도전 과제에 직면한다는 점을 언급했습니다. 그럼에도 불구하고, 이 결과는 로봇에게 부족했던 촉각을 부여하여, 로봇이 완전히 재설계될 필요 없이 물리적 세계와 더 안전하고 효과적으로 상호작용할 수 있게 하는 강력한 새로운 방법을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.