KAN We Flow? Advancing Robotic Manipulation with 3D Flow Matching via KAN & RWKV
이 논문은 무거운 UNet 백본을 새로운 RWKV-KAN 아키텍처와 행동 일관성 정규화(Action Consistency Regularization)로 대체하여, 훨씬 적은 파라미터 수로 최첨단 성능을 달성하는 로봇 조작을 위한 경량화되고 효율적인 3D 플로우 매칭(flow-matching) 정책인 KAN-We-Flow를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 오랫동안 정교한 조작이라는 예술적 과제에 어려움을 겪어왔습니다. 로봇은 무거운 물체를 직선으로 이동시키는 데는 뛰어나지만, 바늘에 실을 꿰거나, 문손잡이를 돌리거나, 노트북을 조립하는 것과 같이 인간과 같은 섬세한 손길이 필요한 작업은 여전히 난제로 남아 있습니다. 수년 동안 연구자들은 전문가가 동작을 수행하는 영상을 로봇에게 보여주는 방식인 모방 학습(imitation learning)을 통해 이러한 기술을 가르치려 노력해 왔습니다. 가장 성공적인 최근의 시도들은 일종의 추측 게임처럼 작동하는 복잡한 수학적 모델에 의존했습니다. 이 모델들은 무작위의 노이즈가 섞인 추측에서 시작하여, 추측이 명확한 움직임 계획이 될 때까지 단계별로 조금씩 정교하게 다듬어 나갑니다. 이 방법은 고품질의 움직임을 만들어내는 데는 효과적이지만, 매우 느리다는 단점이 있습니다. 로봇은 단 하나의 동작을 취할 때마다 수십 번의 정교화 단계를 거쳐야 하며, 이는 실시간 제어를 불가능하게 만드는 지연을 발생시킵니다. 이는 마치 자동차가 움직이기도 전에 다음 회전 구간을 추측하고, 추측을 수정하고, 다시 추측하고, 다시 수정하는 과정을 반복하며 운전하는 것과 같습니다.
이 속도 문제를 해결하기 위해 과학자들은 '플로우 매칭(flow matching)'이라 불리는 더 새로운 접근 방식에 주목했습니다. 이 방법은 추측을 다듬기 위해 여러 번의 작은 단계를 거치는 대신, 무작위 시작점에서 올바른 동작으로 이어지는 직접적인 경로를 학습하여, 이론적으로 로봇이 단 한 번의 단계만으로 다음 동작을 결정할 수 있게 합니다. 그러나 큰 장애물이 남아 있었습니다. 이 모델을 구동하는 컴퓨터의 두뇌가 여전히 너무 무겁고 비대하다는 점이었습니다. 이 모델들은 강력한 서버를 필요로 하는 거대하고 에너지를 많이 소비하는 구조에 의존했기에, 실제 로봇에 탑재된 소형 배터리 구동 컴퓨터에서는 실행이 불가능했습니다. 분야 전체에는 새로운 방식의 속도는 유지하면서도 기존 하드웨어의 무게를 덜어낼 방법이 필요했습니다.
새로운 연구에서 연구진은 정확히 이 균형을 달성하는 로봇 정책을 구축했습니다. 그들은 기존의 무거운 전통적 컴퓨터 구조를 훨씬 가볍고 효율적인 설계로 대체하는 'KAN-We-Flow'라는 시스템을 도입했습니다. 연구진은 두 가지 최신 인공지능 기술을 결합하여 새로운 유형의 처리 블록을 만들었습니다. 첫 번째 부분은 시간의 흐름을 처리하여, 로봇이 단순히 단일 스냅샷을 보는 것이 아니라 마치 이야기를 따라가는 것처럼 자신의 동작이 일련의 과정 속에서 어떻게 연결되는지 이해하도록 돕습니다. 두 번째 부분은 미세 조정 역할을 수행하며, 경직된 직선이 아닌 유연하고 곡선적인 패턴을 학습하는 방식을 통해 로봇의 움직임을 높은 정밀도로 조정합니다. 이 두 가지 역량을 하나로 엮음으로써, 연구팀은 이전의 최고 방식보다 86.8% 더 작으면서도 더 빠르게 실행되고 오류는 더 적은 모델을 만들어냈습니다.
이 연구의 결과는 표준 벤치마크 테스트에서 놀라운 성과를 보여주었습니다. 문 열기, 펜 돌리기, 가구 조립 등을 포함한 일련의 시뮬레이션 환경에서, 이 새로운 시스템은 기존의 방식들을 일관되게 능가했습니다. 로봇 손이 펜을 조작하는 어려운 과제에서 새 모델은 68%의 성공률을 기록했는데, 이는 이전의 선도적인 방식이 기록한 55%와 대조됩니다. 문과 관련된 또 다른 테스트에서는 83%의 성공률에 도달하여 차세대 시스템을 상당한 차이로 앞질렀습니다. 무엇보다 실제 사용 측면에서 중요한 점은 이 시스템이 믿기지 않을 정도로 빠르다는 것입니다. 이 시스템은 약 8~11밀리초 만에 새로운 동작을 결정할 수 있으며, 이는 초당 100회의 속도로 로봇의 움직임을 제어할 수 있을 만큼 충분히 빠른 속도입니다. 이 속도는 인간의 반사 신경과 맞먹는 수준으로, 로봇이 비틀거리거나 목표를 놓치게 만들었던 기존 방식들의 100밀리초 이상의 단계와 극명한 대조를 이룹니다.
로봇이 경로를 이탈하지 않도록 연구진은 안전망 역할을 하는 특정 학습 규칙을 추가했습니다. 학습 단계 동안, 시스템은 단순히 다음 동작을 예측하는 것뿐만 아니라, 현재의 경로를 앞으로 투영했을 때 정확히 전문가인 인간이 도달했을 지점에 착륙하게 된다는 것을 보장하도록 교육받습니다. 이 규칙은 특히 길고 복적인 작업 중에 로봇이 경로를 벗어나는 것을 방지합니다. 연구팀은 이 간단한 추가 사항이 의사 결정에 추가적인 시간을 소요하지 않으면서도 학습 과정을 안정시키고 최종 정확도를 높였다는 것을 발견했습니다. 전체 시스템은 단순한 물체 핸들링부터 복잡한 조립에 이르기까지 세 가지 서로 다른 과제 세트에서 테스트되었으며, 기존 모델에 필요한 컴퓨터 메모리의 극히 일부만을 사용하면서도 일관되게 가장 높은 성공률을 기록했습니다.
이 연구의 의의는 로봇 학습을 실험실에서 공장 현장이나 가정으로 옮길 수 있는 잠재력에 있습니다. 가볍고 효율적인 모델이 거대하고 느린 모델보다 뛰어날 수 있음을 증명함으로써, 연구진은 배포의 주요 장벽을 제거했습니다. 이 새로운 시스템은 실행을 위해 슈퍼컴퓨터를 필요로 하지 않습니다. 로봇 자체에 탑재될 수 있을 만큼 작기 때문입니다. 이는 로봇이 강력한 클라우드 서버에 지속적으로 연결되지 않고도, 새로운 물체와 환경에 맞춰 실시간으로 새로운 기술을 습득할 수 있음을 의미합니다. 본 연구는 로봇 조작의 미래가 더 크고 무거운 두뇌를 만드는 것이 아니라, 인간의 손처럼 빠르게 생각하고 정밀하게 행동할 수 있는 더 스마트하고 효율적인 두뇌를 만드는 데 있다는 것을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.