← 최신 논문
🤖 machine learning

πR2\pi\mathbf{R}^2: Reactive Real-time Flow Policies

본 논문은 새로운 백본 아키텍처를 요구하지 않으면서도 빠른 고유 수용 감각(proprioceptive)과 느린 시각적 컨디셔닝을 분리하고 지연 시간 적응형 플로우 스케줄(latency-adaptive flow schedule)을 채택함으로써, 범용 액션 청킹 플로우 정책(generalist action-chunking flow policies)의 실시간 반응성을 향상시켜 고주파 폐루프 제어를 가능하게 하고 역동적인 조작 작업에서 성공률을 크게 개선하는 프레임워크인 πR2\pi\mathbf{R}^2를 소개한다.

원저자: Sungjae Park, Shubham Tulsiani

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sungjae Park, Shubham Tulsiani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 저글링을 가르치고 있다고 상상해 보세요. 로봇 공학의 세계에서는 인간이 하는 것을 보고 거의 모든 것을 배울 수 있는 거대하고 매우 똑똑한 AI 두뇌인 '파운데이션 모델(foundation models)'을 구축하려는 큰 움직임이 있습니다. 이 두뇌는 마치 지식의 거대한 도서관과 같아서, 책(텍스트)을 읽고 사진(시각)을 보며 세상을 이해합니다. 이 두뇌가 움직이게 만들기 위해 엔지니어들은 '액션 청킹(action chunking)'이라는 기술을 사용합니다. 로봇에게 "손을 여기로, 그다음 저기로, 그다음 저기로 움직여"라고 아주 작은 단계 하나하나를 지시하는 대신, AI는 마치 요리사가 요리를 시작하기 전에 전체 레시피를 미리 써 내려가는 것처럼 미래의 움직임 한 덩어리를 한꺼번에 예측합니다. 이는 로봇의 움직임을 더 부드럽고 일관되게 만듭니다.

하지만 여기에는 함정이 있습니다. AI가 너무 크고 복잡하기 때문에, 그 전체 레시피를 만들어내는 데 시간이 오래 걸린다는 점입니다. 로봇이 레시피의 처음 몇 단계를 실행하는 동안, 세상은 변해버릴 수 있습니다. 공이 굴러가 버릴 수도 있고, 사람이 로봇의 팔을 툭 칠 수도 있습니다. 로봇이 현재 일어나고 있는 일을 보지 못한 채 예전의 레시피를 '오픈 루프(open-loop)' 방식으로 실행하는 동안에는, 즉각적으로 반응할 수 없습니다. 이는 마치 10초 전의 도로 상황만 볼 수 있는 눈가리개를 쓴 채 운전을 하는 것과 같습니다. 로봇이 진정으로 반응형이 되기를 원한다면, 지금 당장의 도로를 봐야 하지만, 거대한 두뇌는 그 레시피를 그렇게 자주 업데이트하기에는 너무 느립니다.

여기서 πR2(파이-알-스퀘어라고 발음)라는 새로운 아이디어가 등장합니다. 카네기 멜런 대학교의 연구진은 로봇의 '눈과 두뇌'(시각과 언어 부분)는 느리고 무겁지만, 로봇의 '신체 감각'(고유 수용 감각—관절이 어디에 있는지, 얼마나 빨리 움직이는지, 얼마나 세게 밀고 있는지 아는 것)은 믿을 수 없을 정도로 빠르다는 사실을 깨달았습니다. 그들은 로봇의 주의력을 두 개의 채널로 나누는 시스템을 구축했습니다. 즉, 큰 그림(물체가 어떻게 보이는지)을 위한 느리고 무거운 채널과, 신체의 즉각적인 느낌을 위한 번개처럼 빠른 채널로 나눈 것입니다.

이것을 비행기를 조종하는 조종사에 비유해 보겠습니다. 조종사는 일반적인 방향을 결정하기 위해 지도와 기상 보고서(느린 시각 부분)를 보지만, 조종간과 바람을 손으로 느끼며 미세하고 순식간에 조절을 수행합니다(빠른 고유 수용 감각 부분). πR2는 로봇도 이와 똑같이 할 수 있게 해줍니다. 이 방식은 일반적인 계획을 위한 크고 느린 레시피를 유지하면서도, 로벳이 근육을 움직일 때마다 매번 새로운 데이터로 즉각적인 '스티어링 휠(조종 핸들)' 움직임을 업데이트합니다.

연구 결과는 인상적입니다. 로봇의 현재 동작을 완성된 제품이 아닌 '진행 중인 작업'으로 취급하는 영리한 스케줄링 기법을 통해, πR2는 기존 방식보다 약 4배 더 빠르게 계획을 업데이트할 수 있었습니다. 테스트 결과, 이 방식은 거대하고 느린 AI 모델을 실행하는 중에도 약 40밀리초(초당 25회)마다 새로운 정보에 반응할 수 있게 해주었습니다.

결과는 놀랍습니다. 컴퓨터 시뮬레이션에서 이 새로운 방법은 성공률을 최대 **23%**까지 향상시켰습니다. 하지만 진짜 마법은 물리적인 세계에서 일어났습니다. 정교한 손을 가진 실제 로봇 팔에 테스트했을 때, πR2는 기존의 가장 뛰어난 방식들을 최대 **30%**까지 앞질렀습니다. 이 로봇은 떨어지는 책을 받거나, 상자를 똑바로 세우거나, 책 더미를 정리할 때 책을 떨어뜨리지 않고 해냈는데, 이는 세상이 변하는 것을 느끼고 즉각적으로 움켜쥐는 힘을 조절했기 때문입니다. 연구진은 다른 로봇들이 너무 늦게 반응하여 책을 뭉개버리는 반면, πR2는 책이 미끄러지는 것을 느끼는 순간 움켜쥐는 힘을 부드럽게 조절한다는 것을 발견했습니다. 이는 로봇이 역동적인 현실 세계의 과업을 진정으로 마스터하기 위해서는 단순히 더 똑똑해지는 것뿐만 아니라, 자신의 몸의 소리에 더 빠르게 귀를 기울여야 한다는 것을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →