RIO: Flexible Real-Time Robot I/O for Cross-Embodiment Robot Learning
본 논문은 다양한 하드웨어 플랫폼에 걸친 제어 및 데이터 처리를 위한 유연하고 경량화된 구성 요소를 제공함으로써 분산된 로봇 인프라를 극복하고 최첨단 비전 - 언어 - 행동 모델의 효율적인 교차 구현 학습 및 배포를 가능하게 하는 오픈 소스 Python 프레임워크인 RIO 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 셔츠를 접거나 그릇을 닦는 것과 같은 집안일을 가르치려 한다고 상상해 보세요. 로봇 공학의 세계에서는 이는 현재 전 세계의 모든 언어를 한 아이에게 가르치려는 것과 비슷하지만, 한 가지 함정이 있습니다: 매번 다른 로봇 (다른 "몸체" 또는 "구현체") 으로 전환할 때마다, 그 로봇과 소통하는 방법을 완전히 다시 배워야 한다는 점입니다.
한 회사의 로봇 팔과 다른 회사의 카메라를 사용한다면, 이들을 함께 작동하게 만드는 코드는 종종 맞춤형 명령어들의 혼란스러운 덩어리가 됩니다. 다른 로봇 팔로 전환하고 싶다면 부품을 단순히 교체할 수 없습니다. 종종 로봇의 전체 "두뇌"를 처음부터 다시 작성해야 합니다. 이로 인해 과학자들 간의 진전 공유는 극도로 어렵고 느려집니다.
RIO(Robot I/O) 가 등장합니다.
RIO를 로봇을 위한 범용 번역기이자 모듈식 "플러그 앤 플레이" 시스템으로 생각하세요. 이는 연구자들이 매번 코드를 다시 작성하지 않고도 다양한 로봇 부품을 자유롭게 조합할 수 있게 해주는 경량 소프트웨어 툴킷입니다.
다음은 몇 가지 간단한 비유를 통해 RIO 가 어떻게 작동하는지 설명한 것입니다:
1. "레고" 접근법 (유연성)
레고 블록 상자가 있다고 상상해 보세요. 그 안에는 로봇 팔, 그리퍼 (손), 카메라, 그리고 인간이 로봇을 움직이는 데 사용하는 텔레오퍼레이션 컨트롤러가 들어 있습니다.
- RIO 없이: 블록들을 초강력 접착제로 영구적으로 붙여야 합니다. 팔을 바꾸려면 전체를 분해하고 처음부터 다시 시작해야 합니다.
- RIO 와 함께: 블록들은 표준 연결기를 갖추고 있습니다. 설정 파일만 변경하면 "프랑카 팔"을 "로보틱 그리퍼"에 연결하거나 "VR 헤드셋"을 "휴머노이드 로봇"에 연결할 수 있습니다. 핵심 로직 (로봇에게 무엇을 할지 지시하는 "두뇌") 은 정확히 동일하게 유지되며, 오직 "몸체"만 변경됩니다.
2. "범용 멀티탭" (미들웨어)
로봇들은 번개 속도로 서로 소통해야 합니다. 보통 서로 다른 부품들은 서로 다른 "언어" (프로토콜) 로 말합니다.
- RIO 의 해결책: 이는 스마트 멀티탭이나 범용 어댑터처럼 작동합니다. 로봇의 하드웨어와 소프트웨어 사이에 위치합니다. 고속 공유 메모리 연결 (같은 방에서 두 사람이 직접 속삭이는 것 같은) 이든 네트워크 연결 (인터넷을 통해 대화하는 것 같은) 이든, RIO 가 자동으로 번역을 처리합니다.这意味着 로봇의 코드 변경 없이 통신 방법을 교체할 수 있음을 의미합니다.
3. "텔레오퍼레이션" 리모컨
로봇을 가르치기 위해 인간은 종종 로봇을 "텔레오퍼레이션"합니다. 즉, 컨트롤러를 착용하고 자신의 손으로 로봇을 움직이는 것입니다.
- RIO 는 간단한 키보드와 게임패드부터 애플 비전 프로 (Apple Vision Pro) 와 같은 첨단 VR 헤드셋, 그리고 인간의 움직임을 모방하는 특수 로봇 팔에 이르기까지 다양한 컨트롤러를 지원합니다.
- 해당 논문은 동일한 소프트웨어를 사용하여 단일 로봇 팔, 양팔 로봇, 심지어 주변을 걷는 풀사이즈 휴머노이드 로봇까지 제어할 수 있음을 보여줍니다. 이는 컨트롤러와 로봇 몸체만 교체하면 가능하다는 것을 의미합니다.
4. "스마트 배달 기사" (정책 추론)
로봇이 훈련을 마치면 "컵을 집어 올리라"와 같은 결정을 내리고 움직여야 합니다. 이를 "추론 (inference)"이라고 합니다.
- RIO 는 속도가 빠르도록 설계되었습니다. "생각" (AI 모델 실행) 과 "행동" (모터에 명령 전송) 을 분리합니다.
- 논문은 RIO 를 LeRobot이라는 다른 인기 시스템과 비교했습니다. 그 결과, RIO 가 카메라에서 로봇의 손까지 명령을 전달하는 속도가 훨씬 빠르다는 것을 발견했습니다.
- LeRobot: 약 581 밀리초 소요 (로봇 속도 기준 긴 시간).
- RIO: 단 130 밀리초 소요.
- 비유: LeRobot 이 우편으로 편지를 보내는 것이라면, RIO 는 문자 메시지를 보내는 것과 같습니다. 이 속도는 타코를 뒤집거나 공을 던지는 것과 같은 동적 작업에서至关重要하며, 1 초의 지연만으로도 실패로 이어질 수 있습니다.
그들은 실제로 무엇을 했나요?
저자들은 단순히 도구를 만든 것이 아니라, 실제 세계에서 이를 테스트했습니다. 그들은 RIO 를 사용하여 다음 작업을 수행했습니다:
- 인간이 로봇을 조종하여 셔츠를 접고, 그릇을 닦고, 상자를 들어 올리는 등 가사 작업을 수행하도록 데이터를 수집했습니다.
- 이 데이터를 기반으로 π0.5 및 GR00T와 같은 고급 AI 모델을 훈련시켰습니다.
- 훈련된 모델을 세 가지 매우 다른 유형의 로봇에 배포했습니다:
- 단일 팔 로봇 (일반 공장 팔과 같은).
- 양팔 로봇 (두 개의 팔을 가진 로봇).
- 휴머노이드 (인간처럼 생겼고 걷는 로봇).
이들은 성공적으로 이러한 로봇들이 옷을 접고, 물건을 집어 올리며, 심지어 걷게 함으로써 동일한 소프트웨어 스택이 완전히 다른 하드웨어를 구동할 수 있음을 입증했습니다.
결론
해당 논문은 로봇 학습의 가장 큰 병목 현상이 단순히 더 많은 데이터나 더 나은 AI 모델을 갖는 것이 아니라 인프라라고 주장합니다. 과학자들은 현재 새로운 로봇마다 맞춤형 "배선"을 만드는 데 너무 많은 시간을 낭비하고 있습니다.
RIO는 한 번에 "배선"을 제공하는 무료 오픈소스 도구입니다. 이는 로봇 공학 커뮤니티가 바퀴를 다시 발명하는 것을 멈추고, 로봇이 어떤 모양이든 상관없이 더 복잡하고 유용한 일을 하도록 가르치는 데 집중할 수 있게 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.