RLDX-1 Technical Report
본 논문은 이질적인 모달리티와 전문화된 시스템 설계를 통합하여 복잡하고 접촉이 많으며 역동적인 실제 세계의 정교한 조작 작업에서 기존 비전-언어-동작 모델을 크게 능가하는 범용 로봇 정책인 RLDX-1 을 다중 스트림 액션 트랜스포머 (MSAT) 아키텍처 기반으로 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 똑똑한 로봇을 만들었는데, 이 로봇은 지시사항을 읽는 것과 그림을 보는 데 탁월합니다. 이 로봇은 '컵'이 무엇인지, '부어 넣기'가 무엇을 의미하는지 알고, 이에 대해 유창하게 이야기할 수 있습니다. 이는 마치 이론 박사 학위를 가지고 있지만 실제 세계에 대한 경험은 전혀 없는 로봇과 같습니다. 만약 이 로봇에 컨베이어 벨트 위를 움직이는 공을 잡거나, 전구를 깨뜨리지 않고 비틀어 주기를 요청한다면, 이 로봇은 운동, 기억, 촉각을 이해하지 못하기 때문에 멈춰 서 버릴지도 모릅니다.
이 논문은 이러한 문제를 해결하기 위해 설계된 새로운 로봇 '두뇌'인 RLDX-1을 소개합니다. RLDX-1을 단순히 똑똑한 독해자가 아니라, 기존 지능에 세 가지 새로운 초능력을 결합한 거장 장인으로 생각해 보세요:
1. 초능력: 운동, 기억, 그리고 촉각
- 운동 인식 (저글러):
대부분의 로봇은 정지된 사진을 보고 다음에 무엇을 해야 할지 추측합니다. 하지만 실제 세계는 움직입니다. 만약 상자가 컨베이어 벨트 위를 미끄러지고 있다면, 정지된 사진은 쓸모가 없습니다. RLDX-1은 공을 바라보는 것뿐만 아니라, 공이 공중을 날아다니는 전체 영상을 지켜보는 저글러와 같습니다. 이는 속도와 방향을 이해하게 하여, 다른 로봇들이 놓치는 움직이는 물체들을 잡을 수 있게 합니다. - 장기 기억 (셜록 홈즈):
어떤 작업들은 시간이 걸립니다. 사람이 세 개의 컵 중 하나 아래에 정육면체를 숨기고, 자리를 떠난 뒤 로봇에게 그것을 찾도록 요청하는 껌뻑이 게임을 상상해 보세요. '단기 기억'만 있는 로봇은 컵을 보지만, 사람이 어떤 컵을 만졌는지 잊어버립니다. RLDX-1은 몇 초 전이나 몇 분 전에 일어난 일들을 기록하는 '수첩'을 유지합니다. 이는 사건들의 순서를 기억하게 하여, 과거를 되돌아보아야 해결할 수 있는 퍼즐을 풀 수 있게 합니다. - 물리적 감각 (부드러운 손):
시각은 훌륭하지만, 소켓 내부나 깨지기 쉬운 달걀을 얼마나 세게 쥐고 있는지 볼 수는 없습니다. RLDX-1은 센서를 통해 '느낄' 수 있습니다. 이는 관절의 토크(비틀림 힘)와 피부의 촉각 신호를 읽는 것입니다. 이는 소켓에 플러그가 제대로 꽂혔는지, 혹은 달걀이 깨지기 직전인지 정확히 알아차리고 즉시 그립을 조절하는 눈가리개를 한 사람과 같습니다.
2. 훈련: 어떻게 배웠는가
로봇에게 이러한 기술을 몇 개의 비디오만 보여준다고 가르칠 수는 없습니다. RLDX-1은 3 단계 훈련 캠프를 거쳤습니다:
- 1 단계: 일반인 (사전 훈련): 다양한 로봇들 (팔, 손, 인간형 로봇) 이 간단한 일들을 수행하는 수백만 개의 비디오를 시청했습니다. 이를 통해 세계가 어떻게 작동하는지에 대한 폭넓은 이해를 얻었습니다.
- 2 단계: 전문가 (중간 훈련): 여기서 새로운 초능력들을 배웠습니다. 구체적으로 '운동', '기억', '촉각' 모듈로 훈련을 수행했습니다. 이를 위해 연구자들은 AI 비디오 생성기를 사용하여 수천 개의 새로운 희귀 시나리오 (예: 존재하지 않는 부엌에서 로봇이 수프를 부르는 상황) 를 만들고, 수학적으로 로봇이 해야 했던 행동을 계산해 내는 교묘한 트릭을 사용했습니다. 이는 실제 세계 데이터가 부족했던 부분을 채워 주었습니다.
- 3 단계: 정제 (사후 훈련): 마지막으로 구체적인 실제 세계 작업에서 훈련하며 자신의 실수로부터 배웠습니다. 컵을 잡는 데 실패하면 다시 시도했는데, 이는 즉각적인 피드백을 주어 성능을 향상시키는 코치와 같은 강화 학습 방법을 사용했습니다.
3. 속도: 고속 트랙에서 달리기
가장 똑똑한 두뇌라도 너무 느리면 쓸모가 없습니다. 로봇이 생각하는 데 0.1 초가 걸린다면, 행동할 때는 세상이 이미 변해 있을지도 모릅니다. 논문은 RLDX-1이 표준 시스템보다 1.6 배 더 빠르게 실행되도록 최적화되었다고 설명합니다.
- 비유: 지도를 확인하기 위해 모든 신호등마다 멈추는 배달 기사 (표준 처리) 를 상상해 보세요. RLDX-1은 전체 경로를 미리 매핑했고, 어떤 신호등이 언제 초록불로 바뀔지 정확히 알고 멈추지 않고 주행하는 기사와 같습니다. 이를 통해 빠른 속도로 움직이는 조립 라인에서도 실시간으로 반응할 수 있습니다.
4. 결과: 과녁을 맞춘 증명
연구자들은 RLDX-1을 다른 최상위 로봇 두뇌들 ( 및 GR00T N1.6 등) 과 비교하여 두 가지 방식으로 테스트했습니다:
- 시뮬레이션 (비디오 게임) 에서: RLDX-1은 복잡한 부엌 작업과 움직이는 물체 도전 과제에서 다른 로봇들을 일관되게 능가했습니다.
- 실제 세계 (시험) 에서:
- 컨베이어 벨트: 물체가 빠르게 움직일 때, RLDX-1은 **87.5%**의 성공률을 보인 반면, 다음으로 좋은 로봇은 거의 70% 의 실패율을 기록했습니다.
- 껌뻑이 게임: 기억을 바탕으로 숨겨진 물체를 찾도록 요청했을 때, RLDX-1은 **91.7%**의 정확도로 정답을 맞혔습니다. 다른 로봇들은 무작위로 추측하여 약 30% 만 정답을 맞혔습니다.
- 전구: 전구를 켜질 때까지 비틀어 주도록 요청했을 때, RLDX-1은 인간 강사가 보여줄 수 있는 것보다 적은 시도 횟수로 이를 수행하는 법을 배웠습니다.
요약
RLDX-1은 단순히 '보고 이해하는' 것을 넘어 교묘하게 행동하는 로봇 정책입니다. 강력한 시각적 두뇌에 운동, 기억, 촉각을 위한 전문 모듈을 결합하고, 실제 데이터와 AI 생성 데이터의 거대한 혼합으로 훈련함으로써, 이전의 로봇들이 어려움을 겪었던 복잡하고 역동적이며 섬세한 작업에서 인간과 유사한 기술을 달성합니다. 이는 로봇이 혼란스럽고, 움직이며, 촉각적인 실제 세계에서 우리와 진정으로 함께 일할 수 있는 중요한 한 걸음입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.