← 최신 논문
🤖 machine learning

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

RynnValue는 시간적 거리를 감독 타겟으로 사용하여 수백만 개의 지시 조건부 클립으로 확장되는 오픈 소스 로봇 가치 파운데이션 모델로, 명시적인 보상이나 진행 상태 주석 없이도 평가에서 선호 기반 방식보다 뛰어난 성능을 보이며 실제 환경에서의 정책 성공률을 크게 높입니다.

원저자: Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

게시일 2026-08-11
📖 5 분 읽기🧠 심층 분석

원저자: Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 요리법을 알려주는 대신, 그냥 "맛있게 만들어 봐!"라고 말하고 나머지는 로봇이 알아서 해결하기를 바라는 상황을 상상해 보세요. 이것이 바로 엔지니어들이 기계가 물리적 세계에서 움직이고 상호작용하는 법을 가르치려고 노력하는 과학의 한 분야인 **로봇 학습(robot learning)**의 세계입니다. 가장 큰 장애물은 대개 로봇의 '두뇌'(움직이는 능력)가 아니라, 바로 **보상(reward)**입니다. AI의 세계에서 '보상'이란 로봇에게 "잘했어!" 또는 "다시 해봐!"라고 알려주는 점수판이나 하이파이브와 같습니다. 문제는 모든 움직임에 대해 완벽한 점수판을 제공하는 것이 매우 어렵다는 점입니다. 점수판이 너무 모호하면 로봇은 혼란에 빠지고, 너무 특정 작업에만 맞춰져 있으면 로봇이 새로운 것을 배울 수 없게 됩니다. 과학자들은 어떤 로봇이 어떤 작업을 수행하더라도 적용 가능한 '범용 점수판'을 만들기 위해 노력해 왔지만, 인간이 매번 수동으로 채점하지 않고 이를 어떻게 만들 수 있을지에 대해 난관에 부딪혀 왔습니다.

여기에서 RynnValue라는 새로운 아이디어가 등장합니다. 이것을 로봇의 성과를 채점하는 새로운 방식이라고 생각해보세요. "결승선에 얼마나 가까워졌니?"라고 묻는 대신(모든 작업마다 결승선의 모습이 다르기 때문에 측정하기 어렵습니다), RynnValue는 "끝나기까지 시간이 얼마나 남았니?"라고 묻습니다. 이 모델은 로봇의 여정을 카운트다운 타이머처럼 취급합니다. 로봇이 목표에서 멀리 떨어져 있으면 타이머는 높고, 가까워지면 낮아집니다. 이 논문의 마법 같은 점은, 이 타이머를 만들기 위해 인간이 버튼을 누르며 "잘했어"라고 말할 필요가 없다는 것을 보여준다는 점입니다. 그저 시계를 보기만 하면 됩니다. 만약 로봇이 요리하는 영상이 10분에서 시작해 0분으로 끝난다면, 컴퓨터는 자동으로 5분 지점에서 로ло봇에게 5분이 남았다는 것을 알 수 있습니다. 이 간단한 트릭 덕분에 로봇은 누군가가 수동으로 채점하지 않아도 수천 시간의 영상을 통해 학습할 수 있습니다.

문제점: "진척도"의 함정

오랫동안 과학자들은 "진척도(progress)"를 측정하여 로봇을 가르치려 노력했습니다. 로봇이 블록을 쌓으려는 상황을 상상해 보세요. 진척도 모델은 로봇이 10% 완료되었는지, 50% 완료되었는지, 아니면 90% 완료되었는지를 추측하려고 할 것입니다. 하지만 여기에는 함정이 있습니다. "50% 완료되었다"는 상태는 블록을 쌓을 때와 물을 따를 때의 모습이 완전히 다릅니다. 어떤 로봇은 높이 기준으로 절반을 지나고 있을 것이고, 다른 로봇은 시간 기준으로 절반을 지나고 있을 것입니다. 이 때문에 로봇이 다양한 일을 할 수 있도록 훈련시키는 것은 매우 어렵습니다. 왜냐하면 "진척도"의 정의가 작업이 바뀔 때마다 변하기 때문입니다. 이는 마치 학생에게 최종 정답이 무엇인지 알려주지 않은 채 "너 거의 다 왔어!"라고 말하며 수학을 가르치는 것과 같습니다.

이 논문의 저자들은 이러한 "진척도" 접근 방식이 막다른 길이라고 주장합니다. 그들은 로봇이 얼마나 진행되었는지 추측하는 것을 멈추고, 작업이 끝날 때까지 남은 시간을 세기 시작해야 한다고 말합니다. 그들은 이를 **시간적 거리(temporal distance)**라고 부릅니다. 이것은 "남은 비용(cost-to-go)", 즉 단순히 "내가 끝날 때까지 시간이 얼마나 남았는가?"를 의미합니다.

해결책: RynnValue와 마법의 시계

Alibaba의 DAMO Academy와 Hupan Lab 팀은 RynnValue라는 모델을 구축했습니다. RynnValue는 진척도 퍼센트를 추측하는 대신, 로봇의 영상과 텍text 명령(예: "컵을 탁자 위에 놓으세요")을 보고 작업이 완료될 때까지 정확히 몇 초가 남았는지를 예측합니다.

여기서 영리한 부분은, 그들이 모든 영상에 대해 "5초 남음"이라고 일일이 적어줄 필요가 없었다는 점입니다. 그들은 단지 영상 파일에 이미 포함된 **타임스탬프(timestamps)**를 사용했습니다. 만약 영상이 0:00에 시작해서 0:10에 끝난다면, 컴퓨터는 0:05 지점에서 로봇에게 5초가 남았다는 것을 알 수 있습니다. 이는 그들이 단 한 명의 인간의 수동 채점 없이도 7,000시간 이상의 로봇 영상 라이브러리(약 300만 개의 클립)를 통해 모델을 훈련할 수 있었음을 의미합니다. 이는 마치 선생님이 문장을 읽을 때마다 채점하는 대신, 자막이 있는 수천 편의 영화를 보게 하여 학생을 읽기 교육하는 것과 같습니다.

교묘한 속임수 (그리고 이를 차단하는 방법)

당신은 "로봇이 단순히 시계만 보는 것이라면, 그것이 지름길을 악용하는 것 아닌가요?"라고 생각할 수도 있습니다. 과학자들도 이 점을 우려했습니다. 그들은 만약 영상을 순서대로 보여준다면, 로봇이 다음과 같은 지름길을 배울 수 있다는 것을 알고 있었습니다: "아, 영상의 세 번째 프레임은 항상 절반 정도 진행된 상태구나!" 또는 "영상이 10초짜리면 중간은 항상 5초가 남은 상태야!" 그러면 로봇은 실제 로봇 팔을 보는 대신 영상의 위치만을 보고 추측하게 될 것입니다.

이를 막기 위해 그들은 훈련 과정에 몇 가지 "혼돈"을 추가했습니다:

  1. 무작위 샘플링(Random Sampling): 그들은 영상을 직선적인 순서로 보여주지 않았습니다. 대신 영상에서 무작위 순간을 뽑아 보여줌으로써, 로봇이 프레임의 순서를 바탕으로 시간을 추측할 수 없게 만들었습니다.
  2. 셔플링(Shuffling): 그들은 때때로 영상을 거꾸로 보여주거나 뒤섞인 순서로 보여주었습니다. 만약 로봇이 "시작" 상태보다 "완료" 상태를 먼저 보게 된다면, 로봇은 "완료" 상태가 시간상으로는 더 멀리 있다는 것을 깨달아야 하며, 이를 통해 단순히 그림의 순서가 아니라 실제 로봇의 모습을 보게 됩니다.
  3. 격리(Isolation): 그들은 로봇이 현재 프레임을 예측하는 동안 다음 프레임에 대한 정답을 엿볼 수 없도록 확실히 조치했습니다. 로봇은 각 순간을 스스로 해결해야 했습니다.

결과: 효과가 있는가?

팀은 R-nnValue를 한 번도 본 적 없는 다양한 로봇과 작업에 테스트했습니다. 결과는 놀라울 정도로 좋았습니다.

  • 순위 매기기 작업: 여러 로봇의 시도를 "최고"에서 "최악"까지 순위를 매기라는 요청을 받았을 때, RynnValue는 0.675의 점수를 얻었습니다. 이는 인간이 직접 영상을 채점했던 기존의 최고 모델들(점수 0.655)보다 높은 성적이었습니다.
  • 실제 로봇: 그들은 이 모델을 가져가서 빵을 바구니에 넣거나 뒤집개로 스테이크를 옮기는 것과 같은 까다로운 작업을 수행하도록 실제 로봇을 가르쳤습니다.
    • 온라인 학습(움직이는 동안 학습) 시, RynnValue를 사용했을 때 로봇의 성공률은 **72.5%**였습니다.
    • 기존의 최선책들을 사용했을 때는 **52.5%**에 그쳤습니다.
    • 오프라인 학습(과거의 움직임 데이터베이스로부터 학습)의 경우, RynnValue는 성공률을 63.8%에서 82.5%로 끌어올렸습니다.

이것이 중요한 이유

이 논문에서 가장 흥고한 점은, 로봇을 가르치기 위해 우리가 반드시 완벽하게 채점할 필요는 없다는 사실을 시사한다는 것입니다. 우리는 단지 그들이 언제 끝났는지만 알면 됩니다. 단순하고 자동화된 "시계"인 시간을 사용함으로써, RynnValue는 로봇 보상을 위한 보편적인 언어를 만들어냅니다. 이는 두 팔을 가진 로봇이든, 바퀴 달린 로봇이든, 손을 가진 로봇이든, 작업이 끝나는 시점만 알 수 있다면 모두에게 적용됩니다.

저자들은 이것이 모든 로봇 문제를 즉각 해결하는 마법 지팡이는 아니라는 점을 주의 깊게 언급했습니다. 그들은 정밀한 정렬이 필요한 매우 까다로운 작업(예: 상자를 서랍에 넣는 작업)의 경우, 시각적 단서가 혼란스러워 모델이 여전히 다소 어려움을 겪는다는 것을 발견했습니다. 하지만 전반적으로, 그들은 **시간적 거리(temporal distance)**가 로봇을 가르치는 강력하고 확장 가능한 방법임을 보여주었습니다. 이는 "좋은 움직임이란 무엇인가?"라는 복잡하고 어려운 문제를 "시간이 얼마나 남았는가?"라는 단순하고 해결 가능한 문제로 바꾸어 놓았습니다.

요약하자면, RynnValue는 로봇에게 성적표 대신 스톱워치를 쥐여주는 것과 같습니다. 그것은 로봇 학습의 혼란스러운 세계를 단순한 카운트다운으로 바꾸어 놓으며, 실제로 기존 방식보다 더 잘 작동하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →