← 최신 논문
🤖 machine learning

Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons

본 논문은 대규모 RBM-1M 데이터셋을 기반으로 다양한 전문가 및 비최적 궤적에서 일반화 가능한 보상 함수를 효과적으로 학습하도록 설계된 프레임 레벨 진행 감독과 궤적 비교 선호도 학습을 결합한 확장 가능한 보상 모델링 프레임워크인 Robometer를 소개합니다.

원저자: Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Ste
게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Stephen Tu, Erdem Biyik, Jesse Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 저녁 요리를 가르친다고 상상해 보세요. 과거에는 로봇을 가르치기 위해 당신이 엄격한 심판 역할을 해야 했습니다. 로봇의 움직임을 초 단위로 지켜보며 양파를 썰어내는 정도에 대해 '10 점 만점에 7.5 점'과 같은 정확한 점수를 매겨야 했습니다. 로봇이 칼을 떨어뜨리면, 정확히 언제 점수가 떨어졌는지 그리고 얼마나 떨어졌는지 파악해야 했습니다. 이는 특히 로봇이 실패할 때 수행하기 매우 어렵기 때문에, 실세계에서 로봇이 수천 번이나 시도하는 '실패' 기록들을 너무 지저분하여 채점하기 어렵다는 이유로 활용할 수 없었습니다.

ROBOMETER는 더 지능적이고 인간과 유사한 채점 방식을 통해 로봇을 가르치는 방식을 변화시키는 새로운 시스템입니다.

핵심 아이디어: 채점이 아닌 비교

모든 순간에 완벽한 점수를 매기려는 시도 대신, ROBOMETER 는 동일한 작업에 대한 두 가지 다른 시도를 비교함으로써 학습합니다.

재능 쇼 심판과 같다고 생각하세요. 참가자에게 10 점 만점에 8.2 점을 매기는 대신, 심판은 두 가지 공연을 보고 "A 공연이 B 공연보다 확실히 더 좋았다"라고 말합니다.

  • 과거의 방식: 로봇이 컵을 테이블에 올려놓는 데 실패하는 모습을 지켜보며 그 실패가 정확히 얼마나 '나쁜지' 계산해야 합니다.
  • ROBOMETER 방식: 로봇에게 완벽하게 수행하는 인간의 영상과 컵을 떨어뜨리는 로봇의 영상을 보여줍니다. 시스템은 학습합니다: "인간 영상이 더 낫다." 시스템은 그런지 알거나 구체적인 숫자를 매길 필요가 없습니다. 그저 '좋음' 대 '나쁨'의 순서만 학습하면 됩니다.

실수의 '거대 도서관' (RBM-1M)

이 시스템을 가르치기 위해 연구자들은 RBM-1M이라는 거대한 도서관을 구축했습니다.

  • 과거의 문제: 대부분의 로봇 훈련 라이브러리는 '완벽한' 영상만 보유하고 있습니다. 로봇이 컵을 떨어뜨리면 그 영상은 채점이 어렵다는 이유로 쓰레기통에 버려집니다.
  • 새로운 해결책: 이 도서관에는 단일 팔부터 인간과 유사한 손까지 21 가지 유형의 로봇에서 나온 100 만 개의 영상이 포함되어 있습니다. 결정적으로, 이 도서관은 실수, 실패, 그리고 서투른 시도로 가득 차 있습니다. ROBOMETER 가 비교를 통해 학습하기 때문에 (예: "이 실패 시도는 그 성공 시도보다 나쁘다"), 실패 영상 더미에서 실제로 학습할 수 있습니다. 이는 실패를 '하지 말아야 할 것'에 대한 귀중한 교훈으로 취급합니다.

작동 방식 (두 단계의 춤)

ROBOMETER 는 두 가지 특정 기법을 동시에 사용하여 학습합니다:

  1. '진행 상황' 확인: 단일 영상을 지켜보며 "이 작업은 얼마나 진행되었는가?" (0% 에서 100%) 를 추측해 봅니다. 이는 로봇의 시간과 진행 상황에 대한 이해를 고정합니다.
  2. '선호도' 확인: 두 영상을 나란히 지켜보며 "어느 것이 작업을 더 잘 수행했는가?"를 결정합니다. 이는 로봇이 완전한 실패라 하더라도 행동의 을 이해하도록 가르칩니다.

이 두 가지를 결합함으로써 로봇은 이전에 본 적 없는 로봇이 이전에 가본 적 없는 방에서 작업할 때조차 성공에 대한 '감각'을 학습하게 됩니다.

실제 수행 내용 (입증된 결과)

이 논문은 이 시스템이 네 가지 구체적인 실세계 시나리오에서 이전 방법들보다 더 잘 작동함을 보여줍니다:

  1. 자동 온라인 학습: 로봇이 실시간으로 작업을 학습할 때 (예: 테이블에 그릇을 올리기), ROBOMETER 는 즉각 "잘못하고 있다"고 알려주고 실수를 수정하도록 안내하는 코치 역할을 합니다. 이는 로봇이 혼잡한 부엌에서 성공률을 **20% 에서 85%**로 높이는 데 기여했으며, 반면 이전 방법들은 55% 에서 멈췄습니다.
  2. 지저분한 데이터로부터의 학습 (오프라인 RL): 완벽한 영상과 지저분한 실패 영상이 섞여 있다면, ROBOMETER 는 이를 분류하여 새로운 로봇을 가르칠 수 있습니다. 이는 기존 최고의 도구들과 비교해 성공률을 2.4 배 향상시켰습니다.
  3. 좋은 것 찾기 (데이터 필터링): 로봇에게 '냄비 저어주기'를 가르치기 위해 10 개의 최상위 클립을 찾아야 하는 거대한 영상 더미가 있다고 상상해 보세요. ROBOMETER 는 다른 검색 도구들보다 실패를 무시하고 관련성 있는 성공 클립을 찾는 데 훨씬 뛰어납니다. 이로 인해 로봇의 작업 학습 능력이 4.5 배 향상되었습니다.
  4. 실패 감지: 로봇이 멈춰 있거나, 진동하며 (앞뒤로 흔들리며 이동하지 않음) 물체를 떨어뜨릴 때, ROBOMETER 는 실패가 어떤 모습인지 미리 알려줄 필요 없이 즉시 이 실패를 감지할 수 있습니다. 이는 다른 시스템들을 능가하는 **81%**의 경우에서 실패를 정확하게 식별했습니다.

결론

ROBOMETER 는 로봇이 자신의 작업 매 초마다 인간에게 채점을 받아야 하는 것을 막아주는 '범용 보상 모델'입니다. 성공과 실패가 모두 포함된 거대한 도서관을 통해 '더 좋음' 대 '더 나쁨'을 비교하는 법을 학습함으로써, 로봇은 더 빠르게 학습하고 실수를 더 잘 처리하며, 처음부터 다시 훈련할 필요 없이 새로운 작업과 새로운 로봇 신체에 적응할 수 있도록 도와줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →