← 최신 논문
💻 computer science

SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation

본 논문은 T 셔츠 접기와 같은 장시간 접촉이 많은 작업에 대한 자연어 주석을 활용하여 일관된 감독 신호를 생성하는 단계 인식형 비디오 기반 보상 모델링 프레임워크인 SARM을 제안하며, 이는 새로운 보상 정렬 행동 복제 (RA-BC) 방법을 통해 하류 정책 학습을 크게 향상시킵니다.

원저자: Qianzhong Chen, Justin Yu, Mac Schwager, Pieter Abbeel, Yide Shentu, Philipp Wu

게시일 2026-04-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Qianzhong Chen, Justin Yu, Mac Schwager, Pieter Abbeel, Yide Shentu, Philipp Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

T 셔츠를 접는 법을 로봇에게 가르친다고 상상해 보세요. 이는 단순히 "집어 올리고 내려놓는" 작업이 아닙니다. 잡기, 주름 펴기, 소매 접기, 옷을 구석에 넣기 등 긴 복잡한 춤과 같습니다. 셔츠가 구겨져 있다면 더욱 어렵습니다.

이 논문의 저자들이 직면한 문제는 로봇을 가르치는 것이 아이에게 비디오를 보여 주며 가르치는 것과 같지만, 그중 일부 비디오는 나쁘다는 것입니다.

문제: 나쁜 비디오와 혼란스러운 타이머

과거에 로봇을 가르치기 위해 연구자들은 인간이 작업을 수행하는 수 시간 분량의 비디오를 수집했습니다. 그들은 로봇에게 "비디오에서 보는 그대로 하라"고 말했습니다. 이를 **모방 학습 (Imitation Learning)**이라고 합니다.

그러나 두 가지 큰 문제가 있습니다:

  1. 비디오가 지저분합니다: 일부 인간 시연은 완벽합니다. 반면 다른 시연은 서툴거나 시간이 너무 오래 걸리거나 중간에 실패하기도 합니다. 모든 비디오를 동등하게 로봇에게 가르치면 로봇은 혼란을 겪습니다. 좋은 습관뿐만 아니라 나쁜 습관까지 배우게 됩니다.
  2. "타이머" 함정: 로봇을 가르칠 때 연구자들은 과거에 "10 초에는 여기에 있어야 하고, 20 초에는 저기에 있어야 한다"고 말했습니다. 하지만 인간은 엄격한 타이머에 따라 작동하지 않습니다. 한 사람은 5 초 만에 셔츠를 펴고, 다른 사람은 20 초가 걸릴 수도 있습니다. 단순히 초를 세기만 하면 로봇은 혼란스러운 지도를 얻게 됩니다. 셔츠가 여전히 구겨진 공 모양일지라도 10 초가 지났다는 이유만으로 셔츠가 "반쯤 접힌" 것으로 생각할 수 있습니다.

해결책: SARM(단계 인식 코치)

저자들은 **SARM(Stage-Aware Reward Modeling, 단계 인식 보상 모델링)**이라는 새로운 시스템을 개발했습니다. SARM을 로봇의 비디오를 보고 작업의 이야기를 이해하는 현명한 코치로 생각하세요. 시계만 보는 것이 아니라요.

"얼마나 많은 시간이 지났는가?"라고 묻는 대신, SARM은 **"우리는 작업의 어떤 단계에 있는가?"**라고 묻습니다.

  • 비유: 영화 대본을 상상해 보세요. 나쁜 코치는 "5 분 차에 영웅은 싸워야 한다"고 말합니다. 좋은 코치 (SARM) 는 "영웅은 현재 '싸움' 장면에 있습니다. 이기고 있습니까? 지고 있습니까? 막 싸움을 시작한 것입니까?"라고 말합니다.
  • 작동 방식: SARM은 비디오와 텍스트 설명 (예: "셔츠 잡기", "셔츠 펴기") 을 봅니다. 긴 작업을 더 작은 "장면"(단계) 으로 나눕니다. 그런 다음 해당 장면 내에서 로봇의 진행 상황을 판단합니다. 로봇이 셔츠를 성공적으로 잡았습니까? 이제 펴고 있습니까?
  • 결과: SARM은 로봇이 실수를 하는 지저분한 비디오를 보고 "아, 당신은 '펴기' 단계에 갇혀 있군요"라고 깨닫고, 단순히 "지각했으니 나쁜 점수를 받는다"고 말하는 대신 그 현실을 반영하는 점수를 줍니다.

두 번째 단계: RA-BC(스마트 필터)

SARM이 훌륭한 심판으로 훈련되면, 저자들은 이를 사용하여 **RA-BC(Reward-Aligned Behavior Cloning, 보상 정렬 행동 복제)**를 구축합니다.

  • 비유: 시험을 준비하는 학생이라고 상상해 보세요. 100 개의 연습 시험지 더미가 있습니다.
    • 구식 방법 (Vanilla BC): 교사가 실수했거나 학생이 부정행위를 한 시험지를 포함해 모든 시험지를 동등하게 공부합니다. 나쁜 예시에 시간을 낭비합니다.
    • RA-BC 방법: "현명한 코치"(SARM) 를 사용하여 먼저 연습 시험지를 채점합니다. 코치는 "이 시험지는 완벽하니 열심히 공부하세요! 이 시험지는 지저분하니 건너뛰세요. 이 시험지는 괜찮으니 조금 공부하세요"라고 말합니다.
  • 작동 방식: RA-BC 는 모든 인간 비디오를 살펴보고 SARM 으로 점수를 매긴 다음 가중치를 재조정하여 훈련을 진행합니다. 로봇에게 "완벽한 비디오에 특히 주의를 기울이고 지저분한 비디오는 무시하라"고 말합니다.

결과: T 셔츠 접기

이 팀은 실제 로봇이 T 셔츠를 접는 작업을 테스트했는데, 구겨진 셔츠로 시작하는 매우 어려운 작업도 포함되었습니다.

  • 구식 방법: 새로운 시스템 없이 로봇은 평평한 셔츠로 **8%**만 성공했고, 구겨진 셔츠로는 0% 성공했습니다. 완전히 길을 잃었습니다.
  • 신식 방법 (SARM + RA-BC):
    • 평평한 셔츠: 83% 성공.
    • 구겨진 셔츠: 67% 성공.

왜 이것이 중요한가

이 논문은 로봇이 빨래 접기나 설거지 내리기와 같은 복잡하고 긴 작업을 수행하려면 데이터의 양보다 데이터의 품질이 더 중요함을 보여줍니다. 단순히 더 많은 비디오가 필요한 것이 아니라, 어떤 비디오가 좋은지, 그리고 로봇이 과정에서 어디에 있는지 이해할 수 있는 방법이 필요합니다.

작업의 이야기를 이해하는 "단계 인식" 코치와 최고의 예시를 선택하는 "스마트 필터"를 사용하여 그들은 로봇에게 이전에는 거의 불가능했던 일을 가르쳤습니다.

간단히 말해: 그들은 로봇에게 초를 세는 것을 멈추고 작업의 이야기를 이해하도록 가르쳐, 최고의 예시에서 배우고 실수는 무시하도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →