← 최신 논문
💻 computer science

Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

Temporal GRPO는 단계별 어드밴티지 정렬을 통해 궤적 수준의 신용 할당 모호성(credit aliasing)을 완화함으로써 시각-언어-행동 강화 학습을 향상시키며, 이를 통해 전통적인 롤아웃 수준의 방법들과 비교하여 작업 성공률과 샘플 효율성을 개선한다.

원저자: Yao Zhou, Hang Gao, Fengge Wu, Changwen Zheng, Wenwen Qiang

게시일 2026-08-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yao Zhou, Hang Gao, Fengge Wu, Changwen Zheng, Wenwen Qiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 복잡한 식사, 예를 들어 코스 요리 세 가지를 만드는 법을 가르치고 있다고 상상해 보세요. 로봇 공학 및 인공지능의 세계에서 이것은 "시각-언어-행동(Vision-Language-Action)" 학습이라고 불립니다. 로봇은 눈(시각), 명령을 이해하는 뇌(언어), 그리고 물건을 움직이는 팔(행동)을 가지고 있습니다. 보통 우리는 인간이 과업을 수행하는 영상을 보여줌으로써 로봇을 가르치지만, 이는 느리고 비용이 많이 듭니다. 더 새롭고 멋진 방법은 "강화 학습(Reinforcement Learning)"인데, 여기서 로봇은 스스로 이것저것 시도해 봅니다. 만약 성공하면 "하이파이브(보상)"를 받고, 실패하면 부드러운 "다시 해봐(벌점)"를 받습니다.

문제는 현실 세계가 매우 복잡하다는 점입니다. 로봇이 채소를 완벽하게 다지고, 양파를 볶고, 접시에 담기까지 했지만, 마지막에 고명을 떨어뜨릴 수도 있습니다. 기존의 방식에서는 컴퓨터가 그 마지막 낙하를 보고 "식사 전체를 실패했다!"라고 판단하여, 로봇이 했던 모든 행동에 대해 벌을 줍니다. 즉, 완벽했던 다지기와 볶기조차도 말이죠. 이는 마치 수학 시험에서 마지막 단계에서 작은 실수 하나를 했다는 이유만으로, 앞서 정답을 맞혔던 모든 문제에 대해 점수를 깎아버리는 것과 같습니다. 이 방식은 로봇에게 잘못된 신호를 주어, 자신이 잘한 일을 잊게 만듭니다. 이 논문은 이러한 불공정함을 해결하기 위해, 로봇이 무엇을 잘했는지 잊지 않으면서도 정확히 무엇이 잘못되었는지 배울 수 있도록 더 똑똑한 방식으로 공로를 인정하는 방법을 제안합니다.


"전부 아니면 전무(All-or-Nothing)"의 함정

기존의 로봇 훈련 방식인 **궤적 수준의 신용 할당(Trajectory-Level Credit)**을 만나보세요. 로봇이 블록을 쌓으려고 한다고 가정해 봅시다. 로봇은 첫 번째 블록을 집어 들고, 테이블로 옮기고, 쌓는 데 성공했습니다. 하지만 마지막 블록을 놓을 때 미끄러져서 탑 전체를 무너뜨리고 맙니다.

표준 방식(GRPO라고 불림)에서 컴퓨터는 최종 결과만을 봅니다. 탑이 무너졌다. 그러면 컴퓨터는 전체 일련의 행동에 대해 단 하나의 "실패 점수"를 부여합니다. 이는 로봇의 뇌에 "블록을 집지도 말고, 옮기지도 말고, 쌓지도 마라"라는 신호를 보내는 것과 같습니다. 성공적이었던 초기 동작들까지 마지막의 실패만큼이나 강하게 처벌하는 것입니다. 저자들은 이를 **궤적 수준의 신용 할당 오류(trajectory-level credit aliasing)**라고 부릅니다. 이는 마치 선생님이 학생의 에세이를 마지막 문장만 보고 채점하는 것과 같습니다. 결말이 좋지 않다는 이유로, 서론과 본론이 훌륭했더라도 에세이 전체에 F 학점을 주는 것과 같습니다. 이는 로봇을 혼란스럽게 만들고, 길고 복잡한 과업을 배우기 어렵게 만듭니다.

새로운 아이디어: 시간적 GRPO (Temporal GRPO)

이 논문은 Temporal GRPO(Group Relative Policy Optimization의 약자이지만, 여기서는 "시간 여행 선생님"이라고 부릅시다)라는 새로운 방법을 소개합니다. 이 방법은 전체 이야기를 하나의 큰 덩어리로 보는 대신, 과업을 명확하고 감지 가능한 "단계(stages)" 또는 "장(chapters)"으로 나눕니다.

로봇의 업무를 비디오 게임의 레벨처럼 생각해 보세요.

  1. 레벨 1: 빨간 컵을 집는다.
  2. 레벨 2: 컵을 선반으로 옮긴다.
  3. 레벨 3: 컵을 선반 위에 놓는다.

Temporal GRPO를 사용하면, 컴퓨터는 단순히 "게임 오버" 화면만 보는 것이 아니라, 로봇이 각 레벨을 통과하는 과정을 지켜봅니다.

  • 만약 로봇이 레벨 3에서 실패한다면(컵을 떨어뜨린다면), 컴퓨터는 이렇게 말합니다. "레벨 1과 2는 아주 잘했어! 컵을 안정적으로 유지하며 잘 옮겼어. 하지만 마지막 배치 단계에서 실수했구나."
  • 그런 다음, 레벨 1과 2에서 취한 행동에는 "하이파이브(긍정적 신용)"를 주고, 레벨 3에서의 행동에만 "다시 해봐(부정적 신용)"를 줍니다.

논문에 따르면, 이는 지침(instructions)을 바탕으로 "감지 가능한 단계" 목록을 생성함으로써 이루어집니다. 로봇의 행동은 이 단계들과 정렬됩니다. 만약 로봇이 레벨 2에 도달하기도 전에 실패했다면, 레벨 3에 도달한 로봇과 비교되지 않습니다. 그들은 오직 같은 단계에 있었던 다른 로봇들과만 비교됩니다. 이를 통해 로봇이 자신의 성공을 잊지 않으면서도 정확한 실수로부터 배울 수 있게 보장합니다.

실험 결과

연구진은 이 새로운 방법을 두 가지 서로 다른 로봇 훈련 환경인 RoboTwin 2.0과 LIBERO-Long에서 테스트했습니다.

다양한 길이(짧음, 중간, 매우 김)의 과업이 있는 RoboTwin 2.0에서, 이 새로운 방법은 현저히 우수한 성과를 보였습니다.

  • 기존 방식(표준 Trajectory-GRPO)은 평균 성공률이 약 **46.4%**였습니다.
  • 새로운 Temporal GRPO 방식은 **75.8%**의 성공률을 기록했습니다.
  • 이러한 개선은 모든 과업 길이에 걸쳐 일관되게 나타났지만, 특히 "전부 아니면 전무"의 실수가 자주 발생하는 길고 복잡한 과업에서 더욱 효과적이었습니다.

또한 연구진은 로봇이 정확히 어느 지점에서 학습하고 있는지 확인하기 위해 LIBERO-Long에서 특별 테스트를 진행했습니다. 그 결과, 기존 방식에서는 로봇이 나중의 실패 때문에 초기 단계(물건을 집는 것과 같은)의 실력이 오히려 저하된다는 것을 발견했습니다. 반면, Temporal GRPO를 사용하면 로봇은 초기 기술을 날카롭게 유지하면서, 실패가 발생하는 특정 단계에만 집중하여 학습할 수 있었습니다.

이것이 중요한 이유

이것은 단순히 로봇이 컵을 쌓는 것에 관한 문제가 아닙니다. 기계가 혼란을 겪지 않고 길고 복잡한 업무를 처리하도록 가르치는 것에 관한 것입니다. 신용을 주는 방식을 수정함으로써, 로봇은 더 빠르고 효율적으로 학습합니다. 저자들은 이 접근 방식이 로봇이 한 단계씩 차례대로 수행해야 하는 작업(예: 가구 조립이나 전체 요리 만들기)을 마스터하는 데 도움을 줄 수 있다고 제안합니다. 마지막의 작은 실수 때문에 지금까지 해온 좋은 성과를 모두 버리지 않도록 보장하기 때문입니다.

하지만 논문은 이 방법이 현재 "단계"를 명확하게 정의할 수 있는 능력에 의존하고 있다는 점을 언급합니다. 만약 과업이 너무 무질서하거나 단계가 명확하지 않다면, 시스템이 어디서 한 단계가 끝나고 다음 단계가 시작되는지 파악하는 데 어려움을 겪을 수 있습니다. 그러나 시작, 중간, 끝이 명확한 과업에 있어서, 이 "시간 여행 선생님"은 로봇을 더 똑똑하고 신뢰할 수 있게 만드는 게임 체인저가 될 것으로 보입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →