GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents
이 논문은 컨텍스트 길이 제한을 극복하기 위해 전체 트래젝토리를 상태 - 행동 샘플로 분해하여 오픈 월드 비전 - 언어 모델 에이전트에 그룹 상대 정책 최적화 (GRPO) 를 적용하는 강화 학습 프레임워크인 GROW 를 소개하며, 이를 통해 800 개 이상의 마인크래프트 작업에서 최첨단 성능을 달성했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
복잡한 비디오 게임인 마인크래프트를 로봇에게 가르친다고 상상해 보세요. 로봇에는 카메라(눈)와 키보드 및 마우스를 조작할 수 있는 기능(손)이 있습니다. 로봇의 목표는 "집 짓기", "금 채굴하기", "괴물 처치하기"와 같은 과제를 수행하는 것입니다.
오랫동안 이러한 로봇을 가르치는 가장 좋은 방법은 **지도 미세 조정 (Supervised Fine-Tuning, SFT)**이었습니다. 이는 인간 전문가가 게임을 완벽하게 플레이하는 영상을 로봇에게 보여주고 "그들이 한 것을 정확히 따라 하라"고 말하는 것과 같습니다. 문제는 완벽한 인간 플레이 영상을 몇 시간씩 찾는 것이 비용이 많이 들며, 로봇이 단순히 영상을 외우게 되면 게임이 조금만 변해도 혼란에 빠진다는 점입니다.
그런 다음 연구원들은 강화 학습 (Reinforcement Learning, RL), 특히 GRPO라는 알고리즘을 시도했습니다. 이는 로봇이 게임을 플레이하다가 실패하고 성공하며 그 결과에서 배우는 것과 같습니다. 하지만 표준 GRPO 는 오픈 월드 게임에 적용될 때 치명적인 결함이 있었습니다. 즉, 게임 세션 전체를 하나의 단일 수업으로 취급했다는 것입니다.
문제: "너무 긴" 수업
케이크를 굽는 법을 배우려 한다고 상상해 보세요.
- 표준 GRPO는 어린 시절의 이야기, 3 일 전의 날씨 예보, 레시피, 그리고 이웃 개에 대한 이야기까지 모두 섞여 있는 500 페이지 분량의 책을 당신에게 건네는 것과 같습니다. 그리고는 "결국 당신은 좋은 케이크를 구웠으니, 이 500 페이지 책에 담긴 모든 것이 좋았다"고 말합니다.
- 논문에서는 이를 **"전체 궤적 (full trajectory)"**이라고 부릅니다. 로봇이 마인크래프트를 플레이할수록, 로봇이 보고 한 행동의 기록은 점점 길어집니다. 결국 그 "책"은 너무 거대해지고, 블록을 찾기 전 10 분 동안 돌아다니는 것과 같은 관련 없는 잡음으로 가득 차게 되어, 로봇은 압도당하고 어떤 특정 행동이 실제로 성공으로 이어졌는지 파악하지 못하게 됩니다.
해결책: GROW ("레시피 카드" 접근법)
저자들은 GROW(State-Action Modeling 과 정렬된 GRPO) 라는 새로운 프레임워크를 제안합니다.
로봇에게 500 페이지 분량의 책 전체를 주는 대신, GROW 는 게임 세션을 작고 한 입 크기의 레시피 카드로 잘게 나눕니다.
- 상태 - 행동 분해 (State-Action Decomposition): GROW 는 긴 게임 세션을 개별 순간으로 분해합니다. "블록 보기" + "마우스 클릭" + "곡괭이 타격".
- 스마트 피드백: 로봇이 결국 성공하면 GROW 는 "게임 전체가 훌륭했다"고 말하지 않습니다. 대신 승리로 이어진 특정 카드를 살펴봅니다. "금을 발견하기 5 초 전에 한 행동은 매우 좋았다. 20 분 전, 그냥 돌아다니던 때의 행동은 그저 평범했다"고 말합니다.
작동 원리 (비유)
축구 선수를 훈련시키는 코치를 상상해 보세요.
- 구식 방법 (표준 GRPO): 코치는 90 분 경기 전체를 지켜보다가 선수가 골을 넣는 것을 보고 "잘했다! 첫 분부터 마지막 분까지 모든 것이 완벽했다!"라고 외칩니다. 선수는 혼란스러워합니다. 실제로는 10 분에 거의 경기를 잃을 뻔한 끔찍한 패스를 보냈기 때문입니다.
- GROW 방식: 코치는 경기를 분해합니다. "10 분의 그 패스는 부실했다. 하지만 80 분에 한 그 드리블은 완벽했다. 그리고 89 분의 그 킥은 환상적이었다." 선수는 정확히 어떤 행동을 반복해야 하는지 배웁니다.
"마법" 같은 수학
논문은 이 "수업을 잘게 나누는" 접근법이 여전히 유효함을 확신시키기 위해 수학적 증명 (Surrogate Analysis) 을 포함하고 있습니다.
- 우려 사항: 이러한 유형의 학습을 위한 표준 수학은 보통 정확히 같은 시작점에서 시도된 서로 다른 시도들을 비교해야 합니다. GROW 는 서로 다른 모든 시간의 순간들을 비교합니다.
- 결과: 저자들은 시작점이 다르더라도 로봇이 받는 "점수"가 여전히 전략의 우수성을 정확하게 반영한다는 것을 증명했습니다. 이는 수학 시험을 채점하는 것과 같습니다. 질문이 다르더라도 최종 점수는 그 학생이 수학 실력을 향상시키고 있는지 여부를 알려줍니다.
결과: 게임 승리
팀은 동굴 탐험부터 아이템 제작 및 괴물 싸움에 이르기까지 800 개 이상의 다양한 마인크래프트 작업에서 GROW 를 테스트했습니다.
- 성공률: GROW 는 이전 방법들을 크게 능가했습니다. 예를 들어, "GUI 작업"(게임 메뉴를 사용하여 아이템 제작) 에서 성공률은 약 39% 에서 **68%**로 급증했습니다.
- 효율성: 로봇은 단순히 더 자주 승리한 것이 아니라, 더 빠르게 승리했습니다. 잡음을 무시하고 실제로 중요한 움직임에 집중하는 법을 배웠기 때문에 작업을 완료하는 데 걸리는 단계 수가 줄었습니다.
- 일반화: 로봇은 단순히 연습했던 특정 게임을 외운 것이 아닙니다. 새로운 목표 찾기나 메뉴 사용법과 같은 일반적인 기술을 배워, 아직 본 적 없는 새로운 작업에서도 성공할 수 있게 되었습니다.
요약
GROW는 오픈 월드 게임을 플레이하도록 AI 에이전트를 가르치는 더 지능적인 방법입니다. 전체 플레이 세션의 길고 messy 한 기록으로 AI 를 압도하는 대신, 게임을 작고 명확한 단계로 분해합니다. 이를 통해 AI 는 어떤 행동이 성공으로 이어지는지 정확히 이해하게 되어, 더 빠르게 배우고, 더 잘 플레이하며, 혼란스러워하지 않고 새로운 도전을 처리할 수 있게 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.