← 최신 논문
🤖 AI

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

GRPO는 웜 스타트(warm-starting)를 위한 구조화된 성찰 데이터 엔진과 성찰 증강 그룹 상대 정책 최적화(reflection-augmented Group Relative Policy Optimization) 알고리즘을 결합하여 도구 사용 에이전트를 향상시키는 새로운 프레임워크로, 이를 통해 에이전트가 아쉬운 실패(near-miss failures)로부터 효과적으로 학습하고 성찰 토큰과 교정 동작을 공동으로 최적화하여 기존 베이스라인을 능가할 수 있게 한다.

원저자: Binjie Zhang, Mike Zheng Shou

게시일 2026-07-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Binjie Zhang, Mike Zheng Shou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 약간은 덜렁거리는 로봇 조수에게 디지털 도구 상자(웹 검색, 이미지 판독기, 코드 실행기 등)를 사용하여 복잡한 퍼즐을 푸는 법을 가르치고 있다고 상상해 보세요. 이 로봇은 '시각-언어 모델(Vision-Language Model)'입니다. 즉, 사진을 보고 텍스트를 읽을 수 있지만, 도구를 사용하려고 할 때 가끔 실수를 저지르곤 합니다.

이 논문은 이 로봇에게 반성하는 법을 가르치는 새로운 훈련 방법인 ReGRPO(Reflection-Augmented Group Relative Policy Optimization)를 소개합니다. 여기서는 이를 쉬운 비유를 통해 설명합니다.

문제점: 실수하는 법을 모르는 로봇

현재 우리는 이 로봇들을 훈련할 때, 주로 과제를 해결하는 완벽한 예시만을 보여줍니다. 이는 마치 학생에게 모든 단계가 올바르게 수행된 정답지만 보여주는 것과 같습니다.

  • 문제점: 만약 로봇이 도구를 사용하려다 실패하면(예를 들어, 영수증을 읽으려 했으나 카메라 각도가 잘못되어 아무것도 보이지 않는 경우), 로봇은 어떻게 해야 할지 알지 못합니다. 로봇은 그저 눈을 감은 채 계속 진행하거나 포기해 버립니다.
  • 격차: 기존의 훈련 방식은 로봇에게 실수로부터 어떻게 회복하는지를 가르치지 않습니다. 오로지 모든 것이 완벽하게 흘러갈 때 성공하는 법만을 가르칩니다.

해결책: "오류-반성-교정" 루프

연구진은 로봇이 멈춰서 생각하고 스스로를 고칠 수 있도록 가르치는 시스템을 만들었습니다. 이를 **반성(Reflection)**이라고 부릅니다.

이것은 GPS 내비게이션 시스템과 같습니다:

  1. 실수 (아차 하는 순간): 로봇이 길을 꺾으려 했으나 길이 막혀 있습니다 (도구의 실패).
  2. 반성 ("아하!" 하는 순간): 단순히 충돌하는 대신, 로봇은 멈춰서 질문합니다: "왜 실패했을까? 아, 이미지의 엉뚱한 부분을 읽으려고 했구나. 증거는 텍스트 부분이 비어 있다는 것이다. 나의 계획은 카메라 박스를 오른쪽으로 이동시키는 것이다."
  3. 교정: 로봇은 즉시 새로운 계획을 시도하고 성공합니다.

구축 방법 (구조화된 데이터 엔진)

로봇에게 이 기술을 가르치기 위해, 연구진은 단순히 로봇이 자연스럽게 실패하기를 기다리지 않았습니다. 대신 시뮬레이션 실험실을 구축했습니다.

  • 그들은 완벽한 과제를 가져온 뒤 의도적으로 망가뜨렸습니다 (예: 로토에게 사진의 엉뚱한 부분을 보라고 지시함).
  • 로봇이 실패하는 과정을 지켜보며 정확히 무엇이 잘못되었는지 기록했습니다.
  • 그 후 "선생님 AI"(매우 똑똑한 모델)를 사용하여 로봇을 위한 구조화된 노트를 작성했습니다. 이 노트는 세 가지 특정 부분으로 구성됩니다:
    1. 오류 유형: 어떤 종류의 실수였는가? (예: "잘못된 위치를 보았다.")
    2. 증거: 무엇이 그것을 증명하는가? (예: "읽은 텍스트가 비어 있다.")
    3. 해결 계획: 어떻게 해결할 것인가? (예: "카메라 박스를 텍스트 쪽으로 이동시킨다.")
  • 그런 다음 로봇에게 이 "실수 + 노트 + 해결책" 시퀀스를 반복해서 보여주며 로봇이 이를 자동으로 수행하도록 학습시켰습니다.

훈련 게임 (Group Relative Policy Optimization)

로봇이 기초를 배운 후, 더 나아질 수 있도록 훈련 게임에 투입했습니다.

  • 게임: 로봇에게 동일한 퍼즐을 10번 풀도록 요청합니다.
  • 점수 산정: 어떤 때는 즉시 성공합니다. 다른 경우에는 실패하고, 잠시 멈춰 "반성"한 뒤, 문제를 해결합니다.
  • 보상: 로봇은 퍼즐을 풀면 점수를 얻지만, 불필요하게 "생각(반성)"하는 데 너무 많은 시간을 쓰면 점수를 잃습니다.
  • 목표: 로봇은 정말로 필요할 때만 멈춰서 반성하고, 그 반성을 짧고 유용하게 만드는 법을 배웁니다. 로봇은 자신의 시도를 서로 비교하며 배웁니다: "헤이, 내가 반성하고 고친 버전이 그냥 눈먼 채로 계속 갔던 버전보다 점수를 더 많이 받았어."

결과: 더 똑똑하고 자가 치유가 가능한 로봇

연구진은 이 새로운 로봇(ReGRPO)을 두 가지 어려운 과제에 대해 테스트했습니다:

  1. GTA: 영수증, 차트, UI 화면 등을 읽는 작업.
  2. GAIA: PDF나 스프레드시트와 같은 복잡한 문서를 다루는 작업.

결과:

  • 이 새로운 로봇은 이전의 오픈 소스 로봇들보다 이러한 과제들을 훨씬 더 잘 해결했습니다.
  • 로봇은 단순히 도구를 사용하는 법뿐만 아니라, 도구가 실패했을 때 회복하는 법도 더 잘하게 되었습니다.
  • 결정적으로, 최종 테스트 중에 사람이나 두 번째 컴퓨터의 도움 없이 스스로의 작업을 검토하는 법을 배웠습니다. 로봇은 실시간으로 오류를 고치기 위해 자신의 "반성"을 신뢰하는 법을 배웠습니다.

요약

요약하자면, 이 논문은 AI 에이전트가 자기 자신을 고치는 정비사처럼 행동하도록 가르칩니다. 단순히 자동차를 완벽하게 운전하는 법을 배우는 것이 아니라, 이상한 소리가 들릴 때 문제를 진단하고 즉시 고치는 법을 배우는 것입니다. 이 과정에서 감독관을 부르기 위해 차를 멈출 필요도 없습니다. 이는 모든 일이 계획대로 되지 않는 실제 세상에서 AI가 훨씬 더 신뢰할 수 있게 만들어 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →