← 최신 논문
🤖 machine learning

AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback

본 논문은 표준 PPO 및 GRPO 방법보다 수학 및 STEM 벤치마크에서 LLM 추론 성능을 향상시키기 위해 그룹 수준의 통계를 활용하여 클리핑 경계와 디코딩 온도를 동적으로 조정하는 비평가 기반 강화 학습 프레임워크인 적응형 그룹 정책 최적화 (AGPO) 를 제안합니다.

원저자: Miaobo Hu, Shuhao Hu, Bokun Wang, Ruohan Wang, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao

게시일 2026-05-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Miaobo Hu, Shuhao Hu, Bokun Wang, Ruohan Wang, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 학생(대규모 언어 모델)에게 어려운 수학 문제를 푸는 법을 가르친다고 상상해 보세요. 여러분이 질문을 주고, 학생이 답을 시도하면, 맞았는지 틀렸는지 알려줍니다. 목표는 학생들이 실수에서 배우고 시간이 지남에 따라 더 나아지도록 돕는 것입니다.

이 논문은 AGPO(적응형 그룹 정책 최적화)라는 새로운 교수법을 소개합니다. 이것이 왜 특별한지 이해하려면, 구식 방식과 새 방식을 비교해 보겠습니다.

구식 방식: 경직된 코치

과거 PPO 나 GRPO 와 같은 방법들은 "고정된" 규칙 세트를 사용했습니다. 학생의 수행 상태와 상관없이 항상 동일한 두 가지 설정을 사용하는 코치를 상상해 보세요:

  1. "안전망"(클리핑): 학생이 생각에서 너무 위험할 수 있는 거대한 도약을 시도할 때, 코치는 이를 잘라냅니다. 하지만 코치는 학생이 막 시작했을 때든 거의 마스터가 되었을 때든 매번 동일한 크기의 안전망을 사용합니다.
  2. "창의성 다이얼"(온도): 학생이 답을 생성할 때, 매우 엄격하게(단 하나의 가능한 답만) 또는 매우 창의적으로(많은 엉뚱한 아이디어를 시도) 할 수 있습니다. 코치는 이 다이얼을 고정된 숫자로 설정하고 절대 변경하지 않습니다.

문제점: 이 경직된 접근 방식은 깨지기 쉽습니다.

  • 초기 단계: 학생은 혼란스럽고 올바른 경로를 찾기 위해 엉뚱하고 창의적인 아이디어를 많이 시도해야 합니다. 고정된 엄격한 설정은 탐색을 충분히 하지 못하게 막습니다.
  • 후기 단계: 학생은 답에 가까워지고 있지만 불안정합니다. 고정된 느슨한 설정은 그들이 너무 많이 뛰어다니게 하여 방금 배운 것을 잊게 만들 수 있습니다.
  • 결과: 코치는 이를 올바르게 만들기 위해 이 다이얼들을 수동으로 조정하는 데 많은 시간을 보내야 하며, 그렇게 하더라도 학생이 막히거나 충돌할 수 있습니다.

새 방식: 적응형 코치 (AGPO)

AGPO 는 학생의 수행을 실시간으로 관찰하고 즉석에서 규칙을 조정하는 코치와 같습니다. 무엇을 해야 하는지 알려줄 또 다른 "심판"(비평가) 이 필요하지 않습니다. 대신 학생이 지금 생성하는 답들의 그룹만 살펴보면 됩니다.

코치는 서로 대화하는 두 가지 주요 도구를 사용합니다:

1. "스마트 안전망"(적응형 클리핑)

고정된 안전망 대신, 코치는 학생의 답들이 얼마나 변하는지 살펴봅니다.

  • 답들이 제각각일 때(불일치가 높음) 또는 보상이 혼란스러울 때, 코치는 학생이 불확실하다는 것을 압니다. 그들은 학생이 더 큰 위험을 감수하고 더 빠르게 배우도록 안전망을 넓힙니다.
  • 답들이 혼란스럽거나 학생이 격렬하게 뛰어다닐 때(불안정성이 높음), 코치는 학생이 진전을 망칠 수 있는 거대한 실수를 하지 않도록 안전망을 조입니다.
  • 비유: 이는 서퍼가 자세를 조정하는 것과 같습니다. 파도가 잔잔하면 멀리 몸을 기울일 수 있지만, 파도가 치면 안정성을 유지하기 위해 몸을 낮춥니다.

2. "동적 창의성 다이얼"(적응형 온도)

코치는 또한 학생이 얼마나 "창의적"일 수 있는지도 조정합니다.

  • 학생이 혼란스러울 때(불확실성이 높음), 코치는 다이얼을 높은 창의성으로 올립니다. 이는 학생이 해결책을 찾기 위해 다양한 접근 방식을 시도하도록 장려합니다.
  • 학생이 자신감이 있을 때(불확실성이 낮음), 코치는 다이얼을 낮은 창의성으로 내립니다. 이는 학생이 집중하여 찾은 최선의 답에 머무르게 하고, 헤매지 않도록 돕습니다.
  • 비유: 이를 온도 조절 장치로 생각하세요. 방 (문제) 이 춥고 혼란스러우면, 코치는 열을 높여 (탐색) 상황을 따뜻하게 만듭니다. 방이 이미 뜨겁고 명확하면, 열을 낮춰 상황을 안정적으로 유지합니다.

실제 작동 방식

이 논문은 이 "적응형 코치"를 GSM8K 와 MATH 벤치마크와 같은 9 가지 다른 수학 및 과학 테스트에서 테스트했습니다. 그들은 Qwen2.5-14B 라는 강력한 모델을 사용했습니다.

결과:

  • 더 높은 점수: AGPO 로 훈련된 학생은 구식 경직된 방법 (PPO 및 GRPO) 으로 훈련된 학생들보다 훨씬 높은 점수를 받았습니다. 예를 들어, GSM8K 수학 테스트에서 **67.3%**의 정확도에 도달하여 이전 최고 기록을 깨뜨렸습니다.
  • 더 빠른 학습: 동일한 양의 "생각 시간"(토큰) 을 사용했음에도 불구하고, 실시간으로 높은 정확도 수준에 도달하는 속도가 구식 방법보다 약 1.6 배 빠릅니다.
  • 다른 모델에도 적용 가능: 그들은 이 방법을 다른 학생 모델 (Llama-3 및 Gemma-2) 에 시도했고, 마찬가지로 잘 작동했습니다. 이는 특정 모델만을 위한 트릭이 아니라 일반적인 개선임을 증명합니다.

결론

AGPO 는 AI 가 추론하도록 훈련시키는 더 똑똑한 방법입니다. 일률적인 규칙서를 사용하는 대신, 학생의 자신감과 문제의 난이도를 지속적으로 확인하며 "위험 제한"과 "창의성 수준"을 즉시 조정하는 반응형 코치처럼 작동합니다. 이는 더 빠르고 안정적인 학습으로 이어지며, 어려운 수학 및 과학 문제에서 더 나은 결과를 가져옵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →