← 최신 논문
🤖 machine learning

F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare

본 논문은 고도 성공 업데이트의 가중치를 낮춤으로써 표준 그룹 기반 알고리즘이 공통된 해법에 과적합되고 드물지만 올바른 경로를 간과하는 경향을 완화하는 난이도 인식 강화 학습 방법인 F-GRPO 를 제안하여, 계산 비용을 증가시키지 않고 다양한 기준선에서 수학적 추론 성능을 크게 향상시킵니다.

원저자: Daniil Plyusov, Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii, Alexey Malakhov, Daria Korotyshova, Daniil Gavrilov

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daniil Plyusov, Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii, Alexey Malakhov, Daria Korotyshova, Daniil Gavrilov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare" 논문에 대한 설명을 쉬운 언어와 창의적인 비유를 사용하여 정리한 것입니다.

큰 그림: "그룹 스터디" 문제

어려운 수학 문제를 해결하는 방법을 학생 (AI 모델) 에게 가르친다고 상상해 보세요. 학습을 돕기 위해 정답 하나만 보여주는 것이 아니라, 동시에 여덟 가지 다른 시도 (한 "그룹") 를 생성하도록 요청합니다. 그런 다음 이 여덟 가지 시도를 살펴보고 비교한 뒤 학생에게 말합니다. "이봐, 대부분의 답이 틀렸지만 이 한 개는 맞았어. 다음엔 이걸 할 확률을 높여보자."

이 방법은 그룹 상대 정책 최적화 (Group-Relative Policy Optimization, GRPO) 라고 합니다. 이는 교사가 그룹이 실제로 생성한 결과에 기반하여만 피드백을 제공하는 스터디 그룹과 같습니다.

문제점:
이 논문은 그룹 크기가 너무 작으면 정답을 전혀 발견하지 못할 수 있다고 주장합니다. 하지만 그룹 크기가 "적절"할 때 (너무 작지도 않고 거대하지도 않을 때) 이상한 일이 발생합니다.

  1. 그룹이 정답을 찾습니다.
  2. 교사는 "그것은 잘했어!"라고 말합니다.
  3. 학생은 그 단 하나의 특정 정답에 너무 흥분하여 문제를 해결하는 다른 방법들을 찾으려 하지 않게 됩니다. 그들은 그 단일 해법에 집착하게 되고, 그곳에 도달하는 모든 다른 유효한 방법들을 잊어버립니다.

AI 세계에서는 이를 "분포 sharpening (Distribution Sharpening)" 이라고 부릅니다. AI 는 가장 흔한 정답 하나를 찾는 데는 매우 능숙해지지만, 희귀하거나 창의적이거나 어려운 정답을 찾는 능력을 상실합니다. 이는 가장 흔한 시험 문제의 정답지를 암기하는 학생이 교사가 까다롭고 특이한 질문을 했을 때 완전히 실패하는 것과 같습니다.

핵심 발견: "골디락스" 함정

저자들은 수학적으로 이 "망각" 현상이 그룹 크기가 중간일 때 가장 자주 발생함을 증명했습니다.

  • 작은 그룹 (크기 2): 그룹이 어떤 정답도 찾지 못하는 경우가 많습니다. 교사는 "이번엔 아무것도 작동하지 않았어"라고 말하므로, 학생은 습관을 크게 바꾸지 않습니다. 그들은 안전하고 다양하게 유지되지만, 많이 배우지는 못합니다.
  • 거대한 그룹 (크기 128 이상): 그룹은 희귀한 것까지 포함해 모든 가능한 정답을 찾습니다. 교사는 "봐라, 흔한 것뿐만 아니라 희귀한 것도 찾았잖아!"라고 말합니다. 학생은 모든 것을 배웁니다. 하지만 이는 컴퓨터에서 수행하기에 너무 비쌉니다 (돈과 시간이 너무 많이 듭니다).
  • 중간 그룹 (크기 8~16): 이것이 함정입니다. 그룹은 흔한 정답을 찾습니다 (그래서 교사가 피드백을 줍니다) 하지만, 희귀한 정답은 놓칩니다. 학생은 "흔한 답이 유일한 중요한 것"이라고 생각하며 희귀한 것들을 탐색하는 것을 멈춥니다.

비유:
1,000 개의 동전이 든 항아리에서 특정 희귀 동전을 찾는다고 상상해 보세요.

  • 2 개의 동전을 잡으면, 희귀한 것을 찾을 가능성이 낮습니다. 아무것도 배우지 못합니다.
  • 500 개의 동전을 잡으면, 희귀한 것을 확실히 찾습니다. 모든 것을 배웁니다.
  • 10 개의 동전을 잡으면, 흔한 동전은 찾을 수 있지만 희귀한 것은 놓칠 수 있습니다. 그러면 "희귀한 동전은 존재하지 않는다"고 결론 내리고 찾기를 멈춥니다.

해결책: F-GRPO ("난이도 인식" 코치)

저자들은 그룹이 많은 정답을 찾을 때 AI 가 너무 자신감을 얻어 희귀한 것들을 무시하기 시작한다는 점을 깨닫고 F-GRPO라는 해결책을 제안했습니다.

그들은 Focal Loss라는 기법에 영감을 받아 "난이도 가중치"를 추가했습니다.

작동 방식:

  • 옛 방식: 그룹이 8 개 중 5 개의 정답을 찾으면, 교사는 큰 "하이파이브"를 보내며 AI 에게 그 정답들에 집중하라고 강력히 지시합니다.
  • 새 방식 (F-GRPO): 교사는 그룹을 보고 "와, 5 개의 정답을 찾았구나! 지금 네게는 쉬운 일이야. 이 피드백의 볼륨을 낮추겠다"고 말합니다.
    • 그룹이 적은 정답을 찾으면 (힘든 싸움이었을 때), 교사는 볼륨을 높여 "이건 어려웠어, 작동한 것에 집중해!"라고 말합니다.
    • 그룹이 많은 정답을 찾으면 (쉬웠을 때), 교사는 볼륨을 낮춰 AI 가 명백한 해법에 너무 집착하지 않도록 합니다.

결과:
"쉬운" 그룹에 대한 볼륨을 낮춤으로써, AI 는 계속 탐색하도록 강요받습니다. 쉬운 것을 찾았다고 해서 희귀하고 어려운 해법을 찾는 것을 멈추지 않게 됩니다.

실험 결과

팀은 수학 문제와 논리 퍼즐을 사용하여 여러 AI 모델 (Qwen 및 Llama 등) 에서 이를 테스트했습니다.

  1. "희귀" 테스트: 1 회가 아닌 256 번의 시도를 주었을 때 AI 가 어떤 정답이라도 찾을 수 있는지 확인했습니다.
    • 수정 전: AI 가 쉬운 정답을 잘 찾게 될수록, 희귀한 정답을 찾을 수 있는 능력은 떨어졌습니다.
    • F-GRPO 적용 후: AI 는 쉬운 것들을 더 잘 찾게 되면서도 희귀한 정답을 찾을 수 있는 능력을 높게 유지했습니다.
  2. "미로" 테스트: 오직 하나의 올바른 경로만 있는 미로를 사용했습니다. 이 간단한 경우에도, 이전 방법은 운이 일찍 좋았을 때 AI 가 그 경로를 잊게 만들었습니다. F-GRPO 는 AI 를 제자리에 머물게 했습니다.
  3. 효율성: 그룹 크기를 늘리지 않고도 이러한 결과를 달성했습니다. AI 에게 100 개의 답을 생성하도록 요청할 필요가 없었습니다. 이미 생성된 8 개의 답을 어떻게 듣는지만 바꾸면 되었습니다.

요약

이 논문은 말합니다: "AI 가 명백한 정답에 너무 편안해지지 않게 하라."

AI 가 시도들의 그룹으로부터 학습할 때, 그룹 크기가 중간일 경우 희귀하고 어려운 해법들을 잊어버리는 경향이 있습니다. 저자들은 쉬운, 성공률이 높은 그룹의 중요성을 낮추는 "볼륨 조절기 (F-GRPO)"를 만들어 이를 해결했습니다. 이는 AI 가 계속 탐색하도록 강요하여, 어렵고 희귀한 문제들을 해결하는 능력을 잃지 않도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →