← 최신 논문
🤖 machine learning

Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models

본 논문은 문제와 동등한 재표현을 생성하여 혼합 보상과 다양한 탐색 경로를 만들어냄으로써 대규모 언어 모델 추론에서의 기울기 소실과 다양성 붕괴를 완화하고 복잡한 수학 벤치마크에서의 성능을 크게 향상시키는 Transformation-Augmented GRPO(TA-GRPO) 방법을 제안한다.

원저자: Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 학생 (대형 언어 모델) 에게 어려운 수학 문제를 푸는 법을 가르친다고 상상해 보세요. 현재 이를 수행하는 가장 최선의 방법은 GRPO라는 방법입니다. GRPO 를 한 명의 교사로 생각하세요. 이 교사는 학생에게 동일한 질문에 대한 8 가지 다른 답안을 작성하도록 요구합니다. 그 후 교사는 이 8 가지 답안을 비교합니다. 일부는 맞고 일부는 틀리면, 학생은 어떤 전략이 가장 효과적이었는지 배웁니다.

그러나 해당 논문은 이 "8 개의 답안" 방식이 학생이 함정에 빠질 수 있는 두 가지 큰 결함을 가지고 있다고 지적합니다.

  1. "전부 아니면 전무" 함정 (기울기 소실):

    • 문제: 문제가 너무 쉬우면 학생은 8 개의 답안을 모두 맞춥니다. 너무 어렵다면 8 개 모두 틀립니다. 두 경우 모두 교사는 답안 간 차이가 없으므로 학생에게 어떻게 개선해야 하는지 알려줄 수 없습니다. 마치 교사가 이유를 설명하지 않고 "잘했다!" 또는 "다시 해봐!"라고만 말하는 것과 같습니다. 학생은 유용한 피드백을 받지 못해 학습이 멈춥니다.
    • 논문의 해결책: 단순히 같은 질문을 8 번 반복하는 대신, 교사는 동일한 질문다르게 재구성하여 제시합니다 (예: 단어 순서 변경, 다른 형식 사용, 다른 관점에서 이야기 전달).
    • 비유: 친구에게 "2 더하기 2 는?"이라고 물으면 "4"라고 답합니다. 쉽죠. 이제 "사과 두 개를 가지고 있는데 두 개를 더 받으면 총 몇 개인가요?"라고 물으면 "4"라고 답할 수 있습니다. 다시 "신발 두 켤레를 가지고 있는데 신발은 총 몇 째인가요?"라고 물으면 멈춰서 더 깊이 생각할지도 모릅니다. 수학은 같지만, 질문을 하는 방식이 학생의 사고 방식을 바꿉니다. 원래 질문을 이러한 "재구성된 이웃"들과 섞으면, 학생은 전체 그룹에서 맞고 틀린 답안이 섞일 가능성이 높아지고, 교사는 이를 통해 풍부한 유용한 피드백을 얻을 수 있습니다.
  2. "에코 챔버" 함정 (다양성 붕괴):

    • 문제: 학생이 일부 답안은 맞추고 일부는 틀리더라도, 8 개의 답안 모두에서 동일한 추론 패턴에 갇히는 경향이 있습니다. 마치 학생이 문제를 푸는 한 가지 "선호" 방식을 고집하며 다른 시도를 거부하는 것과 같습니다. 새로운 전략을 탐구하는 것을 멈춥니다.
    • 논문의 해결책: 재구성된 질문들은 서로 다르게 보이므로, 학생은 이를 해결하기 위해 다양한 전략을 시도하도록 강요받습니다. 질문의 한 버전은 "공식" 접근법을 촉발하는 반면, 다른 버전은 "시각적" 접근법을 촉발할 수 있습니다.
    • 비유: 요리사에게 버거를 만들라고 요청하는 것과 같습니다. 단순히 "버거를 만들어"라고 하면 매번 똑같은 버거를 만들 수 있습니다. 하지만 "빵이 아래에 오게 버거를 만들어", "고기를 입방체로 잘라 버거를 만들어", "치즈를 먼저 녹여 버거를 만들어"라고 요청하면 요리사는 다양한 기법을 실험해야 합니다. 이는 요리사를 더 넓고 다양한 요리 스타일을 탐구하게 하여, 전반적으로 더 유능하고 다재다능한 요리사로 만듭니다.

새로운 방법 (TA-GRPO) 의 작동 원리

저자들은 새로운 방법을 TA-GRPO(Transformation-Augmented GRPO, 변환 증강 GRPO) 라고 부릅니다. 간단한 레시피는 다음과 같습니다:

  1. 수학 문제 하나를 가져옵니다.
  2. AI 도구 (GPT-4 등) 를 사용하여 해당 문제를 의미는 유지하면서 3 가지 다른 방식으로 3 번 다시 씁니다.
  3. 학생에게 원본 문제와 3 개의 새로운 버전을 풀도록 요청하여, 4 개 버전 각각에 대해 8 개의 답안을 생성하게 합니다. 총 32 개의 답안이 나옵니다!
  4. 교사는 모든 32 개의 답안을 함께 살펴 어떤 전략이 가장 효과적이었는지 파악합니다.
  5. 결정적으로, 학생이 질문의 다른 버전을 풀었더라도 교사는 원본 질문에 기반하여 학생의 뇌를 업데이트합니다. 이는 학생이 특정 문구에 대한 답변 방법뿐만 아니라 핵심 개념을 배우도록 보장합니다.

결과

이 논문은 난이도가 높은 수학 경시대회 (AMC 및 AIME 등) 를 사용하여 소형에서 중형 크기의 네 가지 다른 AI 모델을 대상으로 이를 테스트했습니다.

  • 더 높은 점수: TA-GRPO 는 표준 방법보다 일관되게 더 높은 점수를 받았습니다. 예를 들어, 가장 어려운 수학 시험에서 성공률은 평균 약 5 포인트 향상되었습니다.
  • 더 지능적인 탐구: 모델들은 단순히 운이 좋은 것이 아니라, 실제로 문제를 해결하는 더 다양한 방식을 시도했습니다.
  • 데이터 효율성: 가장 인상적인 발견은 TA-GRPO 가 2.5 배 더 많은 데이터로 모델을 학습시킨 것과 유사한 결과를 달성했다는 점입니다. 즉, 질문을 더 지능적으로 던짐으로써 모델은 추가 교과서라는 거대한 도서관을 공급받았을 때만큼이나 많이 학습했습니다.

단점

논문은 작은 비용이 하나 있음을 지적합니다. 재구성된 질문을 얻기 위해 강력한 AI(GPT-4-Turbo) 를 사용하여 다시 쓰는 데 소액의 수수료가 필요합니다. 또한, 각 단계에서 더 많은 질문을 처리해야 하므로 학습에 조금 더 시간이 걸립니다. 하지만 저자들은 성능 향상은 이러한 추가 노력의 가치가 있다고 주장합니다.

간단히 말해: TA-GRPO 는 AI 모델들이 같은 질문을 다양한 "의상"으로 반복해서 물어봄으로써 지루해하거나 갇히는 것을 막습니다. 이는 모델들이 더 창의적으로 사고하고 더 효과적으로 학습하도록 강요하여, 단순히 더 많은 데이터를 던지는 것에 비해 시간과 비용을 절약합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →