← 최신 논문
🤖 machine learning

Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training

이 논문은 대규모 언어 모델의 강화학습 사후 훈련을 최적화하기 위해 모델의 능동적 학습 프론티어 내의 프롬프트에 동적으로 계산 자원을 집중시키는 온라인 데이터 선택 프레임워크인 학습 영역 에너지 (Learning-Zone Energy, LZE) 를 소개하며, 이를 통해 데이터 사용량과 훈련 비용을 크게 줄이면서도 뛰어난 수학적 추론 성능을 달성합니다.

원저자: Peng Cui, Boyao Yang, Jun Zhu

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Peng Cui, Boyao Yang, Jun Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수학 문제 해결을 배우는 학생들을 가르치는 교사라고 상상해 보세요. 과거에는 GRPO 나 DAPO 와 같은 AI 모델들이 사용한 표준 방법은, 학생이 이미 전문가이거나 완전히 길을 잃었는지 여부와 상관없이 모든 학생에게 정확히 동일한 양의 주의와 연습 시간을 할당하는 것이었습니다.

  • 문제점: 교사는 정답을 완벽하게 알고 있는 학생들 (도움이 필요 없는) 을 도와주는 데 시간을 낭비하고, 아직 수업을 이해할 수 없을 정도로 뒤처진 학생들을 가르치려다 시간을 낭비합니다. "중간" 학생들, 즉 어려움을 겪고 있지만 방금 이해할 직전에 있는 학생들이 실제로 가장 많이 배우지만, 그들은 다른 모든 사람들과 똑같은 일반적인 대우를 받았습니다.

  • 해결책 (LZE): "Learning-Zone Energy"(LZE) 라는 이 논문의 저자들은 교실을 운영하는 더 현명한 방법을 제안합니다. 그들은 **"동적 스포트라이트"**처럼 작동하는 시스템을 만들어, "학습 구역 (Learning Zone)"에 있는 학생들을 끊임없이 찾아냅니다.

"스포트라이트"의 작동 방식

이 시스템은 AI 가 시도하는 모든 수학 문제에 대해 "학습 구역 에너지 점수 (Learning-Zone Energy Score)"를 계산합니다. 누가 스포트라이트를 받을지 결정하기 위해 세 가지 간단한 신호를 사용합니다:

  1. 난이도 앵커 ("어려운" 필터):
    수학 천재였던 학생을 상상해 보세요. 오늘 문제를 실수하더라도 시스템은 그들이 보통은 잘한다는 것을 기억합니다. 따라서 초보자인 것처럼 대우하는 데 에너지를 낭비하지 않습니다. 반대로, 항상 불가능했던 문제들을 기억합니다. 이는 시스템이 일시적인 우연에 혼동되지 않도록 방지합니다.

  2. 불확실성 미터 ("50/50" 최적 지점):
    이것이 가장 중요한 부분입니다. 시스템은 AI 가 추측하는 문제를 찾습니다.

    • AI 가 100% 맞다면? 무시하세요. (너무 쉬움).
    • AI 가 100% 틀린다면? 무시하세요. (너무 어려움).
    • AI 가 약 절반의 시간에 맞다면? 여기에 집중하세요! 이것이 바로 "학습 구역"입니다. 이것이 뇌가 늘어나고 배우는 정확한 순간입니다. 시스템은 이러한 문제에 가장 높은 에너지 점수를 부여합니다.
  3. 모멘텀 추적기 ("개선" 신호):
    때로는 학생이 중간에 갇혀 있지만 실제로는 나아지지 않고 단순히 멈춰 있는 경우가 있습니다. 시스템은 확인합니다: "이 학생은 어제의 상태와 비교해 실제로 나아지고 있는가?" 만약 나아지고 있다면 시스템은 추가적인 관심을 줍니다. 만약 제자리걸음만 하고 있다면, 다른 곳으로 이동합니다.

두 단계 전략

이 논문은 시간과 비용 (컴퓨팅 파워) 을 절약하기 위한 교묘한 두 단계 과정을 설명합니다:

  1. 후방 필터 (과제 선택):
    훈련의 모든 단계에서 시스템은 점수를 확인하기 위해 모든 문제에 대한 답을 생성합니다. 그런 다음, 실제로 AI 의 뇌를 업데이트하는 데 사용할 **상위 40%**의 문제 (학습 구역에 있는 문제) 만 선택합니다. 해당 특정 수업의 나머지 "과제"는 폐기합니다.

  2. 전방 가지치기 (쉬운 것 건너뛰기):
    만약 문제가 며칠 연속 완벽하게 해결되었다면, 시스템은 그것을 "건너뛰기 목록 (Skip List)"에 넣습니다. 시간을 절약하기 위해 해당 문제에 대한 답 생성을 완전히 중단합니다. 그러나 AI 가 해결 방법을 잊지 않았는지 확인하기 위해 가끔씩 다시 확인합니다 ("리플레이").

결과

저자들은 GSM8K 와 MATH 와 같은 수학 데이터 세트를 사용하여 15 억 파라미터 모델부터 80 억 파라미터 모델에 이르기까지 다양한 AI 모델에서 이를 테스트했습니다.

  • 효율성: 중요한 문제 40% 에만 집중함으로써 총 컴퓨팅 작업량 (FLOPs) 을 약 36% 줄였습니다.
  • 속도: AI 가 더 빠르게 학습했습니다. 어떤 경우에는 표준 방법보다 1.6 배 짧은 시간에 동일한 성능 수준에 도달했습니다.
  • 더 똑똑한 AI: AI 는 단순히 빨라진 것이 아니라, 이전에 본 적 없는 새로운 유형의 문제를 해결하는 데 더 능숙해졌습니다 (분포 외 개선). 예를 들어, 매우 어려운 수학 경시대회 (AIME25) 에서의 개선은 막대했습니다 (+45.9%).

결론

LZE 를 현명한 코치로 생각하세요. 프로를 위한 워밍업이나 초보자를 위한 강연에 시간을 낭비하지 않습니다. 대신, 운동선수가 더 강해지기 위해 약간의 고난을 겪는 "구역"에 100% 에너지를 집중합니다. 이로 인해 훈련 과정은 더 빠르고 저렴해지며, 훨씬 더 똑똑한 AI 가 탄생합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →