← 최신 논문
📊 statistics

Scalable On-Policy Reinforcement Learning via Adaptive Batch Scaling

본 논문은 정책 안정성에 따라 배치 크기를 동적으로 조정하여 대규모 네트워크와 대규모 배치를 성공적으로 결합하고 우수한 성능을 달성하는 적응형 배치 스케일링 (ABS) 방법을 제안함으로써 대규모 배치 훈련이 강화 학습과 양립할 수 없다는 통념에 도전한다.

원저자: Jongchan Park

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jongchan Park

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"적응형 배치 확장 (Adaptive Batch Scaling) 을 통한 확장 가능한 온-폴리시 강화 학습"이라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 풀어보겠습니다.

큰 문제: AI 학습의 '골디락스' 딜레마

강아지에게 새로운 재주를 가르친다고 상상해 보세요.

  • 작은 배치 크기: 강아지에게 한 번에 한 개의 간식만 주고, 모든 동작 직후 즉시 교정해 줍니다. 강아지가 혼란스러워하고 빠르게 학습할 때 이는 훌륭합니다. 강아지가 이해하지 못하면 즉시 가르치는 방식을 바꿀 수 있습니다.
  • 큰 배치 크기: 강아지가 한 시간 동안 연습할 때까지 기다렸다가, 한꺼번에 거대한 간식 더미와 교정을 줍니다. 이는 효율적이며 강아지가 평균적으로 무엇을 하고 있는지 매우 명확한 그림을 제공하지만, 강아지가 갑자기 이상한 행동을 시작하면 반응하는 데 느립니다.

인공지능 (특히 강화 학습, RL) 의 세계에서는 오랫동안 반드시 '작은 배치' 접근법 (한 단계씩 가르치는 것) 을 고수해야 한다는 믿음이 있었습니다.

왜일까요? AI 는 끊임없이 자신의 마음을 바꾸기 때문입니다. 학습함에 따라 AI 가 보는 세계도 변합니다. 피드백을 주는 것을 너무 오래 기다리면 (큰 배치를 사용하면), AI 는 이미 너무 많이 변해서 피드백이 쓸모없거나 오히려 혼란을 줄 수 있습니다. 마치 더 이상 존재하지 않는 도로에 운전자에게 지시를 내리는 것과 같습니다.

새로운 아이디어: '적응형 배치 확장 (ABS)'

이 논문의 저자들은 "잠깐만요. AI 는 내내 같은 속도로 마음을 바꾸지 않습니다"라고 말합니다.

그들은 적응형 배치 확장 (Adaptive Batch Scaling, ABS) 이라는 방법을 제안합니다. 이는 학생의 행동이 얼마나 안정적인지에 따라 가르치는 방식을 바꾸는 똑똑한 교사라고 생각하면 됩니다.

  1. 초기 (혼란 모드): AI 가 막 시작할 때는 야생처럼 행동하며 탐구하고 큰 실수를 합니다. 행동이 초에서 초로 급격히 변합니다.
    • 전략: 작은 배치를 사용하세요. 피드백을 빠르고 빈번하게 계속 제공하세요. 이렇게 하면 AI 가 유연하게 ('가소성 있게') 유지하며 자신의 실수에 빠르게 적응할 수 있습니다.
  2. 후기 (안정 모드): AI 가 나아질수록 급격한 변동을 멈춥니다. 좋은 루틴에 정착하기 시작합니다. 행동이 예측 가능하고 안정적이 됩니다.
    • 전략: 큰 배치로 전환하세요. 이제 AI 가 안정되었으므로 더 많은 데이터를 모으기 위해 더 오래 기다릴 수 있습니다. 이는 AI 가 기술을 완성하고 최고 성능에 더 빠르게 도달하도록 돕는 초정밀 고품질 교정을 제공합니다.

비밀 도구: '행동 발산 (Behavioral Divergence)'

AI 가 언제 '혼란 모드'에서 '안정 모드'로 전환해야 하는지 어떻게 알까요? 바로 행동 발산 (Behavioral Divergence) 이라는 새로운 측정 기준을 사용합니다.

  • 비유: AI 를 춤추는 사람이라고 상상해 보세요.
    • 높은 발산: 춤추는 사람이 팔을 휘두르고, 미친 듯이 빙글빙글 돌며, 매초마다 동작을 바꿉니다. 교사는 이를 보고 "좋아, 멈추고 즉시 교정하자!"라고 말합니다 (작은 배치).
    • 낮은 발산: 춤추는 사람이 이제 매끄럽고 일관된 루틴을 수행합니다. 교사는 이를 보고 "좋아, 너는 안정적이야. 상세한 비평을 주기 전에 춤을 한 분간 전체적으로 지켜보자"라고 말합니다 (큰 배치).

이 논문은 업데이트 사이에 AI 의 '춤 동작 (행동)'이 얼마나 변하는지 정확히 측정하는 수학 공식을 소개합니다. 동작이 많이 변하면 배치 크기는 작게 유지됩니다. 동작이 안정적이면 배치 크기는 커집니다.

결과: 규칙 깨기

오랫동안 전문가들은 데이터가 너무 지저분해서 강화 학습에서 '큰 배치'를 사용할 수 없다고 생각했습니다. 또한 AI 의 '두뇌 (신경망)'를 더 크게 만들면 학습이 더 어려워질 것이라고 믿었습니다.

이 논문은 그들이 틀렸음을 증명합니다.

그들의 '적응형 배치 확장' 방법을 사용하여:

  1. 한계를 돌파했습니다: 그들은 AI 가 보통 실패하는 것보다 훨씬 더 큰 배치를 사용하여 AI 에이전트를 성공적으로 학습시켰습니다.
  2. 확장했습니다: 이러한 큰 배치와 거대한 AI 두뇌 (더 큰 신경망) 를 결합했습니다. 이미지 인식이나 언어 모델과 같은 AI 의 거의 모든 다른 분야에서는 더 큰 두뇌 + 더 큰 배치 = 더 좋은 결과가 나옵니다. 하지만 RL 에서는 이것이 불가능하다고 생각되었습니다.
  3. 결과: 그들의 방법은 표준 비디오 게임 테스트 (아타리 게임) 에서 기존의 '작은 배치 전용' 방법보다 더 잘 작동했습니다. 초반에는 더 빠르게 학습했고, 후반에는 더 강력하게 마무리했습니다.

요약

이 논문은 AI 학습에 대한 '일률적 접근법 (one size fits all)'은 잘못되었다고 주장합니다. 배치 크기를 영원히 작게 유지하도록 강요하는 대신, AI 가 더 안정적이 됨에 따라 배치 크기가 커지도록 해야 합니다. AI 의 행동이 얼마나 변하는지 측정함으로써, 시스템은 자동으로 '빠르고 유연한 학습'과 '느리고 정밀한 다듬기' 사이를 전환하여 훨씬 더 똑똑하고 큰 AI 에이전트를 학습시킬 수 있는 능력을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →