← 최신 논문
🤖 machine learning

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

이 논문은 그룹 단위 샘플링을 단일 롤아웃 전략으로 대체하고 엄격한 토큰 수준 클리핑을 채택하여 GLM-5.2와 같은 대규모 에이전틱 모델을 복잡한 코딩 및 추론 벤치마크에서 성공적으로 학습시키는 안정적이고 효율적인 비동기 강화 학습 프레임워크인 Single-rollout Asynchronous Optimization (SAO)을 소개한다.

원저자: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

게시일 2026-07-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 학생 요리사들에게 완벽한 식사를 요리하도록 훈련시키는 팀의 헤드 셰프라고 상상해 보세요. 예전 방식(논문에서 **동기식 강화학습(Synchronous RL)**이라 부르는 것)에서는 헤드 셰프가 "모두 요리를 시작하세요!"라고 외친 뒤 기다렸습니다. 그러면 학생들은 각자의 요리를 만들기 시작합니다. 하지만 여기에 문제가 있습니다. 어떤 학생은 빠르고, 어떤 학생은 느립니다. 빠른 학생들은 요리를 마치고 나서도 가장 느린 학생이 끝날 때까지 벽을 바라보며 서서 기다려야 했습니다. 모든 학생이 다 마쳐야만 헤드 셰프가 음식을 맛보고, 피드백을 주고, 다음 할 일을 지시할 수 있었습니다. 이는 매우 비효율적입니다. 주방에 유휴 시간이 가득하게 됩니다.

이를 해결하기 위해 연구자들은 **비동기식 강화학습(Asynchronous RL)**을 시도했습니다. 이 버전에서는 학생이 요리를 마치자마자 헤드 셰프가 즉시 맛을 보고 피드백을 줍니다. 학생은 바로 다음 요리를 시작할 수 있습니다. 주방은 멈추지 않고 계속 움직입니다. 이는 훨씬 더 빠릅니다.

하지만 큰 함정이 있었습니다. 헤드 셰프가 서로 다른 시간에 요리를 시작한 학생들의 음식을 맛보고 있었기 때문에, 학생들이 따르고 있는 "레시피"가 끊임없이 변하고 있었습니다. 어떤 학생은 옛날 레시피를 바탕으로 요리하고 있고, 다른 학생은 새로운 레시피를 사용하고 있었습니다. 이러한 혼란은 훈련을 불안정하게 만들었고, 학생들은 요리가 나아지는 대신 오히려 나빠지기도 했습니다. 또한, 이 학생들을 평가하는 데 사용되는 인기 있는 방법인 GRPO는 헤드 셰프가 한 그룹의 학생들이 모두 마칠 때까지 기다려야 했기에, 다시 '기다림의 문제'를 불러왔습니다.

이 논문의 저자들은 세 가지 영리한 기술을 통해 이 혼란을 해결한 **SAO (Single-Rollout Asynchronous Optimization)**라는 새로운 방법을 소개했습니다.

1. "즉각적인 피드백" 규칙 (Single-Rollout)

한 그룹의 학생들이 배치를 마칠 때까지 기다리는 대신, SAO는 다음과 같이 말합니다. "학생 한 명이 요리를 마치면 즉시 채점하세요."

  • 비유: 게임에서 파티원 전체가 끝날 때까지 기다리는 것이 아니라, 레벨을 클리어하자마자 점수를 받는 것과 같습니다. 이는 "가장 느린 사람을 기다리는" 지연을 제거합니다.
  • 해결하는 문제: 그룹이 가장 느린 구성원을 기다려야 하는 상황을 막아, 훈련이 풀 스피드로 계속 진행되도록 합니다.

2. "엄격한 안전망" (Double-Sided Clipping)

학생들이 너무 빠르게 움직이고 레시피가 계속 변하기 때문에, 학생들이 너무 엉뚱하거나 위험한 시도를 할 위험이 있습니다.

  • 비유: 저자들은 훈련 주변에 "울타리"를 쳤습니다. 만약 학생의 새로운 아이디어가 교사가 예상하는 것과 너무 다르다면(너무 왼쪽이나 너무 오른쪽으로 치우친다면), 시스템은 단순히 그 아이디어를 무시하는 것이 아니라, 그 특정 실수로부터 배우는 것 자체를 완전히 차단합니다. 이는 마치 엄격한 코치가 "네가 뒤로 뛰려고 한다면, 나는 그 달리로부터 전혀 배우지 않겠다"라고 말하는 것과 같습니다.
  • 해결하는 문제: 빠른 속도 때문에 학생들이 혼란을 겪을 때 훈련이 불안정해지거나 "폭발"하는 것을 방략합니다.

3. "슈퍼 코치" (더 나은 가치 모델)

기존의 "그룹" 방식에서는 코치가 학생의 요리를 반 친구들의 요리와 비교하여 좋은지 나쁜지 판단할 수 있었습니다. 하지만 이 "한 명씩 진행하는" 방식에서는 비교할 반 친구들이 없습니다. 코치는 단 하나의 요리가 그 자체로 좋은지 나쁜지를 알 수 있을 만큼 매우 똑똑해야 합니다.

  • 비극: 저자들은 학생 요리사들보다 두 배나 빠르게 지식을 업데이트하는 훨씬 더 똑똑한 "가치 코치(Critic)"를 훈련시켰습니다. 또한 코치의 "본능(Attention layers)"을 고정하여 코치가 혼란을 겪지 않게 하고, 오직 레시피의 구체적인 세부 사항만을 배우도록 했습니다.
  • 해결하는 문제: 이를 통해 학생이 혼자 작업하더라도, 코치가 그룹과 비교할 필요 없이 "그래, 방금 동작은 좋았어" 또는 "아니, 그건 나빴어"라고 정확하게 알려줄 수 있게 합니다.

결과

이 논문은 이 새로운 방법을 두 가지 매우 어려운 과제에 테스트했습니다:

  1. 코딩: AI에게 소프트웨어의 버그를 수정하도록 요청하는 것 (마치 정비사가 자동차를 고치는 것과 같습니다).
  2. 수학적 추론: AI에게 복잡한 수학 문제를 풀도록 요청하는 것 (마치 학생이 어려운 시험을 치르는 것과 같습니다).

결과:

  • 기존 방식(GRPO)은 초반에는 잘 시작하지만, 혼란스러워지면서 시간이 지나면 결국 무너지고 실패했습니다.
  • 새로운 SAO 방식은 오랫동안(최대 1,000 스텝까지) 훈련을 매끄럽게 유지하며 지속적으로 더 높은 점수를 얻었습니다.
  • 또한, 이 방법이 게임의 규칙이 플레이 중에 바뀌는 **온라인 학습(Online Learning)**에 완벽하다는 것을 증명했습니다. 예를 들어, 선생님이 갑자기 "이제 귀여운 이야기를 써줘"라고 말한다면, SAO로 훈련된 AI는 빠르게 스타일을 바꿀 수 있지만, 다른 방법들은 적응하는 데 너무 느렸습니다.

요약하자면, 이 논문은 다음과 같이 말합니다: "그룹을 기다리지 마세요. 각자의 속도에 맞춰 일하게 하되, 엄격한 안전망과 지식을 즉시 업데이트하는 아주 똑똑한 코치를 제공하세요. 이것이 AI 훈련을 더 빠르고, 안정적이며, 어렵고 변화무쌍한 문제를 더 잘 해결하게 만듭니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →