← 최신 논문
🤖 AI

SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL

SPO++는 행동-토큰-측도 정규화(action-token-measure normalization)와 이벤트 정렬 증거 구조화(event-aligned evidence organization)를 통해 궤적 수준의 어드밴티지 중심화(trajectory-level advantage centering)와 토큰 가중치 액터 최적화(token-weighted actor optimization) 사이의 불일치를 교정함으로써 비동기 에이전트 강화 학습의 온라인 학습 효율성을 향상시킨다.

원저자: Kai Ruan, Jinghao Lin, Qianshan Wei, Ziqi Zhou, Zihe Huang

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kai Ruan, Jinghao Lin, Qianshan Wei, Ziqi Zhou, Zihe Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능 분야가 급격히 발전함에 따라, 연구자들은 컴퓨터 프로그램이 시도하고, 실패하고, 그 결과로부터 배우는 과정을 통해 복잡한 문제를 해결하도록 가르치고 있습니다. 강화 학습(reinforcement learning)이라고 알려진 이 과정은 대규모 언어 모델이 도구를 사용하거나, 가상 환경을 탐색하거나, 수학 문제를 해결하는 에이전트로 동작하도록 훈련하는 데 특히 유용합니다. 이 작업의 핵심 과제는 정답으로 가는 경로가 길고 예측 불가능할 때 성공을 어떻게 측정하느냐 하는 것입니다. 전통적인 방식은 시스템이 동일한 문제에 대해 여러 번의 시도를 동시에 생성하고, 학습을 위해 모든 시도가 완료될 때까지 기다려야 합니다. 이는 병목 현상을 일으킵니다. 만약 어떤 시도가 막히거나 많은 도구를 사용하느라 시간이 오래 걸린다면, 전체 학습 과정은 그 가장 느린 시도가 따라잡을 때까지 일시 중단됩니다.

이러한 비효율성을 해결하기 위해, 단일 스트림 정책 최적화(Single-stream Policy Optimization)라고 불리는 새로운 접근 방식이 개발되었습니다. 이 방식은 일련의 시도들을 기다리는 대신, 과거의 성공과 실패에 대한 지속적인 기억을 사용하여 미래의 결정을 안내함으로써 한 번에 하나의 시도로부터 학습할 수 있게 합니다. 그러나 카이 루안(Kai Ruan)과 징하오 린(Jinghao Lin)이 이끄는 연구팀은 이 방법이 대기 시간을 제거했지만, 컴퓨터가 자신의 진보를 계산하는 방식에서 미묘하지만 중요한 불일치를 유발했다는 것을 발견했습니다. 그들은 시스템이 보상을 평균 내는 방식이 솔루션의 단계들을 실제로 처리하는 방식과 일치하지 않는다는 것을 발견했습니다. 이 정렬 문제를 수정함으로써, 그들은 SPO++라고 명명한 개선된 버전의 방법을 만들어냈으며, 이를 통해 인공지능이 훨씬 더 빠르고 효율적으로 학습할 수 있게 했습니다.

문제의 핵심은 컴퓨터가 응답의 길이를 처리하는 방식에 있었습니다. 기존 방식에서 시스템은 로봇이 방을 성공적으로 청소했는지 또는 수학 해결사가 정답을 찾았는지와 같이 전체 시도에 대한 단일 점수를 계산합니다. 그런 다음 이 단일 점수를 모델이 생성한 모든 단어 또는 '토큰'에 분산시킵니다. 이는 논리적으로 보이지만, 왜곡을 만들어냈습니다. 만약 한 시도는 매우 길고 다른 시도는 짧다면, 긴 시도는 자신의 점수를 많은 단어에 희석시키고, 짧은 시도는 자신의 점수를 적은 단어에 집중시킬 것입니다. 시스템이 이러한 점수로부터 학습하려고 할 때, 응답의 길이는 조용히 학습의 중심점을 변화시켜 모델이 잘못된 것을 최적화하도록 만들었습니다. 이는 마치 시스템이 저울의 균형을 맞추려 하는데, 물건 자체의 가치가 아니라 놓인 물건의 개수에 따라 저울 위의 무게가 바뀌는 것과 같았습니다.

연구진은 불일치가 발생하는 두 가지 특정 영역을 식계했습니다. 첫째, 시스템은 시도가 실제로 생성된 시점이 아니라 결과를 받은 시점을 추적하고 있었습니다. 작업이 외부로 보내지고 완료되는 속도가 서로 다른 비동기 시스템에서는, 결과가 도착하는 순서가 네트워크 속도나 컴퓨터 부하에 따라 무작위적일 수 있습니다. 기존 방식은 이 도착 순서를 사용하여 메모리를 업데이트했는데, 이는 학습 신호가 작업의 논리가 아닌 컴퓨터 시스템의 타이밍에 영향을 받게 되었음을 의미합니다. 둘째, 더 결정적으로, 점수를 평균 내는 방식이 모델이 최종 결과뿐만 아니라 생성하는 모든 단어로부터 학습한다는 사실을 고려하지 않았습니다. 연구진은 학습 과정을 수정하기 위해, 모델이 수행하는 실제 작업량과 일치하도록 생성된 행동 단어의 수를 기준으로 점수를 표준화해야 한다는 것을 깨달았습니다.

이러한 문제를 해결하기 위해 연구팀은 학습 과정에 두 가지 핵심적인 변화를 주는 SPO++를 도입했습니다. 첫째, 그들은 요청이 실제로 전송된 시점인 '정책 이벤트(policy event)'를 추적하도록 메모리 시스템을 재구성했습니다. 이는 시스템의 과거 성공에 대한 기억이 작업이 완료된 시점이 아니라 작업이 생성되었을 당시의 모델 상태와 연결되도록 보장하며, 이를 통해 작업이 완료되는 데 얼마나 오래 걸리든 상관없이 학습 신호를 일관되게 만듭니다. 둘째, 그들은 점수를 평균 내는 방식을 변경했습니다. 모든 시도를 단일 단위로 취급하는 대신, 새로운 방식은 생성된 총 행동 단어 수를 기준으로 평균 점수를 계산합니다. 이는 학습 신호가 모델이 단어 하나하나씩 실제로 지식을 업데이트하는 방식과 완벽하게 일치하도록 보장합니다.

이러한 변화의 결과는 두 가지 유형의 작업에 대해 테스트되었습니다: 에이전트가 물체를 특정 위치로 이동시켜야 하는 128개의 시뮬레이션된 가사 노동 세트와, 파이썬 계산기를 사용해야 하는 1,500개의 수학 문제 데이터셋입니다. 연구진은 0.8 tỷ(8억) 개의 파라미터를 가진 모델과 20억 개의 파라미터를 가진 두 가지 크기의 언어 모델을 사용하여 실험을 진행했습니다. 모든 테스트에서 새로운 방식인 SPO++는 기존 방식보다 더 빠르게 학습했습니다. 가사 노동 작업의 경우, 새로운 방식이 훈련 과정 동안 상당히 높은 총 보상을 달Ach하여 개선 효과가 상당했습니다. 수학 문제의 경우, 이득은 더 작았지만 여전히 일관적이었으며, 모델이 더 높은 수준의 성능에 더 빠르게 도달함을 보여주었습니다. 연구진은 새로운 방식의 가장 강력한 부분은 점수를 평균 내는 방식의 변화였으며, 이것이 단독으로 대부분의 개선을 설명한다고 밝혔습니다.

이러한 발견은 인공지능 에이전트를 훈련하는 복잡한 세계에서, 데이터가 처리되는 방식의 세부 사항이 데이터 자체만큼이나 중요할 수 있음을 시사합니다. 시스템이 진보를 측정하는 방식이 실제로 학습하는 방식과 일치하도록 함으로써, 연구자들은 더 많은 컴퓨팅 파워나 더 큰 모델 없이도 상당한 효율성 향상을 이끌어낼 수 있습니다. 이 연구는 학습 과정에서의 작은 불일치조차 발전을 늦출 수 있으며, 이러한 불일치를 바로잡음으로써 시스템이 결함이 있는 측정치를 보완하는 데 에너지를 쓰는 대신 문제를 해결하는 데 집중할 수 있게 된다는 것을 보여줍니다. 인공지능이 점점 더 어렵고 다양한 과제를 수행해 나감에 따라, SPO++와 같은 방법론은 모델의 모든 단계가 정확하게 측정되고 성장에 효과적으로 기여할 수 있도록 하는 더 명확한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →