SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning
이 논문은 정책(policy)과 가치 함수(value function)를 위한 공유된 자기회귀 백본을 활용하여 PPO 및 GRPO와 같은 기존 방식보다 우수한 성능과 안정성을 달성하는 동시에 별도의 크리틱 모델의 필요성을 제거함으로써, 에이전트 강화 학습을 위한 메모리 효율적이고 연산 최적화된 프레임워크인 SAPO를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능이 급격히 진화하는 세상에서, 컴퓨터 프로그램이 더 이상 단순한 수동적 텍스트 생성기에 머물지 않고 추론하고, 웹을 검색하며, 여러 단계에 걸쳐 복잡한 문제를 해결할 수 있는 능동적인 에이전트로 거듭나는 새로운 개척지가 등장했습니다. 에이전트 강화 학습(agentic reinforcement learning)이라고 알려진 이 분야는, 디지털 어시스턴트가 시뮬레이션된 환경에서 행동을 시도하고 그 결과로부터 배우게 함으로써 이들을 교육합니다. 학생이 시험을 치는 모습을 상상해 보십시오. 정답을 맞히면 기분이 좋지만, 실패하면 무엇이 잘못되었는지 파악하려고 노력합니다. AI에게 있어 이러한 학습 과정은 긴 결정의 사슬을 되돌아보고 어떤 특정 단계가 성공이나 실패를 이끌어냈는지 판단할 수 있는 시스템에 의존합니다. 전통적으로 이는 두 부분으로 구성된 무거운 시스템을 필요로 했습니다. 하나는 다음에 무엇을 할지 결정하는 부분이고, 다른 하나는 현재 상황이 얼마나 좋은지를 평가하는 별도의 거대한 '비평가(critic)' 부분입니다. 이러한 분리는 효과적이긴 하지만 엄청난 컴퓨팅 파워와 메모리를 요구하며, 종종 학습 속도를 늦추거나 표준 하드웨어에서 실행하기에 너무 비싸게 만듭니다.
연구자들은 최근 많은 AI 에이전트들이 피드백이 희소하거나 지연될 때, 즉 긴 과업이 끝날 때까지 성공 여부를 기다려야 할 때 어려움을 겪는다는 사실을 발견했습니다. 별도의 비평가를 제거하여 이 과정을 단순화하려는 기존 방식들은, 긴 순서 속에서 개별 단계에 대한 공로를 할당할 명확한 방법을 갖추지 못해 불안정한 학습이나 저조한 성능을 보이는 경우가 많았습니다. 이를 해결하기 위해 샤먼 대학교(Xiamen University)와 난양 공과대학교(Nanyang Technological University)의 과학자 팀은 SAPO라고 불리는 새로운 프레임워크, 즉 단일 실행 자기회귀 정책 최적화(Single-Rollout Autoregressive Policy Optimization)를 개발했습니다. SAPO는 두 개의 별도 모델을 사용하거나 하나의 과업으로부터 학습하기 위해 수십 가지의 다른 시도를 생성하도록 요구하는 대신, 단일 언어 모델이 모든 것을 한 번에 수행하도록 가르칩니다. 이 방식은 언어 생성의 자연스러운 흐름을 활용하여, 하나의 연속적인 사고 흐름 안에서 행동을 결정하고, 행동 전의 상태를 평가하며, 행동 자체의 가치를 판단하는 일을 동시에 수행합니다.
SAPO의 핵심 혁신은 AI의 뇌 내부에서 정보를 조직하는 방식에 있습니다. 일반적인 대화나 과업에서 AI는 프롬프트를 읽고, 생각하고, 그 다음 응답을 작성합니다. 연구진은 AI가 응답을 쓰기 시작하기 바로 직전의 순간이 "이 상황이 얼마나 좋은가?"라고 묻기에 완벽한 시점이며, 응답이 끝난 직후의 순간이 "그 특정 행동이 얼마나 좋았는가?"라고 묻기에 완벽한 시점이라는 것을 깨달았습니다. 이 두 가지 질문을 텍스트 생성 과정의 특정 고정 지점에 배치함으로써, 모델은 별도의 평가자 없이도 두 질문에 모두 답하는 법을 배울 수 있습니다. 이러한 설계 덕분에 AI는 서로 비교하기 위해 대규모의 변형들을 생성할 필요 없이, 단 한 번의 시도만으로도 학습할 수 있습니다. 이 시스템은 다양한 상황에 걸쳐 가치에 대한 이해를 일반화하는 법을 효과적으로 학습하여, 단순히 성공으로 가는 특정 경로를 암기하는 것이 아니라 왜 어떤 움직임이 좋았거나 나빴는지에 대한 근본적인 논리를 이해하게 합니다.
이 접근 방식을 테스트하기 위해, 연구팀은 AI를 두 가지 도전적인 환경에서 훈련시켰습니다. 하나는 에이전트가 청소나 가열과 같은 물리적 과업을 완료해야 하는 시뮬레이션된 가정 환경이고, 다른 하나는 에이전트가 특정 제품을 찾기 위해 웹사이트를 탐색해야 하는 복잡한 웹 쇼핑 시나리오입니다. 연구진은 이 방법이 다양한 규모에서도 유효한지 확인하기 위해 15억 개의 파라미터를 가진 모델과 70억 개의 파라미터를 가진 두 가지 크기의 언어 모델을 사용했습니다. 결과는 놀라웠습니다. 가정 과업에서 이 새로운 방법은 별도의 비평가를 사용하는 표준 방식보다 성공률을 12%포인트 이상, 비평가 사용을 피하려고 시도하는 선도적인 방식보다 15%포인트 이상 향상시켰습니다. 웹 쇼핑 과업에서도 유사하게 유의미한 개선이 나타났으며, AI는 더 높은 점수를 기록하고 더 많은 과업을 성공적으로 완수했습니다. 아마도 가장 중요한 점은, 이 새로운 방법이 전통적인 방식보다 훨씬 적은 메모리를 사용하면서도 훈련 단계당 약 33% 더 빠르게 실행되었다는 것인데, 이는 성능을 평가하기 위한 두 번째의 별도 모델을 실행할 필요가 없었기 때문입니다.
이 프레임워크의 성공은 대규모 언어 모델이 정보를 처리하는 자연스러운 방식이 AI 에이전트를 훈련시키는 데 있어 매우 어려운 문제들을 해결하는 데 활용될 수 있음을 시사합니다. 학습 과정을 언어 생성의 자연스러운 구조와 일치시킴으로써, 연구진은 의사결정과 평가를 위한 별도의 시스템을 유지하는 무거운 계산 비용 없이도 높은 수준의 성능을 달달성할 수 있음을 보여주었습니다. 이 접근 방식은 훈련을 더 효율적으로 만들 뿐만 아니라 더 안정적으로 만들어, 에이전트가 행동에 대한 보상이 지연되거나 드물게 주어지는 상황에서도 효과적으로 학습할 수 있게 합니다. 인공지능 분야가 더 자율적이고 유능한 에이전트를 만드는 방향으로 나아감에 따라, 이러한 방식은 효율성과 고성능이 복잡하고 장기적인 상호작 تعلم의 능력을 희생하지 않고도 공존할 수 있음을 증명하며 실질적인 길을 제시하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.