← 최신 논문
🤖 AI

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

본 논문은 컨텍스트 불일치를 제거하고, 인과적으로 일관된 신용 할당을 가능하게 하며, 비동기적 정책 드리프트를 제어하기 위해 롤아웃을 희소 역트리(sparse reverse trees)로 재구조화함으로써 멀티 턴 에이전트 RL 학습을 안정화하는 통합 프레임워크인 역턴 정책 최적화(Reverse-Turn Policy Optimization, RTPO)를 소개하며, 이를 통해 기존 베이스라인들을 유의미하게 능가한다.

원저자: Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 급격히 진화하는 세상에서, 연구자들은 대규모 언어 모델이 자율적인 에이전트로서 행동하도록 가르치고 있습니다. 이들은 단순히 질문에 답하는 챗봇이 아니라, 복잡한 문제를 해결하기 위해 계획을 세우고, 추론하며, 계산기나 웹 검색 엔진과 같은 외부 도구를 사용하도록 설계된 시스템입니다. 이러한 에이전트를 더 똑똑하게 만들기 위해 과학자들은 종종 '강화 학습'이라 불리는 방법을 사용합니다. 새로운 게임을 배우는 학생을 상상해 보세요. 학생은 여러 가지 움직임을 시도하고, 만약 승리한다면 보상을 받습니다. 시간이 흐르면서 학생은 어떤 움직임이 성공으로 이어지는지를 배웁니다. 디지털 영역에서 '움직임'은 모델이 생성하는 단어들이며, '보상'은 작업이 끝난 직나 매우 마지막에 주어지는 점수입니다. 이 접근 방식은 한 번에 수학 문제를 푸는 것과 같은 단일 단계 작업에는 매우 성공적이었습니다. 그러나 이 에이전트들에게 주제를 조사하고, 데이터를 수집하고, 여러 차례의 대화에 걸쳐 보고서를 작성하는 것과 같은 길고 다단계적인 워크플로우를 수행하도록 요청하면, 훈련 과정은 악명 높게 불안정해집니다. 모델은 종종 짧은 작업은 잘 해결하지만, 작업이 길어지면 처참하게 실패하며, 단계의 수가 증가함에 따라 성능이 무너져 내립니다.

호주와 미국의 대학 연구진은 왜 이런 붕괴가 발생하는지를 식별하고 이를 해결할 새로운 방법을 제안했습니다. 그들은 이 불안정성이 여러 턴에 걸쳐 에이전트를 훈련할 때 발생하는 세 가지 깊게 연결된 문제에서 기인한다는 것을 발견했습니다. 첫째, 모델이 연습하는 동안 보는 것과 교육받는 동안 보는 것 사이에 불일치가 존재합니다. 연습 중에 모델은 공간을 절약하기 위해 대화의 요약본만을 볼 수도 있지만, 훈련 중에는 컴퓨터가 전체 대화 기록 전체를 보도록 강제합니다. 이러한 차이는 모델을 혼란스럽게 만들어, 어떤 문맥을 신뢰해야 할지 확신하지 못하게 만듭니다. 둘째, 시스템은 긴 추론 사슬 속에서 정확히 어떤 단계가 최종적인 성공이나 실패를 이끌어냈는지 파악하는 데 어려움을 겪습니다. 모델이 열 단계의 과정 끝에 보상을 받을 때, 훈련 알고리즘은 종-종 열 단계 전체에 그 공로(또는 책임)를 균등하게 분배하곤 하는데, 실제로는 다섯 번째 단계가 결정적인 실수였을 수도 있습니다. 이는 에이전트가 올바른 행동을 배우는 것을 어렵게 만듭니다. 셋-째, 훈련이 진행됨에 따라 모델은 변화합니다. 만약 시스템이 모델이 더 "어리고" 숙련도가 낮았던 시절에 시작된 긴 대화로부터 배우려고 시도하는데, 훈련이 끝날 때는 모델이 더 "나이가 들고" 숙련된 상태라면, 데이터는 일관성을 잃게 됩니다. 모델은 본질적으로 자신의 과거 모습으로부터 배우려고 노력하는 셈이며, 이는 학습 과정을 불안정하게 만드는 드리프트(drift) 현상을 생성합니다.

이러한 문제들을 해결하기 위해 연구진은 '역방향 턴 정책 최적화(Reverse-Turn Policy Optimization, RTPO)'라고 불리는 새로운 프레임워크를 개발했습니다. 긴 대화를 하나의 거대하고 평평한 텍스트 블록으로 취급하는 대신, 그들은 훈련 과정을 일련의 구별되고 연결된 순간들로 재구상했습니다. 핵심 아이디어는 작업의 맨 마지막 단계부터 시작하여 처음을 향해 역순으로 작업함으로써 모델을 훈련하는 것입니다. 시스템이 대화의 특정 턴에 도달하면, 잠시 멈추고 여러 개의 '형제(sibling)' 버전의 미래를 생성합니다. 시스템은 모델에게 다음과 같이 묻습니다: "만약 내가 지금 이 특정 결정을 내린다면, 그다음에 어떤 일이 벌어질까?" 그런 다음, 이 미래 시나리오들을 앞으로 실행하여 그것들이 좋은 결과로 이어지는지 확인합니다. 이러한 형제 미래들을 비교함으로써, 시스템은 이전의 노이즈나 나중의 불확실성 없이, 현재의 턴에서 어떤 결정이 가장 좋았는지를 정확히 짚어낼 수 있습니다. 이 방법은 모델이 항상 일관된 문맥으로부터 학습하도록 보장하며, 성공적인 결과에 대한 공로가 그것을 유발한 결정에 정확하게 할당되도록 합니다.

이 새로운 접근 방식의 결과는 놀라웠습니다. 어려운 수학적 추론 과제와 복잡한 웹 검색 도전 과제에 대해 테스트했을 때, 이 새로운 방법은 기존 기술들을 크게 능가했습니다. 어려운 수학 문제 세트에서, 이 새로운 방법은 기존 표준 방식들에 비해 에이전트의 정확도를 21% 이상 향 향상시켰습니다. 지식 기반 작업에서는 성능이 거의 11% 향상되었습니다. 아마도 더 중요한 점은, 훈련 과정 자체가 훨씬 더 안정적이었다는 것입니다. 이전 방식들에서는 작업이 길어질수록 모델의 성능이 저하되는 경우가 많았지만, 이 새로운 접근 방식에서는 단계의 수가 증가함에 따라 모델이 계속해서 개선되었습니다. 연구진은 또한 에이전트가 도구를 더 효율적으로 사용하는 법을 배웠다는 것을 발견했습니다. 수학 문제의 경우, 에이전트는 도구 호출 횟수는 줄었지만 정답률은 높아졌는데, 이는 에이전트가 스스로의 추론에 더 의존하고 꼭 필요한 경우에만 도구를 사용하도록 학습했음을 시사합니다. 연구 작업의 경우, 도구 호출은 더 많아졌지만, 이러한 호출은 더 전략적이었으며 더 나은 정보 수집으로 이어졌습니다.

연구진은 각자의 문제를 격리함으로써 자신들의 해결책이 작동함을 검증했습니다. 그들은 문맥 불일치를 해결함으로써 모델이 무엇을 보아야 하는지에 대해 혼란을 겪지 않게 된다는 것을 보여주었습니다. 신용 할당(credit assignment) 문제를 해결함으로써, 모델은 최종 결과에 근거해 추측하는 대신 각 특정 단계에서 더 나은 결정을 내리는 법을 배웠습니다. 그리고 훈련 데이터를 현재 버전의 모델과 일관되게 유지함으로써, 긴 훈련 세션을 실패하게 만드는 드리프트를 제거했습니다. 이 연구는 복잡한 다단계 작업을 수행할 때 길을 잃지 않고 처리할 수 있는 더 신뢰할 수 있는 AI 에이전트를 구축하기 위한 명확한 경로를 제공합니다. 이는 장기적인 추론을 마스터하는 열쇠가 단순히 모델에게 더 많은 데이터를 주는 것이 아니라, 데이터로부터 학습하는 방식을 재구조화하여 모든 결정이 적절한 미래 가능성에 대해 공정하고 정확하게 평가되도록 하는 것임을 시사합니다. 이 연구는 한 번에 한 번의 사려 깊은 단계로 현실 세계의 복잡성을 진정으로 탐색할 수 있는 AI 비서를 만드는 데 있어 중요한 진전입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →