← 최신 논문
🤖 AI

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs

PlanPO는 상호작용 효율성에 기반하여 성공적인 궤적을 구별하기 위해 거친 단계에서 세밀한 단계로 이어지는 어드밴티지 신호를 도입함으로써, 멀티 턴 에이전트형 LLM이 일반화 가능한 계획 행동을 학습하도록 가능하게 하고 도전적인 벤치마크에서 기존 베이스라인들을 크게 능가하는 새로운 그룹 상대적 정책 최적화 방법이다.

원저자: Dayang Liang, Liyuan He, Xuan Feng, Shuxin Li, Bo An, Yunlong Liu

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dayang Liang, Liyuan He, Xuan Feng, Shuxin Li, Bo An, Yunlong Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급격히 진화하는 인공지능의 세계에서, 대규모 언어 모델(LLM)로 알려진 특정 부류의 컴퓨터 프로그램은 이제 단순한 수동적 독자나 필자를 넘어 능동적인 에이전트로서 행동하기 시작했습니다. 이 디지털 개체들은 상황을 관찰하고, 응답을 생각하며, 행동을 취하는 다회차 대화에 참여함으로써 가상 웹 스토어부터 시뮬레이션된 과학 실험실에 이르기까지 복잡한 환경을 탐색할 수 있습니다. 이러한 에이전트가 효과적으로 과업을 수행하는 법을 가르치기 위해, 연구자들은 흔히 강화 학습이라고 불리는 방법을 사용합니다. 이 과정에서 에이전트는 문제를 해결하기 위해 많은 다양한 방법들을 시도하며, 성공했을 때 보상을 받습니다. 시간이 흐름에 따라 에이전트는 성공으로 이끄는 행동을 반복하는 법을 배웁니다. 그러나 에이전트가 성공하는 방법을 찾아냈을 때 중대한 과제가 발생합니다. 모든 성공적인 경로가 동일한 가치를 지니는 것은 아니기 때문입니다. 어떤 해결책은 직접적이고 효율적인 반면, 다른 해결책은 불필요한 루프, 중복된 단계, 또는 지나치게 장황한 설명들로 가득 찬 우회적인 경로일 수 있지만, 이들은 모두 동일한 '성공' 보상을 받습니다. 이러한 구분의 결여는 학습 과정을 혼란스럽게 만들어, 에이전트가 비효율적인 습관에 시간을 낭비하게 하거나 앞을 내다보며 계획하는 능력을 발달시키는 데 실패하게 만들 수 있습니다.

한 연구팀은 이 문제를 해결하기 위한 새로운 접근 방식인 '그룹 계획 인식 정책 최적화(Group Planning-aware Policy Optimization)', 즉 PlanPO를 제안했습니다. 단순히 성공적인 결과에 보상하는 대신, 이 방법은 해결책이 도출된 과정을 살펴봄으로써 에이전트가 좋은 해결책과 훌륭한 해결책을 구분하도록 가르칩니다. 연구자들은 에이전트가 과업을 올바르게 완료하더라도, 그곳에 도달하는 여정은 매우 다양할 수 있다는 점을 관찰했습니다. 어떤 에이전트는 물건을 찾기 전까지 같은 서랍을 반복해서 확인하며 가상 집 안을 헤맬 수 있는 반면, 다른 에이덴트는 곧장 정확한 위치로 갈 수도 있습니다. 마찬가지로, 에이전트가 자신의 생각을 말하거나 글로 쓸 때, 어떤 응답은 간결하고 논리적인 반면, 어떤 응답은 결과적으로 옳은 행동을 취했더라도 장황하거나 혼란스러운 추론을 포함할 수 있습니다. PlanPO의 핵심 아이디어는 이러한 길이와 효율성의 차이를 학습을 위한 신호로 사용하는 것입니다. 에이전트의 성공적인 시도들을 서로 비교함으로써, 시스템은 어떤 경로가 더 직접적이었는지, 그리고 어떤 응답이 더 효율적이었는지를 식별하여, 서투른 경로보다 이러한 특정 행동들에 더 높은 보상을 줄 수 있습니다.

연구진은 세 가지 뚜렷하고 도전적인 환경에서 언어 모델을 훈련시켜 이 아이디어를 테스트했습니다. 첫 번째는 에이전트가 물건을 집거나, 청소하거나, 물건을 데우는 등의 과업을 수행해야 하는 시뮬레이션된 가정집이었습니다. 두 번째는 에이전트가 사용자 지침에 따라 수천 개의 옵션 중에서 특정 제품을 찾아야 하는 복잡한 웹 쇼핑 환경이었습니다. 세 번째는 에이전트가 실험을 수행하기 위해 가상의 도구들을 조작해야 하는 과학 시뮬레이션이었습니다. 이 테스트에서 연구진은 성공의 유형을 구분하지 않는 표준 강화 학습 접근법을 포함한 여러 기존 기법들과 PlanPO를 비교했습니다. 결과는 PlanPO로 훈련된 에이전트들이 다른 방식들을 일관되게 능가했다는 것을 보여주었습니다. 평균적으로, 이 새로운 방법은 이러한 어려운 벤치마크 전반에서 성능을 27.2% 향상시켰습니다. 가정 환경에서 PlanPO로 훈련된 에이전트들은 이전 방식들과 비교해 상당한 도약인 91% 이상의 성공률을 달성했습니다.

이 발견이 특히 주목할 만한 이유는 에이전트들의 행동이 어떻게 변화했는가에 있습니다. 연구진은 PlanPO로 훈련된 에이전트들이 단순히 과업을 해결하는 법을 배운 것이 아니라, 더 효율적으로 해결하는 법을 배웠다는 것을 발견했습니다. 그들은 목표에 도달하기 위해 더 적은 단계를 밟았고, 더 짧고 집중적인 응답을 생성했습니다. 예를 들어, 가정 과업에서 작업을 마치는 데 필요한 평균 상호작용 횟수는 26회 이상에서 14회 미만으로 줄어들었습니다. 또한 에이전트들은 장황하거나 반복적인 텍스트 생성을 멈추어 평균 응답 길이를 크게 줄였습니다. 이러한 개선은 단순히 에이전트에게 더 짧고 빠르게 행동하도록 강요해서 얻어진 것이 아닙니다. 연구진은 그렇게 하는 것이 실제로 성능을 해칠 것이라는 점을 보여주었습니다. 대신, 에이전트들은 그것이 성공에 도움이 될 때만 효율적이 되는 법을 배웠습니다. 그들은 직접적인 경로와 명확한 설명이 길고 구불구불한 경로보다 더 낫다는 것을 이해하는, 일종의 '계획 인식'을 발달시켰습니다. 비록 두 경로 모두 결국 동일한 결과로 이어질지라도 말입니다.

또한 이 연구는 에이전트들이 학습한 내용을 본 적 없는 새로운 상황에 적용할 수 있는지 조사했습니다. 훈련에 사용된 것과 다른 과업들에 대해 테스트했을 때, PlanPO 에이전트들은 높은 수준의 성공률을 유지하며 다른 방식들을 큰 차이로 앞질렀습니다. 이는 에이전트들이 특정 문제에 대한 특정 해결책을 단순히 암기한 것이 아니라, 계획과 의사결정을 위한 일반적인 기술을 학습했음을 시사합니다. 연구진은 이러한 향상이 막대한 양의 추가 컴퓨팅 파워나 복잡한 새로운 하드웨어를 요구하지 않고도 달성되었다고 언급했습니다. 이 방법은 기존의 훈련 데이터를 평가하는 방식을 재구성했을 뿐입니다. 성공적인 시도들 사이의 차이를 노이즈가 아닌 가치 있는 정보로 취급함으로써, 연구진은 에이전트가 더 효과적으로 학습할 수 있도록 했습니다. 이 연구는 인공지능의 복잡한 세계에서 성공의 질이 성공 그 자체만큼이나 중요하며, 기계에게 그 차이를 인식하도록 가르치는 것이 더 똑똑하고 유능한 디지털 비서를 만드는 길임을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →