SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs
이 논문은 단일 상태 전이에서 소비되는 최소 출력 집합을 하나의 통합된 행동으로 취급함으로써, 다양한 워크플로와 모델 규모에 걸쳐 안정적이고 효과적인 학습을 가능하게 하여 분업과 공동 진화를 통합하는 멀티 에이전트 LLM을 위한 새로운 강화 학습 프레임워크인 SRPO(Setwise Relative Policy Optimization)를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
급격히 진화하는 인공지능의 세계에서, 대규모 언어 모델은 추론하고, 정보를 검색하며, 도구를 사용하여 복잡한 문제를 해결할 수 있는 에이전트로서 행동하는 법을 배웠습니다. 이러한 모델들이 단독으로 작업할 때는 단일한 사고 경로를 따릅니다. 그러나 더 어려운 과제들을 해결하기 위해, 연구자들은 종종 전문가 팀처럼 협력하는 여러 에이전트를 배치합니다. 때때로 이 팀들은 각 구성원이 특정 역할을 맡도록 작업을 분할하기도 하고, 또 다른 때에는 해결책을 함께 정교화하기 위해 여러 가지 서로 다른 아이디어를 동시에 생성하기도 합니다. 이러한 팀을 훈련시키는 데 있어 핵심적인 어려움은 그들에게 어떻게 보상을 줄 것인가를 결정하는 것이었습니다. 전통적인 방법들은 여러 에이ست가 하나의 결과를 만들어내기 위해 함께 협력하고 있음에도 불구하고, 각 에이전트의 출력을 별개의 사건으로 취급하곤 했습니다. 이는 불일치를 초래합니다. 즉, 시스템이 그들이 함께 형성하는 전체 그림이 아니라 개별적인 퍼즐 조각들로부터 학습하게 만들어, 혼자 일하는 방식과 공동으로 일하는 방식 사이를 전환하는 팀을 훈련하기 어렵게 만듭니다.
한 연구팀은 '집합적 상대 정책 최적화(Setwise Relative Policy Optimization, SRPO)'라고 불리는 새로운 훈련 방법을 제안함으로써 이 불일치 문제를 해결했습니다. 이 접근 방식은 개별 응답을 보는 대신, 환경에 변화를 일으키는 출력 전체를 하나의 행동 단위로 취급합니다. 탐험가 팀이 갈림길에 도달한 상황을 상상해 보십시오. 한 사람이 경로를 선택하든, 혹은 팀 전체가 토론한 후 경로를 함께 결정하든, 그들을 앞으로 나아가게 하는 결정은 집단적인 결과입니다. 연구진은 이러한 출력들을 '활성 집합(active set)'이라고 부르는 단위로 그룹화함으로써, 팀의 공동 노력이 진정한 행동임을 이해하도록 시스템을 훈련할 수 있다는 것을 발견했습니다. 이 방법은 팀이 한 사람이 한 가지 일을 수행하는 엄격한 분업 모드에서 작동하든, 혹은 여러 사람이 동시에 공유된 아이디어에 기여하는 공동 진화 모드에서 작동하든 동일한 훈련 규칙을 적용할 수 있게 해줍니다.
연구진은 이 아이디어를 두 가지 매우 다른 유형의 과제, 즉 어려운 수학 문제를 해결하는 것과 특정 사실을 찾기 위한 다회차 검색을 수행하는 것에 대해 테스트했습니다. 수학 실험에서 시스템은 후보 솔루션을 생성한 다음 이를 검증해야 했으며, 이 과정은 때때로 한 에이전트가 풀고 다른 에이전트가 검토하는 것을 요구하기도 했고, 때로는 여러 에이전트가 동시에 서로 다른 유도 과정을 제안하는 것을 요구하기도 했습니다. 검색 실험에서 시스템은 더 많은 정보를 요청할지 여부를 결정해야 했으며, 여러 에이전트가 집계기가 결과를 결합하기 전에 동시에 검색 쿼리를 발행할 수 있었습니다. 네 가지 서로 다른 크기의 언어 모델에 대해, 이 새로운 방법은 기존의 접근 방식들을 지속적으로 능가했습니다. 수학 벤치마크에서 시스템은 생성된 솔루션 중 약 61~62%가 정답인 평균 정확도를 달enc성했으며, 문제의 약 78%에 대해 적어도 하나 이상의 정답을 찾아냈습니다. 검색 작업에서는 개선 효과가 더욱 두드러졌는데, 새로운 방법은 평균적으로 60% 이상의 쿼리에서 정답을 찾아냈으며, 이는 이전 방법들로부터의 상당한 도약입니다.
이 발견의 핵심적인 부분은 여러 에이전트의 기여도를 어떻게 균형 있게 맞출 것인지를 이해하는 것이었습니다. 만약 시스템이 단순히 각 에이전트가 만든 변화를 합산한다면, 더 큰 팀은 단순히 목소리가 더 많다는 이유만으로 더 작은 팀보다 훨씬 더 큰 영향력을 가진 것처럼 보일 것입니다. 연구진은 그룹의 기여도를 정규화함으로써 이 문제를 해결했고, 이를 통해 다섯 명의 에이전트로 구성된 팀이 단지 규모가 크다는 이유만으로 단일 에이전트에 비해 불공정하게 가중치를 부여받지 않도록 보장했습니다. 또한 연구진은 시스템이 이러한 모드들 사이를 동적으로 전환하는 법을 배울 수 있음을 입증했습니다. 어떤 경우에는 단일 전문 에이전트가 최선의 선택임을 학습한 반과, 다른 경우에는 소수의 에이전트 그룹을 활성화하여 함께 작업하도록 했습니다. 이러한 유연성 덕분에 훈련 과정은 서로 다른 팀 구조를 위해 다시 작성될 필요가 없었습니다. 동일한 근본 논리가 두 시나리오를 모두 매끄럽게 처리했습니다.
본 연구는 또한 이러한 개선의 비용을 면밀히 조사했습니다. 연구진은 더 나은 결과가 단순히 새로운 방법이 더 많은 텍스트를 생성하거나 더 많은 컴퓨팅 파워를 사용하기 때문이 아님을 확실히 하기 위해 주의를 기울였습니다. 그들은 생성된 토큰 수와 도구 호출 수를 측정하였으며, 개선이 무차별적인 힘(brute force)이 아닌 더 나은 협업으로부터 왔음을 발견했습니다. 실제로 훈련 과정은 시간이 지남에 따라 더 짧고 효율적인 응답을 생성하는 방향으로 이어지는 경우가 많았습니다. 연구진은 결과가 강력하지만, 이는 특정 벤치마크와 발표된 다른 방법들과의 비교에 기반한 것이며, 향-후 연구에서는 이러한 이득이 실제 환경의 장기적 배포에서도 유지되는지 탐구할 필요가 있다고 언급했습니다. 그럼에도 불구하고 핵심적인 발견은 다음과 같습니다. 팀의 집단적 출력을 근본적인 행동 단위로 정의함으로써, 팀이 혼자 일하든 함께 일하든 상관없이 더 안정적이고 효율적이며 복잡한 문제를 해결하는 데 효과적인 다중 에이전트 시스템을 훈련하는 것이 가능하다는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.