Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs
이 논문은 협업형 LLM에서 표준 온-폴리시(on-policy) 강화 학습의 한계를 극복하기 위해 에이전트 및 턴 단위의 그룹화된 최적화 알고리즘과 유연한 학습 시스템을 도입한 새로운 멀티 에이전트 강화 학습 프레임워크인 AT-GRPO를 제안하며, 이를 통해 계획, 코딩 및 수학 작업 전반에 걸쳐 상당한 성능 향상을 달성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: 팀이 협력하는 법 가르치기
매우 똑똑하지만 약간은 서투른 로봇(거대 언어 모델, LLM)이 있다고 상상해 보세요. 당신은 이 로봇이 복잡한 퍼즐을 풀거나, 코드를 작성하거나, 게임을 하기를 원합니다.
사람들이 이 로봇을 더 똑똑하게 만들기 위해 보통 사용하는 두 가지 방법이 있습니다:
- "전문가" 팀 (Multi-Agent System): 로봇에게 친구들을 붙여줍니다. 한 친구는 "코더(Coder)", 다른 친구는 "테스터(Tester)", 세 번째 친구는 "플래너(Planner)" 역할을 맡습니다. 이들은 문제를 해결하기 위해 서로 대화합니다. 각자 특정한 직무가 있기 때문에 이 방식은 효과적입니다.
- "연습이 완벽을 만든다" 방식 (Reinforcement Learning): 로봇이 스스로 시도하고, 실패하고, 점수를 받고, 다시 시도하게 합니다. 시간이 지나면서 로봇은 실수를 통해 배우며 해당 작업의 달인이 됩니다.
문제점: 지금까지 이 두 가지 방법은 잘 섞이지 않았습니다.
- 만약 "연습" 방식을 사용하여 팀 전체를 가르치려 한다면, 훈련 과정이 엉망이 됩니다. "코더"와 "테스터"가 서로 대화를 나누고 있기 때문에, 그들의 프롬프트(지시문)가 계속해서 변하기 때문입니다. 표준적인 훈련 방식은 모든 사람이 동시에 정확히 같은 질문에 답할 것을 기대하기 때문에 혼란을 겪게 됩니다.
- 만약 그들이 그냥 혼자서 연습하게만 둔다면, 그들은 효과적으로 협업하는 법을 배우지 못합니다.
해결책: 저자들은 STRONGER-MAS(구체적으로는 AT-GRPO라고 불리는 알고리즘)를 개발했습니다. 이것을 여러 명의 전문가로 구성된 팀 전체를 동시에 훈련할 줄 아는, 아주 똑똑한 새로운 코치라고 생각하세요.
작동 원리: "트리(Tree)" 비유
1. 기존 방식 (병렬 샘플링)
코치가 4명의 학생에게 수학 문제를 풀라고 요청한다고 상상해 보세요.
- 학생 A가 풀이 과정을 씁니다.
- 학생 B가 풀이 과정을 씁니다.
- 학생 C가 풀이 과정을 씁니다.
- 학생 D가 풀이 과정을 씁니다.
코치는 네 개의 답안을 보고 말합니다. "좋아, 학생 A가 제일 잘했네."
결함: 팀 환경에서 다음 단계는 단순히 "문제를 다시 푸는 것"이 아닙니다. "학생 A, 여기 학생 B가 쓴 내용이야. 이제 네 답안을 수정해 봐"가 되어야 합니다. 맥락(Context)이 매번 바뀝니다. 만약 그들에게 단순히 원래의 문제를 다시 풀라고 한다면, 그들은 함께 일하는 법을 배우지 못할 것입니다.
2. 새로운 방식 (트리 구조 샘플링)
STRONGER-MAS 코치는 트리(Tree) 접근 방식을 사용합니다.
- 1단계: 팀이 문제와 함께 시작합니다.
- 2단계: "코더"가 코드를 작성하는 4가지 서로 다른 방법을 시도합니다. 코치는 즉시 이 4가지를 모두 채점합니다.
- 3단계: 코치는 그 4개 중 가장 나은 코드 하나를 고릅니다.
- 4단계: 이제 "테스터"는 그 특정 최선책인 코드를 보고, 그것을 테스트하는 4가지 서로 다른 방법을 시도합니다. 코치는 이 4개를 채점합니다.
- 5단계: 코치는 가장 좋은 테스트를 선택하고, 이 순환이 계속됩니다.
이것이 중요한 이유: 이를 통해 "코더"의 4가지 시도를 비교할 때, 그들이 모두 정확히 동일한 상황에 반응하도록 보장합니다. 이는 학습을 공정하고 효과적으로 만듭니다. 마치 코치가 "자, 모두 주목해. 이 특정 초안을 봐. 이걸 개선할 수 있는 4가지 방법이 있어. 어떤 것이 가장 잘 작동하는지 보자"라고 말하는 것과 같습니다.
"전문가 vs 공유" 논쟁
이 논문은 두 가지 다른 팀 구조를 테스트했습니다:
- "공유된 뇌" (Role-Sharing): 팀의 모든 구성원이 정확히 같은 뇌(동일한 AI 모델)를 사용합니다. 그들은 단지 서로 다른 지시 카드(프롬프트)를 읽음으로써 다른 사람인 척할 뿐입니다.
- 결과: 간단한 게임과 계획 수립에 매우 효과적이었습니다.
- "특화된 뇌" (Role-Specialized): "코더"는 코딩에 특화된 뇌를 가지고 있고, "테스터"는 테스트에 특하게 훈련된 뇌를 가지고 있습니다. 그들은 역할을 바꾸지 않습니다.
- 결과: 이 방식은 코딩과 수학에서 엄청난 승리를 거두었습니다. "코더"는 코딩만 연습했기에 코딩을 정말 잘하게 되었고, "테스터"는 버그를 찾아내는 데 매우 능숙해졌습니다.
핵론: 이 논문은 모든 직무에 대해 반드시 전문화된 뇌가 필요한 것은 아니라는 점을 발견했습니다. 어떤 작업(간단한 게임 등)의 경우, 한 명의 똑똑한 뇌를 공유하는 것으로 충분합니다. 하지만 어려운 작업(복잡한 소프트웨어 작성 등)의 경우, 각 역할에 전담 전문가를 두는 것이 훨씬 더 낫습니다.
결과: "보통"에서 "초인적 수준"으로
이 시스템은 네 가지 유형의 작업(게임, 계획, 코딩, 수학)에 대해 테스트되었습니다.
장기 계획 (큰 성과): 10단계를 앞서 계획해야 하는 게임을 상상해 보세요.
- 이전: 혼자서 이 일을 하려던 단일 로봇은 정답률이 14%에서 47% 사이였습니다. 쉽게 길을 잃었습니다.
- 이후: STRONGER-MAS 팀과 함께라면, 정답률이 **96%에서 99.5%**에 달했습니다.
- 비유: 구겨진 지도를 들고 헤매는 길 잃은 관광객에서, 모두가 어디로 가야 할지 정확히 알고 있는 가이드 투어 그룹으로 변한 것과 같습니다.
코딩 및 수학: 팀은 또한 버그 없는 코드를 작성하고 어려운 수학 문제를 푸는 데 있어 현저히 더 나은 성과를 보였습니다 (기존 최고 방법들보다 약 4%에서 18% 향상).
요약
이 논문은 AI 팀을 훈련하는 새로운 방법을 소개합니다. 개별적으로 훈련하거나 혼란스러운 집단으로 훈련하는 대신, 팀의 대화가 집중되고 공정하게 유지되도록 하는 트리 구조(Tree-Structured) 방식을 사용합니다. 이를 통해 AI는 협업하는 법을 배울 수 있으며, 경로 계획, 소프트웨어 작성, 수학 퍼즐 풀기와 같은 복잡하고 다단계적인 문제를 해결하는 데 있어 엄청난 발전을 이뤄냈습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.