← 최신 논문
🤖 AI

MASPRM: Multi-Agent System Process Reward Model

이 논문은 최종 결과물(terminal outcomes)을 학습하여 중간 에이전트 메시지에 점수를 매기는 멀티 에이전트 시스템 프로세스 보상 모델인 MASPRM을 소개하며, 이는 기존 모델들과 비교하여 더욱 효과적인 단계별 빔 서치(step-level beam search)와 몬테카를로 트리 서치(Monte Carlo Tree Search)를 가능하게 함으로써 추론 벤치마크에서의 추론 시간 탐색 성능을 크게 향상시킨다.

원저자: Milad Yazdani, Mahdi Mostajabdaveh, Zirui Zhou, Ying Xiong

게시일 2026-07-16
📖 5 분 읽기🧠 심층 분석

원저자: Milad Yazdani, Mahdi Mostajabdaveh, Zirui Zhou, Ying Xiong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 정말 까다로운 퍼즐, 예를 들어 복잡한 수학 문제나 논리 퀴즈를 풀려고 노력하고 있다고 상상해 보세요. 인공지능의 세계에서 '대규모 언어 모델(LLM)'은 매우 똑똑하지만 때로는 산만한 학생과 같습니다. 당신이 어려운 질문을 던지면, 그들은 한 번에 답을 내려고 시도하겠지만, 종종 중간에 막히거나 초기에 실수를 저질러 잘못된 길로 계속 빠져들곤 합니다. 이를 해결하기 위해 과학자들은 '멀티 에이전트 시스템(Multi-Agent Systems)'을 사용하기 시작했습니다. 이것을 혼자 공부하는 학생이 아니라, 하나의 스터디 그룹이라고 생각해보세요. 질문을 읽는 '독자(Reader)', 전략을 세우는 '기획자(Planner)', 수학 문제를 푸는 '해결사(Solver)', 그리고 작업 내용을 검토하는 '검증자(Verifier)'가 있습니다. 이들은 정해진 순서에 따라 서로 노트를 주고받습니다.

하지만 여기에는 함정이 있습니다. 만약 이 스터디 그룹이 제멋대로 움직이게 둔다면, 이미 틀린 아이디어에 대해 논쟁하느라 엄청 많은 시간과 에너지(컴퓨팅 파워)를 낭비할 수 있습니다. 이는 마치 친구들이 미스터리를 풀려고 하는데, 아무도 "잠깐, 이 단서는 말이 안 돼"라고 말해주지 않아서 계속 엉뚱한 단서를 쫓는 것과 같습니다. 이러한 낭비를 막기 위해 연구자들은 몬테카를로 트리 탐색(MCTS)과 같은 '탐색 알고리즘(search algorithms)'을 사용합니다. 이것은 마치 코치가 "다음 단계로 갈 수 있는 다섯 가지 경로를 시도해보고, 그중 가장 유망해 보이는 것에 집중하자"라고 말하는 것과 같습니다. 하지만 큰 문제가 하나 있습니다. 코치는 어떤 경로가 유망한지 어떻게 알 수 있을까요? 보통 코치는 최종 답변이 맞는지 틀리는지만 알 수 있을 뿐, 중간 단계들이 좋았는지에 대해서는 알지 못합니다. 이 논문은 코치가 게임 중간에 더 나은 결정을 내릴 수 있도록 돕는 새로운 도구를 소개합니다.

논문: MASPRM

이 논문의 저자들(브리티시 컬럼비아 대학교와 화웨이 소속)은 바로 이 문제를 다루고 있습니다. 그들은 MASPRM(Multi-Agent System Process Reward Model)이라는 것을 만들었습니다. MASPRM을 '슈퍼 코치' 또는 '과정 판사'라고 생각할 수 있습니다. 이 모델은 그룹이 성공했는지 확인하기 위해 최종 답변이 나올 때까지 기다리는 것이 아니라, 그룹의 대화를 실시간으로 지켜보며 그들이 주고받는 모든 노트에 점수를 매깁니다.

과거에는 AI 팀이 3단계에서 실수를 하더라도, 마지막에 최종 답변이 틀렸을 때가 되어서야 시스템이 이를 알 수 있었습니다. 그때쯤이면 AI는 이미 잘못된 경로를 탐색하는 데 엄청난 에너지를 낭비한 상태였습니다. MASPRM은 이 판도를 바꿉니다. 이 모델은 '라우티드 트랜스크립트(routed transcript)'—즉, 에이전트들이 서로 보낸 메시지의 순서가 담긴 목록—를 살펴봅니다. 그리고 이 메시지들에 점수를 매겨 "이 기획자의 메시지는 아주 좋은 아이디어니 계속 진행하자"라거나, "이 해결사의 메시지는 아무런 도움이 되지 않으니 즉시 이 가지(branch)를 잘라내자"라고 판단합니다.

코치를 가르치는 방법

이 논문의 가장 멋진 부분 중 하나는 이 '슈퍼 코치'를 어떻게 훈련시켰는가 하는 점입니다. 보통 컴퓨터에게 단계를 판단하는 법을 가르치려면, 사람이 일일이 앉아서 각 단계를 '좋음' 또는 '나쁨'으로 라벨링해야 합니다. 이는 비용이 매우 많이 들고 느린 작업입니다. 저자들은 영리한 지름길을 찾아냈습니다. 그들은 AI 에이전트들이 MCTS라는 탐색 방법을 사용하여 수천 번의 시뮬레이션을 수행하도록 했습니다. 이 시뮬레이션에서 에이전트들은 많은 경로를 탐색하게 됩니다. 그리고 각 경로의 끝에서, 그들은 답이 맞았는지(+1) 틀렸는지(-1)를 알 수 있었습니다.

그 후, 그들은 '역전파(backpropagation)'라는 수학적 기법을 사용했습니다. 잎사귀가 최종 결과인 나무를 상상해 보세요. 만약 잎사귀가 '승리'라면, 그 승리의 가치는 가지를 타고 위로 전달되어 이전 단계들을 가치 있게 만듭니다. 만약 잎사귀가 '패배'라면, 그 가치는 부정적인 방향으로 위로 전달됩니다. MASPRM은 단 한 명의 인간도 "이 단계는 좋았다"라고 말해주지 않았음에도 불구하고, 대화 기록만을 보고 이러한 가치를 예측하는 법을 배웠습니다. MAS-PM은 어떤 대화가 결국 정답으로 이어졌는지를 지켜봄으로써, 유망한 대화와 막다른 골목에서의 논쟁을 구분하는 법을 스스로 학습했습니다.

연구 결과

연구팀은 이 새로운 코치를 네 가지 유명한 벤치마크(수학 문제용 GSM8K 및 MATH, 일반 지식 및 논리용 MMLU 및 LOGIQA)에서 테스트했습니다. 그들은 MASPRM을 다음 두 가지 방법과 비교했습니다:

  1. 정책 가능도(Policy Likelihood): 이는 AI가 목표에 대한 실제 이해 없이 단순히 "다음 단어가 이럴 것 같다"라고 추측하는 것과 같습니다.
  2. ORM (Outcome Reward Model): 이는 중간 단계는 무시하고 오직 최종 답변만 확인하는 구식 코치입니다.

결과는 매우 명확했습니다. 연구진이 MASPRM을 사용하여 탐색을 유도했을 때(특히 MCTS와 Step-Level Beam Search를 사용하여), AI의 문제 해결 능력이 눈에 띄게 향상되었습니다.

  • 15억 파라미터 모델(더 작고 빠른 AI)의 경우, MASPRM은 기존의 Outcome Reward Model에 비해 성공률을 2.0~3.0 포인트 높였습니다.
  • 70억 파라미터 모델(더 크고 똑똑한 AI)의 경우, 향상 폭이 엄청났으며 4.1~14.5 포인트나 뛰어올랐습니다.
  • 가장 어려운 테스트인 GSM8K에서, 7B 모델과 MASPRM의 조합은 **Hit@1 82.9%**에 도달했습니다. 이는 첫 번째 시도에서 정답을 맞힐 확률이 거의 83%에 달한다는 의미입니다.

이 논문은 MASPRM이 '단계별 탐색(stepwise search)'에 특히 효과적이라고 제안합니다. 이는 AI가 어떤 에이전트가 다음에 말할지, 혹은 다음 문장이 무엇이 될지 결정하는 것과 같은 일련의 결정을 내려야 할 때를 말합니다. MASPRM은 이러한 중간 단계들을 판단할 수 있기 때문에, AI가 나쁜 아이디어에 시간을 낭비하는 것을 방지합니다. 또한, MASPRM은 AI의 선택을 더 신뢰할 수 있게 만들었습니다. '최선의 추측'과 '다섯 번째 최선' 사이의 격차가 줄어들었는데, 이는 AI가 자신의 상위 선택지에 대해 더 확신을 갖게 되었음을 의미합니다.

한계와 미래

저자들은 이것이 모든 것을 해결하는 마법 지팡이는 아니라는 점을 분명히 밝히고 있습니다. 이 시스템은 에이전트들이 고정된 일정(누가 언제 말할지에 대한 엄격한 순서)을 가지고 있고, 최종 답변을 명확하게 확인할 수 있을 때(특정 숫자가 나오는 수학 문제처럼) 가장 잘 작동합니다. 저자들은 정해진 하나의 정답이 없는 개방형 과제나, 에이전트들이 실시간으로 역할을 동적으로 바꾸는 시스템에서는 이 방식이 여전히 연구 단계에 있다고 인정했습니다. 또한, 코치가 전체 그룹의 대화가 아닌 단 한 명의 에이전트가 보는 정보만 볼 경우 성능이 떨어지는 것을 발견했는데, 이는 최고의 성과를 내기 위해서는 팀의 채팅에 대한 '전역적 관점(global view)'을 갖는 것이 중요하다는 것을 시사합니다.

요약하자면, MASPRM은 AI 팀이 실시간으로 스스로를 교정하는 법을 가르치는 데 있어 획기적인 진전입니다. 끝까지 가보고 나서야 자신들이 틀렸다는 것을 깨닫는 대신, 이제 그들은 나쁜 경로를 조기에 포착하여 팀을 올바른 길로 인도할 수 있는 코치를 갖게 되었습니다. 이는 시간을 절약하고 더 나은 결과를 얻게 해줍니다. 복잡한 추론 작업에 있어서 비밀은 단순히 더 큰 뇌를 갖는 것이 아니라, 진행되는 과정 속에서 사고 과정을 안내하는 더 나은 방법을 갖는 것임을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →