← 최신 논문
💬 NLP

Scaling Multiagent Systems with Process Rewards

이 논문은 AI 피드백으로부터 얻은 행동별 프로세스 보상을 활용하여 다중 에이전트 시스템의 신용 할당 및 샘플 효율성 문제를 해결하는 미세 조정 방법인 MAPPA를 소개하며, 복잡한 수학 및 데이터 분석 작업에서 상당한 성능 향상을 입증한다.

원저자: Ed Li, Junyu Ren, Cat Yan

게시일 2026-02-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ed Li, Junyu Ren, Cat Yan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 어려운 퍼즐을 풀기 위해 협력하는 세 명의 전문가 팀이 있다고 상상해 보세요. 아이디어를 내는 문제 해결사(Problem Solver), 아이디어를 테스트할 도구를 만드는 코드 실행자(Code Executor), 그리고 최종 답안을 확인하는 **검증자(Verifier)**가 그들입니다.

과거에는 팀이 실패하면 그룹 전체가 "엄지 아래(thumbs down)"를 받았고, 성공하면 "엄지 위(thumbs up)"를 받았습니다. 이 방식은 누가 실수를 했는지 알기 어렵게 만들었습니다. 생각하는 사람이 나쁜 아이디어를 낸 것일까요? 만드는 사람이 잘못된 도구를 사용한 것일까요? 아니면 검사자가 오타를 놓친 것일까요?

이 논문은 이러한 팀을 훈련시키는 새로운 방법인 MAPPA를 소개합니다. MAPPA는 팀의 모든 움직임을 지켜보고 즉각적인 피드백을 주는 AI 코치를 활용하여, 게임이 끝날 때까지 기다려 팀 전체에 점수를 매기는 대신 더 정교한 방식을 사용합니다.

작동 원리는 다음과 같습니다. 이해를 돕기 위해 쉬운 비유를 들어 설명하겠습니다.

1. 문제점: "그룹 성적"의 함정

팀이 경기 끝에만 점수를 받는 이어달리기 경주를 상상해 보세요. 만약 팀이 졌다면, 첫 번째 주자가 바톤을 떨어뜨렸는지, 두 번째 주자가 발이 걸려 넘어졌는지, 아니면 세 번째 주자가 길을 잘못 들었는지 알 수 없습니다.

  • 논문의 과제: 다중 에이전트 시스템에서 결과가 틀렸을 경우, 어떤 에이전트에게 책임을 물어야 할지 판단하기 어렵습니다. 또한, 이러한 시뮬레이션을 실행하는 데는 오랜 시간이 걸리기 때문에(마라톤을 완주하는 것처럼), 단 한 번의 "엄지 위"나 "엄지 아래"를 얻기 위해 시뮬레이션을 여러 번 반복할 여유가 없습니다.

2. 해결책: "AI 코치"

MAPPA는 실시간으로 경기를 관람하는 스포츠 코치처럼 행동하는 AI 코치(똑똑한 언어 모델)를 투입합니다.

  • 모든 플레이 관찰: 코치는 경기가 끝날 때까지 기다리는 대신, 모든 패스, 달리기, 태클을 지켜봅니다.
  • 맥락 파고들기: 코치는 각 플레이어의 역할을 알고 있습니다. 만약 "코드 실행자"가 "문제 해결사"가 생성했어야 할 파일을 열려고 시도한다면, 코치는 실행자가 파일을 열지 못한 것을 탓하는 것이 아니라, 파일이 누락된 것에 대해 문제 해결사에게 책임을 묻습니다.
  • 조밀한 피드백: 코치는 모든 개별 동작에 대해 점수(0~10점)를 부여합니다. 이는 팀이 하나의 긴 과제를 수행하는 동안 단 한 번의 큰 성적표 대신, 수백 번의 작은 레슨을 받게 됨을 의미합니다.

3. 훈련 방식

이 논문은 REINFORCE++(학습 알고리즘의 일종)라는 방법을 사용합니다.

  • 루프(Loop): 팀은 문제(수학 경시대회 문제나 데이터 과학 프로젝트 등)를 해결하려고 시도합니다.
  • 검토: 매 단계가 끝난 후, AI 코치는 "좋은 움직임이었습니다" 또는 "파일을 저장하는 것을 잊었기 때문에 나쁜 움직임이었습니다"라고 말합니다.
  • 레슨: 팀은 이 점수들을 사용하여 다음번에 더 나은 움직임을 보일 수 있도록 자신들의 "근육 기억"(내부 가중치)을 조정합니다.

4. 결과: 어떤 일이 일어났는가?

연구진은 이를 두 가지 매우 다른 "스포츠"에서 테스트했습니다.

  • 수학 경시대회 (AIME & AMC): 팀은 어려운 수학 문제를 푸는 능력이 눈에 띄게 향상되었습니다.
    • 비유: 이는 마치 30문제 중 25문제를 풀던 수학 팀이, 사고 과정을 단계별로 교정해 주는 코치를 만난 후 갑자기 30문제 중 30문제를 모두 풀게 된 것과 같습니다.
  • 데이터 과학 파이프라인 (DSBench): 팀은 복잡한 데이터 분석 워크플로우(데이터 정제, 모델 학습, 예측 수행 등)를 구축하는 법을 배웠습니다.
    • 비유: 건설 현장의 작업팀을 상상해 보세요. 이전에는 벽은 세울 수 있어도 지붕을 잊어버릴 수 있었습니다. 코치와 함께하면서, 그들은 "데이터 엔지니어"가 기초를 다지는 것을 잊으면 "모델러"가 벽을 세울 수 없다는 것을 배웠습니다. 코치는 기초를 먼저 고쳐야 한다고 가르쳤습니다.

5. 이것이 왜 중요한가?

  • "정답(Ground Truth)"이 필요 없음: 보통 AI를 훈련시키려면 완벽한 정답지가 필요합니다. 하지만 MAPPA는 정답지가 없어도 작동합니다. 코치는 논리를 사용하여 "이 단계는 타당하다" 혹은 "이 단계는 혼란스럽다"라고 판단합니다.
  • 전문화: 각 에이전트가 자신의 역할에 맞는 구체적인 피드백을 받기 때문에, 다른 에이전트에게 방해가 되지 않으면서도 자신의 특정 업무에 전문가가 될 수 있습니다.
  • 효율성: 코치가 매 단계마다 피드백을 주기 때문에 팀은 훨씬 빠르게 학습합니다. 무엇이 잘못되었는지 알기 위해 시뮬레이션을 100번씩 돌릴 필요가 없습니다. 코치가 즉시 알려주기 때문입니다.

요 요약

이 논문은 단순히 경기가 끝난 후의 성적 대신, 모든 움직임을 비평하는 실시간 AI 코치를 도입함으로써, AI 에이전트 팀이 복잡하고 긴 과제를 훨씬 더 잘, 그리고 더 빠르게 해결하도록 훈련할 수 있음을 보여줍니다. 이는 혼란스러운 집단적 노력을 모두가 무엇을 개선해야 할지 정확히 아는 잘 훈련된 팀으로 변화시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →