← 최신 논문
💬 NLP

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

MASPO 는 지역 에이전트 목표와 글로벌 시스템 목표를 정렬하기 위해 공동 평가 메커니즘과 진화적 빔 서치를 활용하여 LLM 기반 다중 에이전트 시스템의 프롬프트를 자동으로 최적화하는 새로운 프레임워크로, 다양한 협업 작업에서 기존 방법들을 능가합니다.

원저자: Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

전문가 로봇 팀이 매우 어려운 퍼즐을 해결하기 위해 협력한다고 상상해 보세요. 각 로봇은 특정 역할을 맡습니다: 한 로봇은 단서를 읽고, 다른 로봇은 계산을 수행하며, 세 번째 로봇은 오류를 확인하고, 네 번째 로봇은 최종 답안을 작성합니다.

과거에는 팀이 실패했을 때 누구를 탓해야 할지 알기 어려웠습니다. 계산 로봇이 수학 실력이 부족했을까요? 아니면 단서 읽기 로봇이 잘못된 단서를 제공했을까요? 이것이 논문 MASPO가 해결하는 문제입니다.

다음은 간단한 비유를 통해 설명한 MASPO의 작동 원리입니다:

1. 문제: 팀 내 "책임 전가" 게임

보통 이러한 로봇 팀을 훈련시킬 때, 우리는 최종 답안만 봅니다. 답이 틀리면 어느 로봇이 실수했는지 알 수 없습니다.

  • 비유: 계주 경기를 상상해 보세요. 팀이 지면 마지막 주자에게만 화를 낼 수는 없습니다. 아마 첫 번째 주자가 배턴을 떨어뜨렸거나, 두 번째 주자가 잘못된 경로를 달렸을 수도 있습니다. 마지막 주자만 더 빠르게 달리도록 훈련한다면, 배턴 넘기 과정이 고장 나 있기 때문에 팀은 여전히 질 것입니다.
  • 논문의 통찰: 저자들은 다중 에이전트 시스템에서 로봇이 자신의 역할을 완벽하게 수행 (국부적 성공) 하더라도, 다음 로봇에게 전체 실패로 이어지는 정보를 전달할 수 있음을 깨달았습니다. 이를 **"국부 - 전역 불일치 (Local-Global Misalignment)"**라고 합니다.

2. 해결책: MASPO (팀 코치)

MASPO는 결승선만 지켜보는 것이 아니라 계주 경기의 모든 배턴 넘기 과정을 지켜보는 똑똑한 코치처럼 작동하는 새로운 프레임워크입니다. 이는 전체 팀이 더 잘 협력하도록 각 로봇의 "지침서 (프롬프트)"를 자동으로 재작성합니다.

이는 세 가지 주요 기법을 사용하여 이루어집니다:

A. "미래 대비" 점수판 (공동 평가)

MASPO는 단순히 "이 로봇이 자신의 일을 잘했는가?"라고 묻는 대신, "이 로봇의 작업이 다음 로봇의 성공을 도왔는가?"라고 묻습니다.

  • 비유: 요리사가 요리를 준비한다고 상상해 보세요. 일반적인 심사관은 수프를 맛보고 "소금이 너무 많네"라고 말할 뿐입니다. 하지만 MASPO는 "이 수프가 다음 요리사가 구워내는 빵과 잘 어울릴 만큼 소금기가 적절한가?"라고 묻는 심사관과 같습니다.
  • 작동 원리: MASPO는 각 로봇에게 다음 세 가지 기준에 따라 점수를 매깁니다:
    1. 자신의 규칙을 따랐는가? (국부적 유효성)
    2. 출력이 다음 로봇의 작업을 더 쉽게 만들었는가? (선제적 잠재력)
    3. 팀이 최종 게임을 이기는 데 도움이 되었는가? (전역 정렬)

B. "거의" 재앙에서 배우기 (불일치 마이닝)

대부분의 시스템은 최종 답이 틀린 경우의 실수로부터만 학습합니다. MASPO는 로봇이 일을 완벽하게 수행했지만 팀은 여전히 실패한 특정하고 교활한 유형의 실수를 찾습니다.

  • 비유: 모든 교통 법규를 완벽하게 준수하는 운전자가 (국부적 성공) 지도가 혼란스러워 실수로 막다른 길로 들어가는 상황을 상상해 보세요. 일반적인 코치는 "잘했어, 운전사!"라고 말하겠지만, MASPO는 "잠깐, 규칙은 지켰지만 우리는 여전히 길을 잃었어. 다음에 막다른 길로 들어가지 않도록 지침을 수정하자"라고 말합니다.
  • 작동 원리: 시스템은 이러한 "국부적 성공, 전역적 실패" 사례를 저장하고 로봇들이 이를 연구하도록 강요하여 동일한 조정 오류가 반복되지 않도록 합니다.

C. "재정렬" 훈련 (빔 리프레시)

로봇들이 학습하고 행동을 바꾸면, 다음 로봇을 위한 지침이 갑자기 구식 정보가 될 수 있습니다.

  • 비유: 댄스 팀을 상상해 보세요. 첫 번째 댄서의 속도가 빨라지면 두 번째 댄서의 타이밍이 이제 맞지 않게 됩니다. 만약 오래된 안무로 연습을 계속한다면, 그들은 계속 서로의 발을 밟게 될 것입니다.
  • 작동 원리: MASPO는 팀을 지속적으로 점검합니다. 첫 번째 로봇이 스타일을 바꾸면 MASPO는 두 번째 로봇의 지침에 대한 "점수"를 즉시 업데이트하여, 과거 버전의 팀이 아닌 현재 현실에 맞춰 연습하도록 합니다.

3. 결과: 더 나은 팀

저자들은 복잡한 수학, 논리 퍼즐, 컴퓨터 코드 작성 등 6 가지 유형의 어려운 작업에서 이를 테스트했습니다.

  • 결과: MASPO로 훈련된 팀은 다른 방법들보다 일관되게 우수한 성과를 거두었습니다. 기존 최우수 방법 대비 정확도가 평균 2.9% 향상되었습니다.
  • 중요성: 이는 로봇들에게 자신의 작업이 팀원에게 미치는 영향 (자신의 작업뿐만 아니라) 을 고려하도록 가르침으로써 전체 시스템이 훨씬 더 똑똑해진다는 것을 증명합니다.

요약

MASPO를 실시간으로 플레이북을 재작성하는 팀 코치라고 생각하세요. 선수들에게 단순히 "최선을 다하라"고 말하는 대신, 플레이어 A 의 패스가 플레이어 B 의 캐치에 어떤 영향을 미치는지 분석하고, 개인 선수뿐만 아니라 전체 팀이 승리하도록 두 선수 모두의 지침을 재작성합니다. MASPO 는 "나는 내 일을 했지만 우리는 여전히 졌다"는 문제를 해결하여, 모든 사람의 역할이 팀 승리를 돕도록 설계되도록 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →