← 최신 논문
🤖 AI

MARFT: Multi-Agent Reinforcement Fine-Tuning

이 논문은 Flex-MG라고 불리는 새로운 마르코프 게임 정식화와 대규모 언어 모델 기반 다중 에이전트 시스템에 강화 학습을 적용할 때 발생하는 고유한 과제들을 극복하기 위해 설계된 보편적인 알고리즘 접근 방식을 특징으로 하는 다중 에이전트 강화 미세 조정(Multi-Agent Reinforcement Fine-Tuning, MARFT) 프레임워크를 소개한다.

원저자: Junwei Liao, Muning Wen, Jun Wang, Weinan Zhang

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Junwei Liao, Muning Wen, Jun Wang, Weinan Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: AI 전문가 팀이 협력하는 법 가르치기

여러분이 대화와 글쓰기에 능숙한 매우 똑똑한 로봇들(대규모 언어 모델, 즉 LLM)로 구성된 팀을 가지고 있다고 상상해 보세요. 개별적으로는 매우 똑똑합니다. 하지만 여행 계획을 세우거나, 복잡한 컴퓨터 프로그램을 작성하거나, 과학 연구를 수행하는 것과 같은 복잡한 문제를 함께 해결하라고 요청하면, 이들은 종음에 어려움을 겪습니다. 서로 말을 끊거나, 누가 무엇을 해야 하는지 잊어버리거나, 목표에 대해 혼란을 겪기도 합니다.

이 논문은 MARFT(Multi-Agent Reinforcement Fine-Tuning)라는 새로운 훈련 방법을 소개합니다. MARFT를 이 AI 에이전트들이 개별적인 지능을 잃지 않으면서도 효과적으로 협업하는 법을 배우도록 설계된 특화된 "팀 코칭" 시스템이라고 생각하세요.

문제점: 기존 방식들이 실패하는 이유

저자들은 기존의 로봇 팀 훈련 방식(다중 에이전트 강화 학습, 즉 MARL이라 불리는)을 이 새로운 AI 팀에 그대로 적용할 수 없다고 설명합니다. 그 이유는 다음과 같습니다.

  1. "동시적" vs "순차적" 불일치:

    • 기존 방식: 전통적인 훈련은 축구 팀이 동시에 공을 차는 것처럼 모든 구성원이 정확히 동시에 행동한다고 가정합니다.
    • 현실: AI 에이전트들은 보통 순차적으로 작동합니다. 한 에이전트가 "날짜 정보가 필요해"라고 말하면, 다음 에이전트는 그 말을 듣고 나서야 "알겠어, 항공권을 예약할게"라고 말하며 기다립니다.
    • 해결책: MARFT는 팀을 모두가 동시에 소리 지르는 상황이 아니라, 한 사람이 말하면 다음 사람이 말하는 이어달리기나 대화처럼 취급합니다.
  2. "정체성 위기":

    • 기 old 방식: 전통적인 훈련에서 에이전트들은 종종 똑같이 생긴 쌍둥이와 같습니다.
    • 현실: 실제 AI 팀에서는 한 에이전트는 "기획자(Planner)", 다른 에이전트는 "코더(Coder)", 또 다른 에이전트는 "검증자(Checker)" 역할을 합니다. 이들은 각기 다른 직무와 "성격(프롬프트)"을 가지고 있습니다.
    • 해결책: MARFT는 시스템이 이러한 특정 역할을 존중하도록 가르칩니다. 이를 통해 "코더"가 "기획자"처럼 행동하려고 시도하지 않도록 보장합니다.
  3. "망각"의 위험:

    • 기존 방식: 로봇이 게임에서 이기도록 너무 강하게 훈련하면, 인간의 언어로 말하는 법을 잊어버릴 수 있습니다.
    • 현실: 우리는 이 AI 에이전트들이 좋은 문장을 쓰거나 맥락을 이해하는 능력을 유지하면서도, 과업을 해결하는 능력을 향상시키기를 원합니다.
    • 해결책: MARFT는 "미세 조정(Fine-Tuning)" 방법입니다. 이는 전면적인 개조라기보다 부드러운 독려와 같습니다. 원래의 언어 능력을 온전히 유지하면서 팀워크를 개선합니다.

해결책: MARFT는 어떻게 작동하는가?

논문은 Flex-MG(Flexible Markov Game)라고 불리는 새로운 프레임워크를 제안합니다. 이것이 어떻게 작동하는지 쉬운 말로 설명하면 다음과 같습니다.

  • "의존성 지도(Dependency Map)": 흐름도를 상상해 보세요. MARFT는 "에이전트 B는 에이전트 A가 마칠 때까지 행동할 수 없다"라고 명시하는 지도를 만듭니다. 이는 AI 에이전트들이 서로의 출력값에 의존하는 상황을 처리합니다.
  • "코치"(중앙 비평가, Central Critic): MARFT는 팀 전체를 지켜보는 중앙 "코치"(신경망)를 사용합니다. 코치는 단순히 에이전트가 자신의 일을 잘 해낸 것에 대해 칭찬하는 것이 아니라, 에이전트가 팀 전체의 승리에 기여한 것에 대해 칭찬합니다.
  • 토큰 단위 훈련(Token-Level Training): 단순히 최종 답변(예: "항공권 예약이 완료되었는가?")에 보상을 주는 대신, MARFT는 에이전트가 생성하는 모든 단어(토큰)를 살펴봅니다. 이는 마치 선생님이 학생의 에세이를 최종 성적만으로 채점하는 것이 아니라, 문장 하나하나를 검토하며 채점하는 것과 같습니다. 이를 통해 에이전트들은 단순히 '무엇을 말할지'가 아니라 '어떻게 생각할지'를 배웁니다.

실험: 실제로 효과가 있는가?

저자들은 이 방법을 수학코딩이라는 두 가지 어려운 과업에 테스트했습니다.

  • 설정: 그들은 서로 다른 역할(예: 기획자, 해결사, 검증자)을 가진 AI 에이전트 팀(2, 3, 또는 4명)을 구성했습니다.
  • 비교: 그들은 에이전트들을 따로 훈련시킨 뒤 한데 모아놓는 표준 방식(Independent PPO)과 MARFT를 비교했습니다.
  • 결과:
    • 더 높은 점수: MARFT 팀은 수학 문제와 코딩 벤치마크에서 표준 팀보다 일관되게 높은 점수를 기록했습니다.
    • 안정성: 표준 방식은 훈련 중에 가끔 오류가 나거나 혼란을 겪었지만, MARFT는 꾸준하고 매끄럽게 향상되었습니다.
    • "익명성"의 놀라운 결과: 흥 nghiệm한 실험으로, 그들은 특정 직함(예: 기획자 또는 해결사)을 주지 않고 팀을 훈련시켜 보았습니다. 놀랍게도 익명의 팀들은 스스로 역할을 찾아내는 법을 배웠으며, 어떤 경우에는 직함이 미리 부여된 팀보다 더 높은 성능을 보이기도 했습니다. 이는 MARFT가 AI가 스스로 조직을 구성할 수 있도록 할 만큼 유연하다는 것을 시사합니다.

"Flex-MG" 개념

논문은 Flex-MG라는 새로운 수학적 모델을 도입합니다. 이것을 보드게임의 새로운 규칙서라고 생각해 보세요.

  • 기존의 규칙서에서는 모두가 동시에 움직입니다.
  • Flex-MG 규칙서에서는 게임을 진행하면서 게임이 변합니다. 때로는 혼자 움직이고, 때로는 팀원의 차례를 기다려야 합니다. 때로는 이전 턴에 일어난 일에 따라 규칙이 바뀝니다. 이 규칙서는 실제 AI 팀이 작동하는 복잡하고 역동적인 방식에 맞춰 설계되었습니다.

향-후 과제 (도전 과제)

저자들은 MARFT가 큰 진전이지만, 여전히 극복해야 할 과제가 있음을 인정합니다.

  • 연습 필드를 찾기 어려움: AI 팀이 연습할 수 있는 현실적이고 역동적인 환경(예: 시뮬레이션된 도시나 복잡한 사무실)을 구축하는 것은 어렵습니다.
  • 데이터 갈증: 모든 AI 훈련과 마찬가지로, 학습을 위해서는 많은 양의 고품질 예시가 필요합니다.
  • 표준 도구의 부재: 이러한 모든 특징을 결합하여 누구나 사용할 수 있는 단일하고 사용하기 쉬운 "도구 상자"는 아직 존재하지 않습니다.

요약

요약하자면, MARFT는 AI 에이전트 팀을 훈련시키는 새로운 방법입니다. 이들을 동기화된 게임을 하는 동일한 로봇들로 취급하는 대신, 순차적으로 협력하는 다양한 인간 전문가 그룹으로 취급합니다. 이 방식은 그들을 안내하는 "코치"를 활용하고, 특정 역할을 존중하며, 인간의 언어를 구사하는 능력을 잃지 않으면서도 팀워크를 향상시킵니다. 결과적으로 이 방법은 AI 팀이 수학과 코딩 같은 복잡한 문제를 해결할 때 더 똑똑하고, 안정적이며, 더 나은 성과를 내도록 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →