← 최신 논문
🤖 AI

Who Deserves the Reward? SHARP: Shapley Credit-based Optimization for Multi-Agent System

이 논문은 샤플리 기반의 한계 기여도 보상을 활용하여 기여도를 정밀하게 귀속시킴으로써 대규모 언어 모델을 사용하는 다중 에이전트 시스템의 신용 할당 문제를 해결하는 새로운 프레임워크인 SHARP를 소개하며, 이를 통해 기존의 최첨단 방법들을 학습 안정성과 성능 면에서 크게 능가한다.

원저자: Yanming Li, Xuelin Zhang, WenJie Lu, Ziye Tang, Maodong Wu, Haotian Luo, Tongtong Wu, Zijie Peng, Hongze Mi, Yibo Feng, Naiqiang Tan, Chao Huang, Lian Peng, Li Shen

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yanming Li, Xuelin Zhang, WenJie Lu, Ziye Tang, Maodong Wu, Haotian Luo, Tongtong Wu, Zijie Peng, Hongze Mi, Yibo Feng, Naiqiang Tan, Chao Huang, Lian Peng, Li Shen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 고도의 전문성을 요하는 연구 팀의 매니저라고 상상해 보십시오. 당신의 목표는 새로운 컴퓨터 칩의 정확한 사양을 찾아내는 것과 같은 복잡한 미스터리를 해결하는 것입니다. 당신에게는 문제를 작은 과업들로 나누는 **플래너(Planner, 설계자)**와, 웹을 검색하거나 계산을 수행하는 등 실제로 업무를 수행하는 여러 명의 **워커(Worker, 작업자)**들이 있습니다.

과거에 이 팀이 성공하거나 실패했을 때, 보상 체계는 매우 단순했습니다. 팀이 정답을 찾아내면 모두가 금메달을 받았고, 실패하면 모 모두가 레드 카드를 받았습니다.

이것은 큰 문제를 야기했습니다: 누가 실제로 공로를 인정받아야 하는가?

  • 플래너가 훌륭한 로드맵을 제시했는가?
  • 워커 A가 완벽한 기사를 찾아냈는가?
  • 워커 B가 막다른 길의 검색에 시간을 낭비했는가?
  • 워커 C가 계산 실수를 했는가?

팀이 성과와 상관없이 동일한 보상을 받았기 때문에, "학습" 과정은 엉망이 되었습니다. 플래너는 자신의 전략이 좋았는지 알 수 없었고, 워커들은 자신의 특정 행동이 도움이 되었는지 아니면 해가 되었는지 알 수 없었습니다. 이는 마치 한 선수가 계속 공에 걸려 넘어지더라도 팀 전체가 승리하면 트로피를 나눠 갖는 스포츠 팀과 같았습니다.

SHARP의 등장: "공정한 배분" 시스템

이 논문은 SHARP(Shapley Credit-based Optimization for Reinforcement Policy)라고 불리는 새로운 방법을 소개합니다. SHARP를 정교한 회계 시스템이라고 생각하십시오. 이 시스템은 각 팀원이 최종 결과에 정확히 얼마나 기여했는지를 계산해 냅니다.

SHARP가 어떻게 작동하는지 간단한 비유를 통해 설명하겠습니다.

1. 3단계 점수표

SHARP는 하나의 커다란 보상을 주는 대신, 모든 팀원을 위해 점수를 세 가지 특정 부분으로 나눕니다.

  • "우리가 이겼는가?" 보너스 (전역 정확도, Global Accuracy): 팀이 미스터리를 해결하면 모두가 기본 보너스를 받습니다. 이는 모두가 주요 목표에 집중하도록 만듭니다.
  • "만약 ~했다면?" 보너스 (샤플리 크레딧, Shapley Credit): 이것이 핵심적인 부분입니다. SHARP는 다음과 같은 반사실적 질문을 던집니다: "만약 이 특정 인원을 팀에서 제외했다면 어떻게 되었을까?"
    • 만약 워커 A가 없을 때 팀이 실패하지만, A가 있을 때 성공한다면, 워커 A는 거대한 "한계 기여도(marginal credit)" 점수를 받습니다. 그들은 필수적인 존재였습니다!
    • 만약 워커 B가 없어도 팀이 똑같이 잘 해내거나 오히려 더 잘한다면, 워커 B는 낮은 (또는 마이너스) 점수를 받습니다. 그들은 도움이 되지 않았습니다.
    • 이것은 수학적 개념인 **샤플리 값(Shapley Values)**에 기반합니다. 이는 단순히 똑같이 나누는 것이 아니라, 각자가 실제로 얼마나 배고픈지에 따라 피자를 나누는 공정한 방법과 같습니다.
  • "당신의 직무를 제대로 수행했는가?" 보너스 (도구 프로세스, Tool Process): 이것은 워커들이 도구를 올바르게 사용했는지 확인합니다. 만약 어떤 워커가 계산기를 사용하려 했으나 잘못된 공식을 입력했다면, 설령 운 좋게 최종 정답이 맞았더라도 여기서 점수를 잃게 됩니다.

2. "플래너와 워커"의 댄스

이 시스템에서 플래너와 워커들은 하나의 공유된 뇌(단일 대규모 언어 모델, LLM)를 사용하여 함께 훈련됩니다.

  • 플래너는 자신이 할당한 워커들이 얼마나 잘 수행했느냐에 따라 크레딧을 받습니다. 만약 플래너가 실패하는 워커에게 과업을 맡겼다면, 플래너는 다음번에 더 나은 워커를 선택하는 법을 배웁니다.
  • 워커는 자신의 특정 행동이 실제로 변화를 만들어냈는지에 따라 크레딧을 받습니다.

3. 결과: 더 나은 팀

논문은 이 시스템을 실제 세계의 퍼즐(복잡한 수학 문제나 웹 검색 등)에 테스트했습니다. 결과는 다음과 같습니다.

  • 더 나은 성능: SHARP로 훈련된 팀은 기존 방식보다 훨씬 더 많은 문제를 정확하게 해결했습니다. 단일 인원 팀보다 약 23%, 다른 다중 인원 팀보다 14% 더 높은 성능을 보였습니다.
  • 낭비 감소: 시스템은 "나쁜" 행동을 멈추는 법을 배웠습니다. 쓸모없거나 해로운 작업(예: 잘못된 것을 검색하는 것)을 수행하는 워커들을 걸러냄으로써 이러한 행동을 줄였습니다.
  • 안정성: 훈련 과정이 더 매끄러웠습니다. 모든 구성원이 자신이 무엇을 잘했고 잘못했는지 정확히 알았기 때문에, 팀이 혼란에 빠지거나 나쁜 습관의 굴레에 갇히지 않았습니다.

결론

SHARP는 AI 팀을 훈련시키는 새로운 방법입니다. 팀을 단순히 일반적인 보상을 받는 하나의 덩어리로 취급하는 대신, 모든 움직임을 지켜보는 공정한 심판 역할을 합니다. SHARP는 "누가 실제로 차이를 만들었는가?"라고 묻고, 그에 따라 각 에이전트에게 보상을 주거나 교정합니다. 이는 더 똑똑하고 효율적인 팀을 만들어, 무의미한 행동에 시간을 낭비하지 않고 더 어려운 문제들을 해결할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →