← 최신 논문
💻 computer science

Closed-Loop Vision-Language Planning for Multi-Agent Coordination

본 논문은 코드 기반 기술 정제와 구조화된 의사소통을 통해 탈중앙화 폐루프 계획을 수행하는 비전-언어 모델을 활용한 새로운 다중 에이전트 프레임워크인 COMPASS 를 소개하며, 이는 전통적인 MARL 베이스라인을 크게 능가하여 SMACv2 벤치마크에서 최첨단 성능을 달성합니다.

원저자: Zhiyuan Li, Wenshuai Zhao, Joni Pajarinen

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhiyuan Li, Wenshuai Zhao, Joni Pajarinen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

5 명의 친구들이 스타크래프트와 같은 복잡하고 빠른 속도의 비디오 게임을 5 명의 적대 팀과 대결하며 플레이하도록 가르친다고 상상해 보세요. 문제는 각 친구는 자신 주변 아주 작은 원만 볼 수 있다는 점입니다. 그들은 전체 지도를 볼 수 없으며, 혼란에 빠지지 않고 자유롭게 대화할 수도 없고, 승리를 위해 순간적인 결정을 내려야 합니다.

이 논문이 다루는 과제가 바로 이것입니다. 전통적인 AI 방법 (예: "다중 에이전트 강화 학습") 은 이러한 친구들에게 게임을 수백만 번 플레이하게 하여 결국 승리 전략을 우연히 발견하기를 바라는 방식과 같습니다. 이는 느리고 비효율적이며, 왜 그들이 특정 행동을 했는지 이해하기 어렵습니다.

저자들은 COMPASS라는 새로운 시스템을 소개합니다. COMPASS 를 게임 화면을 보고 텍스트 로그를 읽을 수 있는 초지능적이고 시각적 감각이 뛰어난 코치 (비전 - 언어 모델) 에 의해 지도받는 5 명의 친구 팀으로 생각해 보세요. COMPASS 의 작동 원리는 세 가지 간단한 부분으로 나뉩니다.

1. "기술 서적"을 가진 코치 (플래너 및 기술 라이브러리)

코치가 "왼쪽으로 가라!"나 "공격하라!"와 같은 무작위 지시를 외치는 대신, 코치는 기술 라이브러리를 가지고 있습니다. 이는 "집중 사격"(모두가 같은 적을 공격함) 이나 "키팅"(사격하며 도망감) 과 같은 특정 전술을 위한 미리 작성된 레시피 (파이썬 코드) 의 요리책과 같습니다.

  • 학습 방식: 코치는 처음부터 시작하지 않습니다. 먼저 게임 플레이 중인 인간 전문가의 "비디오 리플레이"를 읽습니다 (이를 "워밍업"이라고 함). 그런 다음 전문가의 움직임을 코드로 변환하여 요리책에 넣습니다.
  • 적응 방식: 게임 도중 코치가 현재 레시피가 작동하지 않는 상황을 발견하면, 즉시 새로운 레시피를 작성합니다. 예를 들어, 팀이 특정 전투에서 밀리고 있다면, 코치는 "공격적인 측면 공격"이라는 새로운 스크립트를 작성하여 즉시 책에 추가할 수 있습니다.
  • 루프: 코치는 화면을 보고 레시피를 선택하면 에이전트들이 이를 실행하고, 그 후 코치가 결과를 확인합니다. 실패했다면 코치는 반성하고 더 나은 레시피를 작성하여 다시 시도합니다. 이것이 "폐루프" 부분으로, 실시간으로 계속 조정합니다.

2. "속삭임 네트워크" (구조화된 의사소통)

많은 게임에서 에이전트들이 무작위로 대화하면 혼란을 겪거나 사실을 왜곡 (할루시네이션) 합니다. COMPASS 는 엄격한 "속삭임 네트워크"를 사용합니다.

  • 문제: 에이전트 A 가 적을 봅니다. 에이전트 B 는 벽 뒤에 있어 적을 볼 수 없습니다.
  • 해결: 에이전트 A 가 에이전트 C 에게 속삭이고, C 가 에이전트 B 에게 속삭입니다. 이를 멀티홉 전파라고 합니다.
  • 비유: "전화" 게임을 상상해 보세요. 하지만 메시지가 왜곡되는 대신 에이전트들은 정확한 사실을 전달합니다: "적 #1 은 동쪽으로 5 미터". 이를 통해 단일 에이전트가 모든 것을 볼 수 없더라도 팀 전체가 전장의 공유된 정신 지도를 구축할 수 있습니다.

3. "자기 수정" (반성)

매번 행동 후 코치는 스스로에게 묻습니다: "그게 효과가 있었는가?"

  • 팀이 적을 성공적으로 포위했다면, 코치는 "좋아, 그 레시피를 저장해라"라고 말합니다.
  • 팀이 전멸했다면, 코치는 "그건 너무 공격적이었어. 다음에는 더 신중하게 행동하는 새로운 규칙을 작성하자"라고 말합니다.
    이 지속적인 자기 성찰을 통해 팀은 같은 실수를 반복하는 것이 아니라 게임이 진행됨에 따라 더 똑똑해집니다.

결과: 그들이 얼마나 잘했는가?

팀은 SMACv2라고 불리는 스타크래프트 챌린지의 매우 어려운 버전에서 COMPASS 를 테스트했습니다.

  • 대승: 양팀이 모두 5 개의 프로토스 유닛을 가진 특정 시나리오 (균형 잡힌 전투) 에서 COMPASS 는 **57%**의 승률을 기록했습니다. 이전 최고의 AI 방법 (QMIX) 은 **27%**만 승리했습니다. 이는 엄청난 도약입니다.
  • **한계:**该系统은 "저그"종족 (빠르고 약한 유닛들의 군집) 에서는 어려움을 겪었습니다. 코치는 게임 시간 기준으로 10~20 초마다 화면을 확인하고 새로운 코드를 작성하기 때문에, 순간적인 반응이 필요한 저그 유닛들에게는 너무 느렸습니다. 이는 느리게 움직이는 교통 경찰이 벌떼를 지시하려는 것과 같습니다. 벌들은 지시를 따라갈 만큼 너무 빠르게 움직입니다.

요약

COMPASS는 AI 에이전트들이 다음과 같이 협력하도록 하는 시스템입니다:

  1. 비전과 텍스트를 사용하여 인간처럼 게임을 읽기.
  2. 전문가 예시에서 시작하여 플레이하면서 자신만의 설명서 (코드) 를 작성하기.
  3. Everyone 이 무엇을 하고 있는지 알 수 있도록 구조화된 체인을 통해 정보 공유하기. (보이지 않는 부분이라도)

이것은 대규모 AI 모델의 추론 능력과 정보를 공유하고 코드를 작성하는 구조화된 방식을 결합함으로써, 로봇 (또는 게임 에이전트) 이 이전보다 훨씬 빠르고 지능적으로 협력하는 법을 배울 수 있음을 증명합니다. 단, 게임이 AI 가 따라갈 수 없을 정도로 너무 빠르게 움직이지 않는다는 전제가 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →