Benchmarking Open-Ended Multi-Agent Coordination in Language Agents
이 논문은 장기 생존 과제에서의 개방형 다중 에이전트 협업을 평가하기 위한 JAX 기반 벤치마크인 *alem*을 소개하며, 최첨단 LLM들이 개별 작업에는 뛰어나지만 협업에서는 상당한 어려움을 겪는다는 점을 밝혀내는데, 이는 의사소통이 결정적인 역할을 하며 모델마다 성능 차이가 크게 나타나는 뚜렷한 병목 구간이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
탐험가들이 거대하고 끊임없이 변화하는 황야에서 살아남기 위해 고군분투하는 모습을 상상해 보십시오. 그들은 나무를 베고, 돌을 캐고, 은신처를 짓고, 괴물과 싸워야 합니다. 하지만 여기 함정이 있습니다. 그들은 혼자서 이 일들을 할 수 없습니다. 때로는 나무를 쓰러뜨리기 위해 정확히 동시에 나무를 베어야 합니다. 또 어떤 경우에는 한 사람이 구멍을 파기 시작하면, 다른 사람이 몇 초 이내에 구멍을 마무리해야 합니다. 그렇지 않으면 구멍이 무너져 버립니다.
이 논문은 AI 에이전트들이 이런 종류의 혼란스럽고 장기적인 생존 게임에서 얼마나 잘 협력할 수 있는지 테스트하기 위한 새로운 "훈련장"인 ALEM(암하라어로 "세계"를 의미)을 소개합니다.
문제점: 솔로 스타 vs 팀 플레이어
지금까지 대부분의 AI 테스트는 마치 싱글 플레이 비디오 게임과 같았습니다. "이 AI가 퍼즐을 풀 수 있는가?" 또는 "미로를 통과할 수 있는가?"를 물었습니다. 하지만 현실 세계에서 AI는 팀으로 일해야 합니다. 저자들은 기존의 팀워크 테스트가 너무 단순하다는 점을 발견했습니다. 즉, 너무 짧거나, 규칙이 고정되어 있거나, 팀원 간의 소통이 거의 필요하지 않았습니다.
그들은 현대적 AI(대규모 언어 모델, LLM)가 **장기적인 협동(long-term coordination)**을 처리할 수 있는지 알고 싶었습니다. 50단계 전의 계획을 기억할 수 있는가? "나는 왼쪽으로 갈 테니 너는 오른쪽으로 가"라고 팀원에게 말할 수 있는가? 상황이 변할 때 적응할 수 있는가?
해결책: ALEM (생존 시뮬레이터)
저자들은 Craftax라는 게임을 기반으로 한 디지털 세계인 ALEM을 구축했습니다. 이것은 고성능 버전의 마인크래프트나 테라리아라고 생각하면 되지만, 다음과 같은 반전이 있습니다:
- 절차적 생성 (Procedural Generation): 게임이 시작될 때마다 지도와 특정 팀워크 과제가 무작위로 생성됩니다. 이는 AI가 단순히 정답을 "암기"하는 것을 방지합니다.
- "협동 스펙트럼" (The Coordination Spectrum): 게임에는 팀워크의 난이도를 조절하는 다이얼이 있습니다.
- 쉬움: 주로 혼자서 작업할 수 있습니다.
- 중간: 도구를 서로 주고받아야 합니다 (예: 벽을 만드는 사람에게 망치를 건네주는 것).
- 어려움: 마치 싱크로나이즈드 스위밍 팀처럼 완벽하게 동시에 움직여야 하며, 그렇지 않으면 과제에 실패합니다.
- 부드러운 전문화 (Soft Specialization): 이 세계에서는 누구나 어떤 일이든 할 수 있지만, 만약 당신이 그 일의 "전문가"가 아니라면 실패할 수도 있습니다. 이는 팀이 현장에서 누가 무엇을 해야 할지 스스로 결정하도록 강제합니다 합니다.
실험: 13명의 AI 에이전트 vs 세상
연구진은 13개의 서로 다른 현대적 AI 모델을 이 세계에 투입했습니다. 그들에게 플레이하는 법을 가르치지 않고 그냥 던져 놓았습니다 (이를 "제로샷(zero-shot)"이라고 합니다). 또한 가능한 성능의 기준점을 제시하기 위해 표준 강화 학습을 사용하여 "로봇" 에이전트들도 훈련시켰습니다.
결과는 놀라웠습니다:
- AI는 고전했습니다: 평균적으로 AI 에이전트들은 가능한 점수의 약 **6%**만을 달성했습니다. 그들은 게임을 해결하기에는 턱없이 부족했습니다.
- 혼자서 똑똑하다고 해서 함께할 때도 똑똑한 것은 아닙니다: 어떤 AI 모델은 단독 작업(예: 나무 모으기)은 잘했지만, 협동에는 형편없었습니다. GPT-5.4 모델은 기본적인 작업은 매우 잘 수행했지만, 팀원과 호흡을 맞춰야 할 때는 처참하게 실패했습니다. 반면 Gemini-3.1 모델은 팀워크에 훨씬 더 뛰어났으며, 가장 어려운 시나리오에서 훈련된 로봇 에이전트 중 일부를 능가하기도 했습니다.
- 크기가 전부가 아닙니다: 더 큰 AI 모델(더 많은 "두뇌 능력"을 가진)이 반드시 팀으로서 더 잘 작동하는 것은 아니었습니다. 때로는 더 작은 모델이 거대한 모델보다 더 잘 협동했습니다.
"왜?": 무엇이 팀워크를 어렵게 만드는가?
연구진은 AI 에이전트의 실패 원인을 파악하기 위해 내부를 분석했습니다. 그들은 세 가지 주요 요인을 발견했습니다:
- 소통이 핵심입니다 (Communication is King): 에이전트들의 대화 능력을 껐을 때, 팀워크 점수는 폭락했습니다. AI 에이전트들은 채팅을 통해 "나는 나무로 갈 테니 너는 여기서 기다려", 또는 "나무 좀 줘"와 같은 말을 사용하고 있었습니다. 이 기능이 없으면 그들은 그저 추측만 할 뿐이었습니다.
- 기억은 계획을 위한 것입니다: AI에게는 "스크래치패드"(개인 메모장)가 있었습니다. 성적이 좋은 모델들은 이 메모장을 사용하여 미래의 계획을 작성했습니다 (예: "1단계: 돌 캐기. 2단계: 화로 만들기"). 약한 모델들은 이 메모장을 현재 보이는 것을 반복하는 데만 사용했으며, 이는 앞날을 계획하는 데 도움이 되지 않았습니다.
- 추론이 도움이 됩니다: AI가 행동하기 전에 "생각"하도록 강제했을 때, 단독 작업과 팀워크 모두에서 더 나은 성과를 보였습니다.
"혼합 팀"의 반전
연구진은 한 팀에 서로 다른 AI 모델을 섞어서 구성해 보기도 했습니다 (예: Gemini 에이전트와 GPT 에이전트가 한 팀이 됨). 그들은 팀의 성적이 가장 똑똑한 구성원을 따라갈 것이라고 예상했습니다. 하지만 실제로는 팀의 성적이 두 모델의 평균 수준에 머물렀습니다. 아주 똑똑한 팀원이 있더라도, 다른 팀원이 계획을 이해하지 못하거나 소통 방식이 맞지 않는다면 도움이 되지 않는다는 사실이 드러났습니다.
결론
이 논문은 협동(coordination)은 현재의 AI가 아직 마스터하지 못한 독특한 기술임을 보여줍니다. 단순히 질문에 답하거나 혼자서 퍼즐을 푸는 데 능숙하다고 해서, 팀으로서 일할 수 있다는 뜻은 아닙니다.
ALEM은 이 특정한 "팀워크 병목 현상"을 측정할 수 있는 통제된 방법을 제공합니다. 이는 우리가 AI가 현실 세계에서 인간이나 다른 AI와 진정으로 협력할 수 있도록 만들려면, 단순히 단독 작업에 대해 더 똑똑하게 만드는 것에 집중할 것이 아니라, 어떻게 소통하고, 함께 계획하며, 서로를 신뢰할 것인지를 가르치는 데 더 집중해야 함을 보여줍니다.
이 "생존 시뮬레이터"의 코드는 다른 연구자들이 사용하고 개선할 수 있도록 공개되어 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.