← 최신 논문
🤖 AI

SyncPlan: Long-Horizon LLM Coordination with Explicit Synchronization and Adaptive Correction

SyncPlan은 단일 단계 중앙 집중식 계획, 의존성 관리를 위한 명시적 동기화 프리미티브, 그리고 신선도 탐지기에 의해 트리거되는 적응형 재계획을 결합함으로써 최소한의 지연 시간으로 최첨단 장기 다중 에이전트 협업을 달성하는 계획-실행-수정 프레임워크이다.

원저자: Shen You, Xiaoming Zhu, Weining Weng, Hefei Mei, Weixuan Wang, Zhongshen Li, Zeji LI, Ye-Wen Wang, Zijun Liao, Juchao Zhuo, Yang Wei, Fuhao Qiu, Siqin Li, Zhenjie Lian, Danei Gong, Junkai Ji, Xiangtao
게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shen You, Xiaoming Zhu, Weining Weng, Hefei Mei, Weixuan Wang, Zhongshen Li, Zeji LI, Ye-Wen Wang, Zijun Liao, Juchao Zhuo, Yang Wei, Fuhao Qiu, Siqin Li, Zhenjie Lian, Danei Gong, Junkai Ji, Xiangtao Li, Qiuzhen Lin, Liang Wang, Ka-Chun Wong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구들이 비디오 게임 속에서 거대하고 혼란스러운 퍼즐을 함께 풀려고 노력하는 모습을 상상해 보세요. 그들은 보스를 물리치거나 복잡한 요리를 만드는 것과 같은 공동의 목표를 가지고 있지만, 게임 세계는 예측 불가능합니다. 적들이 갑자기 나타나고, 아이템이 사라지며, 팀원이 어딘가에 끼어버리기도 합니다. 성공하기 위해서 그들은 완벽하게 협력해야 합니다. 이것이 바로 컴퓨터 과학자들이 인공지ộp(AI) 에이전트들이 팀으로서 일하도록 가르치는 분야인 **다중 에이전트 협업(Multi-Agent Coordination)**의 세계입니다.

전통적으로 이러한 팀들은 두 가지 주요 전략에 의존합니다. 첫 번째는 **강화 학습(Reinforcement Learning, RL)**으로, 이는 강아지가 간식을 통해 기술을 배우는 것처럼 시행착오를 통해 에이전트가 학습하는 방식입니다. 이는 빠르고 효율적이지만, 단 하나의 게임만을 위해 방대한 양의 특화된 훈련이 필요할 때가 많아 새로운 상황에 적응하기 어렵습니다. 두 번째 전략은 시를 쓰거나 여러분과 대화할 수 있는 똑똑한 AI인 **대규모 언어 모델(Large Language Models, LLMs)**을 사용하는 것입니다. 이 모델들은 복잡한 지시를 이해하고 계획을 세우는 데 뛰어나지만, 느립니다. 초지능적인 AI에게 매 순간 움직일 때마다 생각을 하라고 요구하는 것은, 천재 요리사에게 칼질을 할 때마다 매번 새로운 레시피를 쓰라고 요구하는 것과 같습니다. 레시피가 완성될 때쯤이면 이미 재료는 다 타버린 상태가 될 것입니다.

연구자들이 답을 찾고자 하는 핵심 질문은 이것입니다: 어떻게 하면 언어 모델의 스마트하고 유연한 계획 능력은 가져오면서도, 빠른 속도의 게임에서는 무용지물로 만드는 느리고 답답한 속도 문제는 해결할 수 있을까?

여기 홍콩 시립대학교, 텐센트 등의 연구진이 제안한 새로운 프레임워크인 SyncPlan이 있습니다. SyncPlan을 AI 에이전트들을 위한 궁극의 팀 캡틴 역할을 수행하도록 설계된 "계획-실행-수정(Plan-Execute-Correct)" 시스템이라고 생각해 보세요. SyncPlan은 AI에게 끊임없이 생각하라고 요구하는 대신, 한 번에 팀 전체를 위한 길고 상세한 스크립트(즉, "공동 계획")를 작성하도록 합니다. 이 스크립트는 각 에이전트가 무엇을 해야 하는지, 언제 움직여야 하는지, 그리고 결정적으로 언제 기다려야 하는지를 알려줍니다.

여기에 영리한 점이 있습니다. 과거에는 만약 AI 팀이 "함께 보스를 공격하자"라고 계획했다면, 한 에이전트가 달려드는 동안 다른 에이전트는 여전히 걷고 있어 재앙을 초래했을 것입니다. SyncPlan은 **명시적 동기화(Explicit Synchronization)**를 통해 이 문제를 해결합니다. 이는 마치 신호등처럼 특수한 "대기(wait)" 명령어를 사용하여, 팀원이 도착하거나 적이 적절한 위치에 올 때까지 에이전트가 잠시 멈추도록 강제합니다. 이를 통해 "함께 협력하라"와 같은 모호한 개념을 엄격하고 기계가 읽을 수 있는 규칙으로 바꾸어 팀원들이 서로 엉키는 것을 방지합니다.

하지만 게임의 상황이 변한다면 어떻게 될까요? 만약 보스가 갑자기 도망간다면요? 만약 팀이 이전의 스크립트를 맹목적으로 따른다면 그들은 실패할 것입니다. SyncPlan에는 비밀 병기가 있습니다. 바로 가벼운 **계획 노후화 탐지기(Plan Staleness Detector, PSD)**입니다. 이는 경기장 옆에서 지켜보는 경계병을 상상해 보세요. 이 경서병은 현재의 게임 상태를 현재의 계획과 끊임없이 대조하여 확인합니다. 만약 이 경계병이 계획이 더 이상 유효하지 않다는 것(예: 보스가 사라짐)을 발견하면, 즉시 "캡틴"(LLM)에게 새로운 스크립트를 작성하라는 신호를 보냅니다. 만약 계획이 여전히 유효하다면, 경계병은 침묵을 지키며 팀이 중단 없이 계속 실행되도록 둡니다. 즉, 이 시스템은 반드시 필요할 때만 느리고 생각하는 AI를 호출함으로써 엄청난 시간을 절약합니다.

연구진은 이 시스템을 두 가지 매우 다른 세계에서 테스트했습니다: 두 에이전트가 수프를 준비해야 하는 혼란스러운 요리 게임인 오버쿡드(Overcooked), 그리고 복잡한 5대 5 전투 아레나 게임인 **왕자영요(Honor of Kings)**입니다. 결과는 인상적이었습니다. 요리 게임에서 SyncPlan은 기존 방식들보다 더 자주 임무를 완수하면서도, 기존 방식들이 소요하는 시간의 0.05% 미만만을 사용했습니다. 전투 아레나에서는 **86.3%**의 성공률을 기록하며 차순위 방법보다 큰 격차로 앞섰으며, 26배 더 빠르게 작동했습니다.

이 논문은 이러한 접근 방식이 '무거운 생각(계획)'과 '빠른 행동(실행)'을 분리하기 때문에 효과적이라고 제약합니다. AI에게 구조화된 스크립트를 쓰는 법을 가르치기 위해 **지도 미세 조정(Supervised Fine-Tuning, SFT)**을 사용하고, 실제 게임 피드백을 바탕으로 이를 정교화하기 위해 **강화 학습(Reinforcement Learning, RL)**을 사용함으로써, 시스템은 똑똑하면서도 빠른 법을 배웁니다. 저자들은 "경계병(PSD)"이 없으면 팀이 종종 갇히거나 잘못된 계획을 따르게 되고, "대기" 명령어가 없으면 서로 충돌하여 실패한다는 것을 발견했습니다.

요약하자면, SyncPlan은 AI를 더 빠르게 생각하게 만드는 것이 아니라, 미리 계획하고, 적절한 순간을 기다리며, 세상이 변할 때만 다시 생각하게 함으로써 AI를 더 똑똑하게 만듭니다. 이는 끊임없이 "무엇을 해야 하지?"라고 묻는 것에서 "여기에 계획이 있고, 여기는 언제 계획을 변경해야 하는지에 대한 규칙이다"라고 말하는 것으로의 전환이며, 느리고 똑똑한 생각가들의 집단을 빠르고 동기화된 팀으로 탈바꿈시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →