← 최신 논문
💻 computer science

An Empirical Study of Coordination Mode as the First-Class Citizen in From-Scratch Multi-Agent Coding

이 논문은 실제 풀스택 프로젝트와 자동화된 평가 프레임워크를 활용하여 조직적 토폴로지가 속도, 비용, 품질 간의 트레이드오프에 상당한 영향을 미치며 종종 모델 성능만큼이나 중요하게 작용함을 입증하는, 바닥부터 시작하는 멀티 에이전트 코딩을 위한 엄격한 벤치마크인 MSEval을 소개한다.

원저자: Yanyu Ren, Yunfeng Bai, Xizheng Wang, Li Chen, Dan Li

게시일 2026-07-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yanyu Ren, Yunfeng Bai, Xizheng Wang, Li Chen, Dan Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

소프트웨어를 만드는 일이 단 한 명의 천재적인 코더를 위한 외로운 작업이 아니라, 디지털 노동자들로 구성된 팀이 운영하는 북적이는 건설 현장이 되는 세상을 상상해 보십시오. 이것이 바로 **멀티 에이전트 시스템(Multi-Agent Systems)**의 영역입니다. 이곳에서는 인공지능(AI)이 단순히 코드 한 줄을 쓰는 것에 그치지 않고, 협력하여 처음부터 전체 애플리케이션을 구축합니다. 마치 친구들이 나무집을 지으려는 것과 같습니다. 한 명은 설계도를 그리고, 다른 한 하나는 나무를 자르고, 세 번째 친구는 벽을 칠할 수 있습니다. 하지만 여기에는 함정이 있습니다. 만약 그들이 서로 대화하지 않거나, 누가 망치를 가질지를 두고 다툰다면, 나무집은 삐뚤어지거나 미완성되거나 완전히 무너져 버릴 수도 있습니다. 오랫동안 과학자들은 이 AI 팀들에게 "에이전트 하나가 고장 난 장난감을 고칠 수 있는가?"라고 물으며 실험을 진행해 왔습니다. 하지만 현실 세계는 더 복잡합니다. 현실은 "팀 전체가 스카이스크래퍼를 짓고, 의견 충돌을 해결하며, 예산을 다 쓰지 않고 제시간에 마칠 수 있는가?"라고 묻습니다. 이것이 바로 연구자들이 현재 다루고 있는 거대한 질문입니다. 즉, AI 에이전트 팀이 단순히 흉내를 내는 것이 아니라, 실제로 소프트웨어를 만들기 위해 어떻게 협력할 수 있는지 그 측정 방법을 고민하는 것입니다.

칭화대학교와 중관촌 실험실의 연구진이 만든 새로운 AI 팀 테스트용 "체육관", MSEval을 만나보십시오. MSEval은 AI 팀에게 모든 나사의 위치까지 지정된 정교한 설계도를 주는 대신, 마치 선생님의 과제물처럼 대략적인 아이디어만을 건네주고 그들이 밑바닥부터 풀스택 웹 앱을 구축하는 과정을 지켜봅니다. 연구진은 100가지의 서로 다른 시나리오를 포함하는 대규모 실험을 설정했습니다. 여기에는 실시간 스트리밍 교육 플랫폼이나 인스턴트 메시징 앱과 같은 10개의 실제 프로젝트와, AI 팀이 조직되는 10가지의 서로 다른 방식을 혼합했습니다. 어떤 팀은 작업이 체인처럼 전달되는 엄격한 조립 라인처럼 작동했고, 어떤 팀은 적절한 작업을 스스로 찾아가는 벌떼처럼 행동했습니다. 또한 어떤 팀은 모두를 감시하는 "관리자" AI를 두기도 했고, 어떤 팀은 에이전트들이 서로 경쟁하게 하기도 했습니다.

연구진은 단순히 최종 앱이 작동하는지만을 본 것이 아니라, 모든 것을 측정했습니다. 그들은 소요 시간(벽시계 시간), 디지털 통화(토큰) 비용, 그리고 AI가 실수를 수정하기 위해 몇 번이나 다시 시도했는지를 추적했습니다. 연구진은 TAgent라는 특별한 자동 채점기를 사용했는데, 이는 마치 매우 엄격한 조교와 같습니다. TAgent는 단순히 코드를 읽는 데 그치지 않고, 실제로 라이브 웹사이트를 방문하여 버튼을 클릭하고, 로그인이 작동하는지 확인하며, 코드에서 숨겨진 보안 결함을 스캔합니다. 그런 다음 팀에게 "채팅 기능은 작동하지만, 메시지를 저장하는 것을 잊었습니다"와 같이 구체적인 피드백을 주어 팀이 다시 시도할 수 있게 합니다.

결과는 놀라웠습니다. 연구는 팀이 어떻게 조직되느냐가 AI 모델이 얼마나 똑똑한가만큼 중요하다는 것을 밝혀냈습니다. 실제로 팀의 "토폴로지(topology, 구조)"를 변경하는 것만으로도 최종 점수가 30점 이상 변동하거나 완료 시간이 두 배로 늘어날 수 있었습니다. 예를 들어, 에이전트들이 명확한 단계에 따라 작업을 넘겨주는 구조화된 파이프라인은 종종 가장 높은 품질의 결과물을 가장 빠르게 만들어냈습니다. 반면, 과도한 관리 감독이 있거나 혼란스러운 "스워밍(swarming, 군집)" 방식의 팀은 논쟁이나 중복 작업으로 인해 시간과 비용을 낭비하며 정체되는 경우가 많았습니다. 흥로도, 연구진은 단순히 더 강력한 AI 모델을 보유하는 것이 성공을 보장하지 않는다는 것을 발견했습니다. 약간 덜 강력한 모델이라도 더 나은 팀 구조를 갖춘 모델이 혼란스러운 팀을 가진 초강력 모델보다 더 뛰어난 성과를 내기도 했습니다.

또한 이 논문은 이러한 AI 팀들이 완전히 "붕괴"하는 경우는 드물다는 사실을 밝혔습니다. 대신, 그들은 대개 작동은 하지만 불완전한 시스템을 구축하곤 합니다. 가장 흔한 실패는 치명적인 오류가 아니라, 문은 열리지만 잠기지는 않는 것과 같은 기능 누락이나 논리적 공백이었습니다. 이 연구는 AI 팀이 미래에 진정으로 유용해지기 위해서는 그들의 협업 스타일을 유연한 도구로 취급해야 한다고 제안합니다. 우리는 단순히 가장 "똑똑한" AI를 선택하고 운에 맡기는 것이 아니라, 그들이 어떻게 대화할지, 프로젝트의 어느 부분을 누가 소유할지, 그리고 언제 멈추고 수정할지를 신중하게 설계해야 합니다. MSEval은 소프트웨어를 구축하는 경주에서 비결은 단순한 원초적 지능이 아니라, 조정의 기술이라는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →