Multi-Agent Computer Use
이 논문은 매니저 모델이 동적 유향 비순환 그래프(DAG)를 통해 병렬 서브 에이전트들을 조율함으로써 복잡하고 장기적인 과업을 효과적으로 처리하는 시스템인 Multi-Agent Computer Use (MACU)를 제안하며, 데스크톱 및 웹 내비게이션 벤치마크 전반에서 단일 에이전트 베이스라인 대비 유의미한 성능 향상을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 결혼식이나 기업 연수와 같이 거대하고 복잡한 이벤트를 조직해야 한다고 상상해 보십시오.
과거의 방식 (단일 에이전트):
과거에는 이 일을 완수하기 위해 매우 똑똑하지만 매우 바쁜 비서 한 명을 고용하려 했습니다. 이 비서는 모든 것을 혼자서 해야 했습니다: 케이터링 업체에 전화하고, 장소를 예약하고, 날씨를 확인하고, 꽃을 사는 일까지 말이죠. 만약 케이터링 업체가 "그 날짜에는 예약이 꽉 찼습니다"라고 말한다면, 비서는 하던 일을 멈추고 장소에 전화하여 그 날짜가 비어 있는지 확인하고, 플로리스트에게 연락하여 이용 가능한지 확인한 다음, 다시 케이터링 업체에 전화하여 새로운 날짜를 제안해야 했습니다. 비서가 전화 한 통에 막히게 되면, 이벤트 계획 전체가 중단되었습니다. 그들은 한 번에 한 단계씩, 직선적인 방식으로 작업했으며, 벽에 부딪히면 다른 경로를 시도하기 위해 처음부터 다시 되돌아가야 했습니다.
새로운 방식 (다중 에이전트 컴퓨터 사용 - MACU):
이 논문은 더 똑똑한 방식을 제 제안합니다: **프로젝트 매니저(Project Manager)**와 **전문가 보조팀(Specialist Assistants)**을 고용하는 것입니다.
이 새로운 시스템이 작동하는 방식은 다음과 같습니다 (결혼식 계획 비유 사용):
1. 프로젝트 매니저 (The "Manager")
매니저는 직접 일을 하는 대신, 오직 큰 그림을 보고 **지도(Map)**를 그리는 역할만 수행합니다 (이를 유향 비순환 그래프, 즉 DAG라고 부릅니다).
- 세분화: 매니저는 "결혼식 계획하기"라는 과업을 보고 이를 "장소 찾기", "케이터링 예약하기", "꽃 선택하기", "초대장 보내기"와 같은 작은 조각들로 나눕니다.
- 지도: 매니저는 어떤 작업들이 동시에 일어날 수 있는지 보여주는 지도를 그립니다. 예를 들어, "장소 찾기"와 "케이터링 예약하기"는 서로 의존하지 않으므로 동시에 진행될 수 있습니다.
- 두뇌: 매니저만이 전체 지도를 볼 수 있습니다. 만약 새로운 정보가 들어오면 (예: "장소가 너무 비싸다"), 매니저는 즉시 지도를 다시 그리고, 비싼 장소를 찾는 작업을 취소한 뒤, 다른 보조원을 보내 더 저렴한 장소를 찾게 할 수 있습니다. 이 과정에서 다른 보조원들의 작업은 멈추지 않습니다.
2. 보조팀 (The "Subagents")
매니저는 실제 업무를 수행할 동일한 형태의 보조원(서브에이전트) 팀을 파견합니다.
- 병렬 처리의 힘: 한 사람이 끝날 때까지 기다리는 대신, 매니저는 네 명의 보조원을 동시에 보냅니다. 한 명은 호텔을 확인하고, 다른 한 명은 항공권을 확인하며, 세 번째는 식당을, 네 번째는 날씨를 확인합니다. 이들은 마치 레이싱 카의 타이어를 교체하는 피트 크루처럼 병렬적으로 움직입니다.
- 격리: 각 보조원은 자신만의 전용 "샌드박스"(가상 컴퓨터)에서 작업합니다. 만약 한 보조원이 오류가 나거나 혼란에 빠지더라도, 다른 보조원들에게 영향을 주지 않습니다. 이들은 서로 격리되어 있습니다.
3. "살아있는" 지도 (재계획)
이 부분이 가장 중요합니다. 기존 시스템에서는 계획을 세우면 상황이 변하더라도 그 계획을 고수했습니다.
이 새로운 시스템에서 지도는 살아있습니다.
- 피드백 루프: 보조원이 과업을 마치는 즉시 (예: "호텔을 찾았지만 만실입니다"), 매니저에게 보고합니다.
- 피벗(방향 전환): 매니저는 이 새로운 정보를 보고 즉시 지도를 업데이트합니다. 예를 들어 호텔이 만실이라면, 매니저는 "대체 호텔 찾기"라는 새로운 과업을 추가하고 새로운 보조원을 보내 이를 수행하게 합니다. 만약 보조원이 (작동하지 않는 버튼을 계속 클릭하는 것과 같이) 루프에 빠져 있다면, 매니저는 "그 작업은 중단하고, 다른 접근 방식을 시도하라"고 명령할 수 있습니다.
- 과거 기억하기: 때때로 보조원이 파일이나 특정 정보를 찾아내면, 다음 사람이 필요로 할 수도 있습니다. 매니저는 사서처럼 그 파일을 저장했다가 다음 보조원에게 전달하여, 그들이 처음부터 다시 시작할 필요가 없도록 합니다.
왜 이것이 더 나은가요?
이 논문은 단순한 데스크톱 작업(글꼴 변경 등)부터 웹을 통한 복잡한 다일간의 여행 계획에 이르기까지, 네 가지 다른 유형의 "컴퓨터 작업"을 대상으로 테스트를 진행했습니다.
- 속속도: 복잡한 작업의 경우, 여러 작업을 동시에 수행했기 때문에 단일 보조원보다 약 1.5배 빠르게 완료했습니다.
- 성공률: 팀 방식은 어려운 문제를 해결하는 데 훨씬 뛰어났습니다. 가장 어려운 여행 계획 테스트에서 단일 보조원은 90%의 확률로 실패했지만, 팀은 34%의 성공률을 기록했습니다. 이는 엄청난 도약입니다.
- 탈출 능력: 단일 보조원이 막다른 길에 부딪히면 전체 과정이 멈췄습니다. 그러나 팀 방식은 다른 사람을 보내 다른 문을 시도하게 할 수 있었습니다. 한 경로가 막히더라도, 다른 경로가 이미 열려 있을 수 있기 때문입니다.
핵심 요약
이 논문은 복잡하고 장기적인 컴퓨터 작업을 수행할 때, 하나의 "슈퍼 봇"이 직선적으로 모든 것을 하려고 노력하는 것에 의존해서는 안 된다고 주장합니다. 대신, 유연한 지도를 그리는 매니저와, 병렬로 실행되고, 멈추고, 시작하며, 발견한 내용에 따라 즉각적으로 방향을 바꿀 수 있는 팀을 활용해야 합니다.
이는 정글을 홀로 횡단하려는 고독한 탐험가와, 리더와 지도, 그리고 흩어져서 더 넓은 영역을 커버하고 장애물에 즉각 적응할 수 있는 팀이 있는 가이드 원정대의 차이와 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.