← 최신 논문
💬 NLP

Spine-Branch Coordination for Multi-agent Computer Use

이 논문은 컴퓨터 사용 작업을 연속적인 '척추(spine)'와 병렬적인 '가지(branches)'로 분해하여 가상 머신 상태를 병합하는 물리적 불가능성을 피함으로써, 장기 과제에서의 성공률을 크게 높이고 비용을 절감하는 멀티 에이전트 프레임워크인 '척추-가지 협응(Spine-Branch Coordination)'을 제안한다.

원저자: Mian Zhang, Manasi Sharma, Sheng Zhang, Minglai Yang, Kejian Shi, Ying Liu, Zhiyu Zoey Chen, Daniel Yue Zhang

게시일 2026-08-25
📖 5 분 읽기🧠 심층 분석

원저자: Mian Zhang, Manasi Sharma, Sheng Zhang, Minglai Yang, Kejian Shi, Ying Liu, Zhiyu Zoey Chen, Daniel Yue Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대적인 사무실의 조용한 소음 속에서, 새로운 종류의 노동자가 등장했습니다: 바로 컴퓨터 사용 에이전트(computer-use agent)입니다. 이들은 단순히 텍스트를 읽거나 이미지를 생성하는 것을 넘어, 가상의 책상에 앉아 화면을 보고 마우스를 움직이거나 키보드를 타이핑하여 실제 세계의 과업을 수행하도록 설계된 인공지능 시스템입니다. 이들은 항공권을 예약하고, 스프레드시트를 정리하거나, 복잡한 웹사이트를 탐색할 수 있습니다. 이러한 에이전트들이 점점 더 유능해짐에 따라, 연구자들은 마치 인간 프로젝트 매니저가 서로 다른 전문가에게 업무의 각 부분을 할당하듯, 이들이 팀을 이루어 협력하게 만들고자 노력하고 있습니다. 그 희망은 거대하고 복잡한 작업을 작은 조각들로 나누고 여러 에이전트가 동시에 작업하게 함으로써, 단일 에이전트가 혼자 작업할 때보다 더 빠르게, 그리고 더 정확하게 일을 끝내는 것입니다. 그러나 이 디지털 노동자들에게는 그들의 진행 상황을 공유하는 데 있어 근본적인 물리적 한계가 존재합니다. 에이전트가 파일을 복사하거나 텍스트 노트를 복사하여 동료에게 전달하는 것은 쉽지만, 자신의 전체 작업 환경을 복사하는 것은 쉽지 않기 때문입니다. 만약 한 에이전트가 보안 계정에 로그인되어 있고, 수십 개의 브라우저 탭을 열어 놓았으며, 복잡한 양식을 작성하는 도중에 있다면, 그 컴퓨터의 특정 상태는 복제되어 다른 에이전트의 상태와 병합될 수 없습니다. 두 에이전트가 문제의 서로 다른 부분에 대해 작업을 시작하면 그들의 디지털 환경은 갈라지게 되며, 나중에 이를 단순히 하나로 합칠 수 없습니다.

이러한 제약은 AI 에이전트 팀에게 상당한 병목 현상을 초래합니다. 만약 어떤 작업이 한 에이전트가 몇 시간 동안 로그인 상태를 유지해야 하는 동시에 다른 에이전트가 백그라운드에서 데이터를 수집해야 하는 상황을 요구한다면, 팀은 컴퓨터의 실시간으로 진화하는 상태를 어떻게 처리할지 결정해야 합니다. 이전의 시도들은 대개 임시방편적인 해결책에 의존했는데, 시스템이 상태를 병합하는 방법을 추측하려고 시도하거나, 귀중한 진행 상황을 버리고 처음부터 다시 시작하게 하여 시간 낭비와 오류를 초래했습니다. Scale AI, 텍사스 대학교 달라스 캠퍼스, 그리고 존스 홉킨스 대학교의 연구진은 이들을 조직하는 새로운 방법인 '스파인-브랜치 코디네이션(Spine-Branch Coordination)'을 제안했습니다. 이들은 호환되지 않는 환경을 강제로 병합하려고 시도하는 대신, 이 한계를 게임의 핵심 규칙으로 받아들였습니다. 그들은 하나의 에이전트인 '스파인(spine, 척추)'이 작업의 주요하고 연속적인 흐름을 담당하며, 시작부터 끝까지 라이브 컴퓨터 상태를 온전히 유지하도록 설계했습니다. 한편, 다른 에이전트들인 '브랜치(branch, 가지)'들은 정보 수집이나 고립된 작업을 수행하기 위해 신선하고 일회성인 컴퓨터에서 병렬로 실행됩니다. 브랜치 에이전트가 자신의 일을 마치고 다운로드된 파일이나 텍스트 요약과 같은 가시적인 결과물을 만들어내면, 해당 컴퓨터는 단순히 꺼지고 폐기됩니다. 그 결과물은 스파인 에이전트에게 전달되며, 스파인은 두 개의 서로 다른 컴퓨터 상태를 병합할 필요 없이 메인 워크플로우를 계속 이어갑니다.

연구진은 여행 계획을 세우거나 여러 웹사이트에서 제품을 조사하는 것과 같은 다단계 워크플로우를 포함하는 200개의 길고 복잡한 과업을 대상으로 이 접근 방식을 테스트했습니다. 그들은 이 스파인-브랜치 시스템을, 엄격한 분리 없이 여러 에이전트를 관리하려고 했던 기존의 베이스라인 방식 및 단일 에이전트가 혼자 작업하는 방식과 비교했습니다. 결과는 다양한 유형의 AI 모델에 걸쳐 명확하고 일관적이었습니다. 스파인-브랜치 시스템은 과업을 완료하는 데 훨씬 더 자주 성공했으며, 기존의 최선이었던 멀티 에이전트 방식에 비해 성공률을 6.0%에서 16.5% 사이로 향상시켰습니다. 아마도 더 놀라운 점은, 이 시스템을 실행하는 비용이 훨씬 저-렴해졌다는 것입니다. 컴퓨터 상태를 끊임없이 재시작하거나 재구성할 필요를 피함으로써, 시스템은 과업당 비용을 34%에서 70%까지 절감했습니다. 이 연구는 이 방식이 특히 가장 어려운 과업들에 효과적임을 보여주었는데, 이는 연속적이고 끊김 없는 작업의 선을 유지하는 능력이 에이전트들이 길을 잃거나 값비싼 실수를 하지 않고 복잡한 순서를 탐색할 수 있게 해주었기 때문입니다.

이 시스템의 성공은 컴퓨터가 작동하는 물리적 현실을 존중하는 명확한 분업에 달려 있습니다. '스파인' 에이전트는 메인 세션을 유지하는 유일한 존재로서, 재현하기 어렵거나 불가능한 로그인 세션이나 열려 있는 창 등을 보존합니다. 이 에이전트는 이전 단계의 상태를 상속받아 단계별로 앞으로 나아갑니다. '브랜치' 에이전트들은 병렬로 자유롭게 실행되어 다양한 웹사이트를 탐색하거나 데이터를 분석할 수 있지만, 이들은 일시적인 것으로 취급됩니다. 이들은 장기적인 상태를 유지할 필요가 없으며, 단지 파일이나 텍스트로 저장될 수 있는 결과물을 만들어내기만 하면 됩니다. 브랜치가 완료되면 그 컴퓨터는 폐기되고, 그 결과는 스파인에게 전달됩니다. 이러한 설계는 중앙 관리자가 충돌하는 컴퓨터 상태를 지속적으로 조정하려고 시도할 필요를 없애주는데, 이 과정은 종종 오류를 일으키곤 했습니다. 대신, 정보의 흐름은 라이브 상태가 스파인을 따라 한 방향으로 이동하고, 정적인 정보는 필요한 모든 에이전트 사이에 자유롭게 흐르도록 구조화되어 있습니다.

실험에서 연구진은 이러한 구조가 에이전트 팀이 더 효율적이고 오류 없이 작업할 수 있게 한다는 것을 발견했습니다. 워크플로우가 여러 단계에 걸쳐 길게 늘어지는 가장 어려운 과업에서, 스파인-브랜치 시스템은 성능을 유지한 반면 다른 방식들은 성공률이 급격히 떨어졌습니다. 또한 시스템은 AI가 동작을 재시작하거나 재계획해야 하는 횟수를 줄였으며, 이는 시간과 비용을 모두 절약했습니다. 연구진은 이 접근 방식이 더 작고 덜 강력한 에이전트부터 더 크고 유능한 에이전트에 이르기까지 다양한 모델에서 잘 작동한다는 점에 주목했습니다. 중앙 계획 에이전트가 덜 강력하더라도 스파인-브랜치 구조는 견고함을 유지했는데, 이는 과업을 조직하는 방식이 관리자의 순수한 지능보다 더 중요하다는 것을 시사합니다. 또한 연구는 모든 과업이 분업의 혜택을 받는 것은 아니라는 점도 강조했습니다. 매우 단순한 작업의 경우, 여러 에이전트를 조정하는 오버헤드가 오히려 작업을 더 느리고 비싸게 만들 수 있습니다. 그러나 복잡하고 긴 호흡의 과업들을 대표하는 미래의 AI 작업에 있어서, 스파인-브랜치 방식은 호환되지 않는 컴퓨터 상태라는 벽에 부딪히지 않고 규모를 확장할 수 있는 신뢰할 수 있는 방법을 제공합니다.

이 연구의 함의는 단순히 AI 에이전트를 더 빠르게 만드는 것에 그치지 않습니다. 이는 실세계와 상호작용하는 시스템을 구축하는 방법에 대한 새로운 사고방식을 제시합니다. 연구진은 컴퓨터 상태를 병합할 수 없는 것을 해결해야 할 버그가 아닌 근본적인 제약 조건으로 취급함으로써, 더 단순하면서도 효과적인 프레임워크를 만들었습니다. 이 시스템은 불가능한 것을 강요하지 않고, 기술적 한계 내에서 작동하며 가장 효율적인 경로를 찾아냅니다. 이러한 접근 방식은 여러 에이전트가 서로 방해하지 않으면서 협력할 수 있게 하며, 컴퓨터 세션의 귀중한 라이브 상태를 보존하는 동시에 병렬 작업의 속도와 폭을 활용할 수 있도록 보장합니다. 컴퓨터 사용 에이전트가 계속 진화함에 따라, 이들을 효과적으로 조정하는 능력은 개별 지능만큼이나 중요해질 것이며, 스파인-브랜치 방식은 그러한 조정을 실질적이고 확장 가능한 방식으로 달성할 수 있는 명확한 청사진을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →