← 최신 논문
💻 computer science

MARS: Efficient, Adaptive Co-Scheduling for Heterogeneous Agentic Systems

MARS 는 허용과 실행을 분리하고 상태 유지를 최적화함으로써 자율 LLM 에이전트를 위한 이종 GPU-CPU 자원을 전역적으로 조정하는 효율적이고 적응적인 공동 스케줄링 시스템으로, 높은 처리량을 유지하면서 종단 간 지연을 크게 줄입니다.

원저자: Yifei Wang, Hancheng Ye, Yechen Xu, Cong Guo, Chiyue Wei, Qinsi Wang, Dongting Li, Tingjun Chen, Hai "Helen" Li, Danyang Zhuo, Yiran Chen

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yifei Wang, Hancheng Ye, Yechen Xu, Cong Guo, Chiyue Wei, Qinsi Wang, Dongting Li, Tingjun Chen, Hai "Helen" Li, Danyang Zhuo, Yiran Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 바쁘고 첨단 기술이 갖춰진 주방을 운영한다고 상상해 보세요. 과거에는 이 주방이 단순한 일회성 요리 (단일 텍스트 응답과 같은) 만 만들었습니다. 셰프들 (GPU) 만이 중요했으며, 목표는 단순히 시간당 가능한 한 많은 요리를 만드는 것이었습니다.

하지만 오늘날 주방은 변했습니다. 이제 이 주방은 자율 에이전트를 운영합니다. 이를 단순히 요리를 하는 것이 아니라 문제 해결을 위해 복잡한 여정을 떠나는 슈퍼 셰프로 생각하세요. 그들은 조금 요리한 뒤 재료를 가져오기 위해 식료품 저장고 (도구 사용) 로 달려가거나, 레시피 책 (파일 읽기) 을 확인한 뒤 다시 스토브로 돌아와 조금 더 요리하고, 일이 끝날 때까지 이 루프를 수십 번 반복합니다.

이 논문은 바로 이 혼란스럽고 다단계적인 요리 스타일을 위해 특별히 설계된 새로운 "주방 관리자"인 MARS를 소개합니다. 간단한 비유를 통해 그 작동 방식을 살펴보겠습니다.

문제: 낡은 주방이 고장 나고 있습니다

낡은 주방 관리자 (기존 AI 시스템) 들은 "일회성 요리" 시대를 위해 설계되었습니다. 이러한 새로운 복잡한 에이전트 여정에 직면했을 때, 그들은 세 가지 큰 실수를 저질렀습니다.

  1. "중단과 재개"의 함정: 셰프가 요리를 멈추고 식료품 저장고 (CPU 도구 실행) 로 달려갈 때, 낡은 관리자는 공간을 절약하기 위해 셰프의 메모 (KV 캐시) 를 버리거나, 카운터를 가득 채우는 방식으로 영구적으로 보관했습니다. 메모가 버려지면 셰프는 돌아와서 레시피를 처음부터 다시 써야 하므로 엄청난 시간이 낭비되었습니다.
  2. "대량 주문"의 마비: 거대하고 복잡한 주문 (긴 컨텍스트) 이 들어오면 스토브를 장악하여 그 뒤에 있는 작고 빠른 주문들까지 막아버렸습니다. 비록 그 작은 주문들이 준비되어 있었다 하더라도 말입니다.
  3. "맹점": 관리자는 오직 스토브 (GPU) 만 지켜봤습니다. 식료품 저장고 (CPU) 가 막혀 있다는 사실을 보지 못했습니다. 그래서 저장고가 가득 차 있음에도 불구하고 계속 셰프들을 스토브로 보냈고, 이로 인해 재료를 기다리며 셰프들이 서서히 멈추는 교통 체증이 발생했습니다.

해결책: MARS (스마트 주방 관리자)

MARS는 스토브와 저장고를 모두 보고 완벽하게 조율하는 중추 신경계로 작동하여 이를 해결합니다.

1. "통합 정보 스트림" (무전기)

추측 대신 MARS는 스토브와 저장고를 연결하는 실시간 피드를 갖추고 있습니다.

  • 작동 방식: 셰프가 식료품 저장고로 가려고 멈추거나 재료를 들고 돌아올 때마다 신호가 즉시 전송됩니다. 관리자는 셰프가 왜 멈췄는지, 언제 돌아올지 정확히 압니다.
  • 이점: 관리자는 추측할 필요가 없습니다. 셰프의 메모를 위해 얼마나 많은 카운터 공간 (메모리) 을 유지해야 하는지, 그리고 언제 새로운 주문을 위해 공간을 비워야 하는지 정확히 알 수 있습니다.

2. "외부 제어 플레인" (문지기)

새로운 주문이 주방에 들어오기 전에 MARS는 주방이 실제로 이를 처리할 수 있는지 확인합니다.

  • 작동 방식: 두 가지를 확인합니다. 스토브가 비었는가? 식료품 저장고가 비었는가? 만약 도구 작업으로 인해 저장고가 막혀 있다면, 스토브가 비어 있더라도 MARS는 "지금은 새로운 주문을 받지 않는다"고 말합니다. 이는 주방이 압도되는 것을 방지합니다.
  • 이점: 한 번에 너무 많은 주문을 받아 전체적인 마비로 이어져 아무것도 완료되지 않는 상황을 막아줍니다.

3. "내부 에이전트 중심 스케줄러" (스마트 디스패처)

주문이 들어온 후 MARS는 누가 다음에 요리할지 결정합니다. 단순히 "선착순" 줄을 따르지 않습니다.

  • 작동 방식:
    • 우선순위: 셰프가 빠르고 상호작용적인 단계에 있다면, MARS는 그들을 먼저 진행시킵니다. 셰프가 거대하고 느린 레시피에 갇혀 있다면, MARS는 다른 이들이 완료할 수 있도록 잠시 멈추게 하여 "대량 주문" 마비를 방지합니다.
    • "웜 리쥼" 트릭: MARS는 셰프의 메모 (KV 캐시) 를 카운터에 유지할지 여부를 지능적으로 결정합니다. 셰프가 2 초 후에 돌아온다면 MARS는 메모를 유지하여 시간을 절약합니다. 만약 20 분 동안 떠난다면, MARS는 다른 이들을 위해 메모를 지웁니다. 실제로 시간을 절약할 때만 메모를 유지합니다.

결과: 더 빠르고 매끄러움

이 논문은 MARS를 실제 시나리오 (소프트웨어를 작성하고 테스트하는 코딩 어시스턴트 등) 에서 테스트했습니다.

  • 속도: MARS는 통제된 테스트에서 에이전트가 작업을 완료하는 속도를 기존 시스템보다 최대 5.94 배 빠르게 만들었습니다. 실제 코딩 환경에서는 작업 완료 속도가 1.87 배 빨라졌습니다.
  • 신뢰성: 기존 시스템은 너무 막혀서 아예 작업을 완료하지 못하게 되는 (높은 "처리량"이지만 "유효 처리량"은 제로) 반면, MARS는 주방이 원활하게 작동하도록 유지하여 작업이 실제로 제시간에 완료되도록 보장했습니다.

요약

MARS는 스토브 위의 냄비 개수만 세는 주방 관리자와 레스토랑 전체 흐름을 이해하는 관리자의 차이라고 생각하세요. 스토브와 저장고를 동시에 관찰하고, 누가 다음에 요리할지, 어떤 메모를 유지할지 지능적으로 결정함으로써 MARS는 복잡한 다단계 AI 에이전트들이 교통 체증에 갇히지 않고 효율적으로 작업할 수 있도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →