← 최신 논문
🤖 AI

Towards Understanding, Analyzing, and Optimizing Agentic AI Execution: A CPU-Centric Perspective

이 논문은 에이전트 AI 워크로드의 CPU 중심 병목 현상을 분석하고, 이를 해결하기 위해 CPU-GPU 동시 활용을 최적화하는 COMB 및 MAS 스케줄링 기법을 제안하여 지연 시간을 크게 단축하는 효과를 입증합니다.

원저자: Ritik Raj, Souvik Kundu, Ishita Vohra, Hong Wang, Tushar Krishna

게시일 2026-04-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ritik Raj, Souvik Kundu, Ishita Vohra, Hong Wang, Tushar Krishna

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 비유: "명령을 내리는 지휘관 (CPU) 과 천재 화가 (GPU)"

지금까지 우리는 AI 가 그림을 그릴 때 (문장을 만들 때) **GPU(그래픽 카드)**가 모든 일을 한다고 생각했습니다. 마치 천재 화가가 캔버스 앞에서 붓을 휘두르는 것처럼 말이죠.

하지만 이 논문은 **"아니요, 화가보다 더 바쁜 사람이 있어요!"**라고 말합니다. 그 사람이 바로 **CPU(중앙 처리 장치)**입니다.

1. 문제 상황: 화가는 쉬는데 지휘관이 지친 이유

에이전트 AI 는 단순히 글을 쓰는 게 아니라, 도구를 사용합니다.

  • "날씨를 찾아봐" (웹 검색)
  • "이 파일을 열어봐" (파일 조작)
  • "이 계산을 해줘" (수학 계산)

이때 **천재 화가 (GPU)**는 그림을 그리는 데만 집중하고, **지휘관 (CPU)**이 도구를 들고 뛰어다니며 일을 처리합니다.

  • 기존의 생각: "화가가 더 빠르니까 GPU 를 더 많이 쓰면 되겠지?"
  • 실제 상황: 화가는 아주 빠르게 그림을 그리지만, 지휘관이 도구를 찾으러 뛰어다니느라 전체 작업이 지휘관 때문에 멈춰 서는 것이죠.
    • 논문 결과에 따르면, 어떤 작업에서는 전체 시간의 80% 이상을 CPU 가 도구를 처리하는 데 보냈습니다.
    • 특히 고성능 GPU 를 쓰면 화가가 더 빨라져서, 지휘관 (CPU) 의 한계가 더 극명하게 드러나 전체 시스템이 느려집니다.

2. 해결책 1: "작은 그룹으로 나누고 겹쳐서 일하기" (COMB)

기존에는 작업을 한 번에 128 개나 몰아서 처리하려 했습니다. 하지만 CPU 지휘관에게 128 개의 도구를 한 번에 주면, 지휘관이 너무 바빠서 오히려 엉망이 됩니다 (이걸 '과부하'라고 합니다).

  • 새로운 방법 (COMB):
    1. 작은 그룹으로 나누기: 128 개를 64 개씩 두 그룹으로 나눕니다. CPU 가 64 개만 처리하면 훨씬 효율적입니다.
    2. 겹쳐서 일하기 (파이프라인): 첫 번째 그룹 (64 개) 이 CPU 에서 도구를 처리하는 동안, 두 번째 그룹 (64 개) 은 이미 GPU(화가) 가 그림을 그리기 시작하게 합니다.
    • 효과: 지휘관이 쉬는 시간 없이, 화가도 쉬는 시간 없이 동시에 일하게 되어 전체 처리 속도가 1.7 배~3.9 배 빨라집니다.

3. 해결책 2: "서로 다른 업무를 섞어서 공정하게 처리하기" (MAS)

실제 서비스에서는 두 가지 종류의 요청이 섞여 옵니다.

  • A 타입 (CPU 중시): "웹 검색하고 요약해줘" (지휘관이 많이 필요함)
  • B 타입 (GPU 중시): "그냥 이거만 써줘" (화가만 필요함)

기존 방식은 이 두 가지를 한 줄에 섞어서 처리했습니다. 만약 A 타입 요청이 갑자기 몰리면, 지휘관이 바빠져서 B 타입 요청 (화가만 필요한 일) 도 기다려야 합니다. 반대로 B 타입이 몰리면 화가가 바빠서 A 타입이 기다리게 되죠.

  • 새로운 방법 (MAS):
    • 두 개의 대기열 만들기: CPU 가 필요한 요청과 GPU 가 필요한 요청을 서로 다른 줄로 나눕니다.
    • 공정한 배분: 한쪽 줄이 너무 길어지지 않도록, 각 줄에 최대 대기 인원을 정해둡니다.
    • 효과: "도구 사용이 필요한 요청"이 몰려도 "그림만 그리는 요청"이 기다리지 않게 되어, 소수 요청도 공정하게 빠르게 처리됩니다.

📝 요약: 이 연구가 우리에게 주는 메시지

  1. AI 는 혼자 일하지 않습니다: 에이전트 AI 는 CPU(지휘관) 와 GPU(화가) 가 팀을 이루어 일합니다.
  2. 병목은 CPU 에 있습니다: 화가 (GPU) 가 아무리 빨라도, 지휘관 (CPU) 이 도구를 처리하는 속도가 느리면 전체가 느려집니다.
  3. 해결책은 '조율'입니다:
    • 작업을 너무 많이 몰지 말고 작게 나누어 겹쳐서 처리하세요 (COMB).
    • 서로 다른 성격의 요청을 공정하게 분리해서 처리하세요 (MAS).

이 연구를 통해 앞으로의 AI 서비스는 GPU 만 좋으면 되는 게 아니라, CPU 와 GPU 가 서로 맞춰서 일하는 '팀워크'가 중요하다는 점을 깨닫게 되었습니다. 마치 오케스트라에서 지휘자와 악기들이 완벽하게 조화를 이루어야 아름다운 음악이 나오는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →