← 최신 논문
🤖 AI

Harmonia: End-to-End RAG Serving Optimization

Harmonia는 유연한 파이프라인 인터페이스, 이질성 인지형 배포, 그리고 폐쇄 루프 런타임 컨트롤러를 통해 이질적인 구성 요소 전반의 성능을 최적화하는 엔드 투 엔드 RAG 서빙 프레임워크로, 상용 대안 대비 2.04배 이상의 처리량 향상과 최대 78.4%의 SLO 위반 감소를 달성합니다.

원저자: Saurabh Agarwal, Bodun Hu, Luis Pabon, Myungjin Lee, Jayanth Srinivasa, Aditya Akella

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Saurabh Agarwal, Bodun Hu, Luis Pabon, Myungjin Lee, Jayanth Srinivasa, Aditya Akella

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 고급 레스토랑을 운영하고 있다고 상상해 보세요. 옛날에는 셰프(AI)가 고객이 주문하는 것을 그대로 요리하기만 하면 되었습니다. 하지만 이제 고객들은 "컴파운드 AI(Compound AI)" 요리를 원합니다. 고객은 셰프에게 방대한 요리책 라이브러리를 먼저 확인하고(검색/Retrieval), 보조 셰프에게 레시피를 다시 작성하도록 요청한 뒤(쿼리 변환/Query Transformation), 그 다음에 요리를 할 것(생성/Generation)을 요구합니다.

이것을 **RAG(검색 증강 생성/Retrieval-Augmented Generation)**라고 부릅니다. 이는 AI를 더 똑똑하고 정확하게 만들지만, 이를 효율적으로 운영하는 것은 물류 측면에서 매우 까다로운 일입니다.

이 논문은 이러한 복잡한 AI 요리를 위한 궁극적인 "레스토랑 매니저"로 설계된 새로운 시스템인 **하모니아(Harmonia)**를 소개합니다. 하모니아가 어떻게 작동하는지 쉬운 개념으로 나누어 설명하겠습니다.

문제점: 현재 시스템이 어려움을 겪는 이유

현재 대부분의 AI 시스템은 복잡한 주문을 하나의 거대한 작업 블록처럼 취급합니다. 이들은 전체 주방을 통째로 키우거나 줄이려고 하는데, 이는 비효율적입니다.

  1. "경직된 레시피" 문제: 현재의 도구들은 개발자들이 매우 특정한 방식(마치 엄격한 DSL처럼)으로 코드를 작성하도록 강요합니다. 만약 안전 점검 단계를 추가하는 등 레시피를 약간이라도 바꾸고 싶다면, 전체 주방 프레임워크를 다시 구축해야 하는 경우가 많습니다. 이는 모든 절단 작업에 특정 브랜드의 칼을 반드시 사용해야 하는 것과 같습니다. 다른 도구를 쓰고 싶다면 주방 전체를 새로 사야 하는 상황인 것입니다.
  2. "일률적인 규모" 문제: RAG 워크플로우에서는 어떤 단계는 두뇌(GPU)를 많이 쓰고, 어떤 단계는 메모리(CPU)를 많이 쓰며, 어떤 단계는 단순히 정보를 찾아보기만 합니다(I/O).
    • 비유: 식재료를 찾는 단계는 10초가 걸리는데, 요리하는 단계는 1초밖에 걸리지 않는 주방을 상상해 보세요. 만약 100명의 셰프가 모두 같은 일을 하고 있다면, 99명의 셰프는 재료를 찾고 있는 한 사람을 기다리며 아무것도 못 하고 서 있게 됩니다. 현재의 시스템은 이 전체 그룹을 함께 확장하므로 자원을 낭비하게 됩니다.
  3. "눈 가린 매니저" 문제: 작업량은 끊임없이 변합니다. 때로는 고객이 간단한 질문을 하고, 때로는 라이브러리를 확인하고, 질문을 다시 쓰고, 다시 확인한 뒤에 요리해야 하는 복잡한 요청을 합니다. 현재의 시스템은 이를 예측하지 못합니다. 이들은 긴급한 주문을 우선순위에 두거나 실시간으로 주방 인력을 조정할 수 없으며, 이로 인해 대기 시간이 길어집니다(서비스 수준 목표, 즉 SLO 위반).

해결책: 하모니아(Harmonia)

하모니아는 이 전체 과정을 처음부터 끝까지 관리하는 엔드 투 엔드(end-to-end) 시스템입니다. 하모니아는 세 가지 주요 "초능력"을 가지고 있습니다.

1. 유연한 청사진 (명세 계층/Specification Layer)

하모니아는 개발자가 일상적인 파이썬(Python) 코드로 AI 워크플로우를 작성할 수 있게 해줍니다.

  • 비유: 주방을 설계할 때 엄격한 정부 양식을 채우도록 강요하는 대신, 하모니아는 냅킨에 주방을 그려낼 수 있게 해줍니다. 그런 다음 하모니아는 당신의 그림을 자동으로 읽어 흐름(예: "먼저 라이브러리를 확인한 다음 요리한다")을 이해하고, 이를 기계가 읽을 수 있는 지도로 변의합니다. 새로운 언어를 배울 필요 없이, 당신이 원하는 로직을 그냥 작성하면 됩니다.

2. 스마트한 인력 배치 계획 (배포 계층/Deployment Layer)

워크플로우를 이해한 후, 하모니아는 각 단계에 정확히 몇 명의 "셰프"와 "사서"가 필요한지 계산합니다.

  • 비유: 만약 레시피에서 "검색" 단계가 병목 현상이 된다면, 하모니아는 단순히 일반 셰프 100명을 고용하는 것이 아니라, 100명의 전문 사서와 10명의 요리사만을 고용합니다. 하모니아는 복잡한 수학 문제를 풀어 모든 파이프라인이 낭비 없이 움직일 수 있도록 딱 적절한 양의 자원을 할당합니다. 이는 전체 워크플로우를 하나의 블록이 아닌, 서로 연결된 그래프로 취급합니다.

3. 교통 경찰 (런타임 컨트롤러/Runtime Controller)

이것은 주방이 돌아가는 동안 실시간으로 관찰하는 실시간 매니저입니다.

  • 비유: 번화한 교차로에 서 있는 교통 경찰을 상상해 보세요.
    • 우선순위 지정: 고객이 오래 기다렸거나 주문이 복잡하다면, 경찰은 그들이 새치기하여 지나갈 수 있게 해줍니다.
    • 동적 확장: 만약 "검색" 단계에 갑자기 사람이 몰리면, 경찰은 즉시 더 많은 사서를 호출합니다.
    • 스마트 스트리밍: 데이터를 작은 조각으로 보내는 것(스트리밍)이 빠를 때도 있고, 오히려 통로를 막을 때도 있습니다. 경찰은 현재 주방이 얼마나 바쁜지에 따라 최적의 조각 크기를 결정합니다.

결과: 얼마나 더 나은가?

저자들은 네 가지 유형의 복잡한 AI 워크플로우를 사용하여 하모니아를 두 개의 유명한 상용 시스템(LangChain 및 Haystack)과 비교 테스트했습니다.

  • 속도: 하모니아는 경쟁사보다 평균 2.04배 더 빠르게 요청을 처리했습니다.
  • 신뢰성: 속도 약속(SLO)을 지키지 못한 횟수를 최대 78.4%까지 감소시켰습니다.

핵심 요약

하모니아는 복잡한 AI 워크플로우를 하나의 경직된 기계처럼 취급하는 것을 멈추는 시스템입니다. 대신, 이를 역동적이고 살아있는 생태계로 취급합니다. 개발자가 유연한 워크플로우를 쉽게 구축할 수 있게 하고, 각 단계에 대한 완벽한 자원 조합을 자동으로 찾아내며, 작업량이 혼란스러워질 때도 모든 것이 원활하게 돌아가도록 스마트한 교통 컨트롤러 역할을 수행합니다.

이 논문은 하모니아가 이 세 가지 능력(유연한 코딩, 스마트한 자원 할당, 실시간 제어)을 하나의 패키지로 결고합한 최초의 시스템이며, 현재 사용 가능한 것들보다 훨씬 더 빠르고 신뢰할 수 있다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →