← 최신 논문
💻 computer science

Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications

본 논문은 엔터프라이즈 애플리케이션을 위한 LLM 기반 멀티 에이전트 시스템의 확장 가능하고 비용 효율적이며 견고한 배포를 가능하게 하기 위해, 고급 모델 커스터마이징 기술과 추론 가속화 기술인 스펙큘레이티브 디코딩(speculative decoding) 및 FP8 양자화를 결합한 통합 2단계 프레임워크를 제안하며, 이를 통해 4.48배의 처리량 향상을 달성한다.

원저자: Paresh Dashore, Shreyas Kulkarni, Uttam Gurram, Nadia Bathaee, Kartik Balasubramaniam, Genta Indra Winata, Sambit Sahu, Shi-Xiong Zhang

게시일 2026-06-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Paresh Dashore, Shreyas Kulkarni, Uttam Gurram, Nadia Bathaee, Kartik Balasubramaniam, Genta Indra Winata, Sambit Sahu, Shi-Xiong Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 번창하는 고급 자동차 판매 대리점을 운영하고 있다고 상상해 보세요. 당신은 고객의 시승 예약을 돕기 위해 협력하는 다섯 명의 유능하고 전문적인 전문가들(멀티 에이전트 시스템)을 보유하고 있습니다.

  1. **이해자(The Understander)**는 고객이 원하는 바를 경청합니다.
  2. **설계자(The Planner)**는 최선의 단계를 구상합니다.
  3. **평가자(Evaluator)**는 안전 가드 역할을 하며, 계획이 안전하고 논리적인지 확인합니다.
  4. **실행자(The Executor)**는 실제로 예약을 확정합니다.
  5. **설명자(The Explainer)**는 고객에게 최종 세부 사항을 전달합니다.

과거에 이 팀은 "슈퍼 전문가"(거대 AI 모델)에 의해 운영되었습니다. 슈퍼 전문가는 믿을 수 없을 정도로 똑똑했지만, 느리고 비용이 많이 들었으며, 엄청난 양의 사무실 공간(컴퓨팅 파워)을 차지했습니다. 고객이 복잡한 질문을 하면 팀은 슈퍼 전문가를 다섯 번이나 따로 호출해야 했기에, 대기 시간은 길어지고 청구되는 비용은 높아졌습니다.

이 논문의 저자들(Capital One 소속)은 이 팀의 지적 능력은 유지하면서도 더 빠르고, 저렴하며, 운영하기 쉽게 만들고 싶었습니다. 그들은 이를 두 가지 주요 단계로 수행했습니다: 새로운 인턴 교육워크플로우 최적화입니다.

1단계: 새로운 인턴 교육 (에이전트 모델 커스터마이징)

모든 업무에 느린 슈퍼 전문가에게 의존하는 대신, 그들은 작고 빠른 "인턴"(소형 AI 모델)을 훈련시켜 업무를 수행하기로 했습니다. 하지만 그들은 단순히 인턴에게 교과서를 준 것이 아니라, 영리한 3단계 훈련 캠프를 활용했습니다.

  • 1단계: 맥락적 속성 과정 (지속적 사전 학습 - Continual Pretraining):
    보통 새로운 직원에게 특정 산업(예: 자동차 판매)을 가르칠 때, 그들은 일반적인 영어를 잊어버리거나 일반적인 지능을 잃을 수 있습니다. 이를 해결하기 위해 저자들은 매 레슨 전에 인턴에게 "맥락적 단서"를 제공했습니다. 이는 책의 한 장을 읽기 전에, 시작하기 전 앞 장의 요약본을 먼저 읽는 것과 같습니다. 이를 통해 인턴은 자동차 판매 규칙을 배우면서도 일반적인 기술을 잊지 않고 매끄러운 상태를 유지할 수 있었습니다.

  • 2단계: 마스터 섀도잉 (지도 미세 조정 - Supervised Fine-Tuning):
    인턴은 슈퍼 전문가가 수천 건의 실제 고객 대화를 처리하는 과정을 관찰했습니다. 그러나 슈퍼 전문가는 때때로 작은 실수를 하거나, 기술적으로는 맞지만 '완벽하지는 않은' 답변을 내놓기도 했습니다. 이를 바로잡기 위해, 그들은 훨씬 더 똑똑한 "판사" AI를 사용하여 슈퍼 전문가의 결과물을 검토하고 답변을 완벽하게 다시 작성하도록 했습니다. 인턴은 가공되지 않은 답변이 아닌, 이 완벽하게 재작성된 답변으로부터 학습했습니다.

  • 3단계: 고객이 '진짜' 무엇을 좋아하는지 배우기 (선호도 최적화 - Preference Optimization):
    때로는 질문에 대해 두 가지 방식의 답변이 존재할 수 있습니다. 하나는 안전한 방식이고, 다른 하나는 위험한 방식입니다. 인턴은 어떤 것을 고객이 선호하는지 배워야 했습니다. 팀은 인턴에게 쌍으로 된 답변들을 보여주었습니다: "이것은 좋다 (선택됨)" vs "이것은 나쁘다 (거부됨)". 인턴은 "선택된" 경로를 선택하도록 학습하며, 비즈니스가 실제로 원하는 방향에 자신의 행동을 맞추었습니다.

결과: 이제 그들은 거대한 슈퍼 전문가만큼이나 업무 수행 능력이 뛰어나면서도, 훨씬 가볍고 관리하기 쉬운 작고 빠른 인턴을 갖게 되었습니다.

2단계: 워크플로우 초강력 엔진 탑재 (추론 최적화 - Inference Optimization)

빠른 인턴을 갖게 되었음에도 불구하고, 컴퓨터가 정보를 처리하는 방식 때문에 시스템은 여전히 다소 느렸습니다. 그들은 두 가지 "터보 부스트"를 추가했습니다.

  • "추측하고 확인하기" 기법 (추측 디코딩 - Speculative Decoding):
    보통 AI는 한 번에 한 단어씩 쓰며, 매 글자마다 자신의 작업을 확인합니다. 이는 문장을 한 글자씩 타이핑하고 글자 하나를 칠 때마다 "엔터"를 누르는 것과 같습니다.
    저자들은 메인 인턴이 단어를 쓰기 전에 다음 몇 단어를 미리 추측하는 아주 작은 "초안 보조자(Draft Assistant)"(매우 작은 AI)를 추가했습니다. 메인 인한은 그 추측들이 맞는지 빠르게 확인합니다. 만약 맞다면, 그들은 한꺼번에 모든 단어를 승인합니다. 이는 초안 보조자가 냅킨 위에 문장 전체를 적으면, 인턴이 그 위에 "승인" 도장을 찍는 것과 같습니다. 이 방식은 엄청난 시간을 절약해 줍니다.

  • "가벼운 유니폼" (FP8 양자화 - FP8 Quantization):
    AI 모델들은 보통 많은 메모리를 차지하는 무거운 "옷"(고정밀 수학 숫자)을 입습니다. 저자들은 이 무거운 옷을 "가벼운 유니폼"(FP8이라 불리는 특정 압축 수학 방식)으로 교체했습니다. 이를 통해 인턴이 업무 수행 방식을 잊지 않으면서도, 모델이 사용하는 메모리를 절반으로 줄이고 속도를 두 배로 높일 수 있었습니다.

최종 결과

스마트한 인턴추측 및 확인 기법과 가벼운 유니폼을 결합함으로써, 팀은 놀라운 성과를 거두었습니다.

  • 속도: 시스템은 기존 설정보다 4.48배 더 빨라졌습니다.
  • 품질: 새로운 시스템은 멍청해지지 않았습니다. 오히려 복잡하고 까다로운 상황(긴 대화나 특이한 요청 등)을 기존의 거대 모델보다 더 잘 처리했습니다.
  • 비용: 더 빠르고 메모리를 적게 사용하기 때문에 운영 비용이 훨씬 저렴합니다.

핵심 교훈:
이 논문은 복잡한 문제를 해결하기 위해 반드시 거대하고 느린 뇌가 필요한 것은 아니라는 점을 가르쳐 줍니다. 작은 뇌를 올바른 데이터와 학습 방법을 통해 정교하게 훈련시키고, 적절한 도구(예: "추측하고 확인하기" 기법)를 제공한다면, 매우 빠르면서도 매우 똑똑한 시스템을 구축할 수 있습니다. 이것은 단순히 더 열심히 하는 것이 아니라, 더 스마트하게 일하는 법에 관한 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →