Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study
본 논문은 Salesforce 에서 모듈화되고 플랫폼에 구애받지 않는 추론 아키텍처의 프로덕션 배포 사례를 제시하며, 이를 통해 Agentforce 및 ApexGuru 와 같은 복합 AI 시스템의 확장 가능하고 비용 효율적이며 저지연 서빙을 가능하게 하여 처리량, 꼬리 지연 및 운영 비용 측면에서 상당한 개선을 이루었으며, 다중 모델 팬아웃과 연쇄적 콜드 스타트와 같은 고유한 과제를 해결했다고 설명합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
Agentforce이라는 바쁘고 고급스러운 레스토랑을 운영한다고 상상해 보세요. 과거 이 레스토랑은 한 명의 수석 셰프가 모든 일 (야채 다지기, 스테이크 구이, 디저트 굽기, 설거지 등) 을 시도했던 단일 거대한 주방 (정적 설정) 을 갖추고 있었습니다. 레스토랑이 바빠지면 주방은 막히게 되었고, 셰프가 휴식을 취하기 위해 멈춰야 할 때 (콜드 스타트) 레스토랑 전체가 음식 제공을 중단했습니다. 그보다 더 나쁜 점은 아무도 식사를 하지 않을 때도 24 시간 내내 셰프의 급여를 지불해야 했다는 것입니다.
이 논문은 Salesforce 가 컴파운드 AI 시스템을 처리하기 위해 그들의"레스토랑"을 어떻게 재건했는지 설명합니다. 하나의 거대한 주방 대신, 그들은 모듈식 온디맨드 식품 배달 네트워크를 구축했습니다.
다음은 이를 간단한 용어로 설명한 방법입니다:
1. 문제:"모든 상황에 맞는"주방
현대 AI 애플리케이션 (Agentforce 나 ApexGuru 와 같은) 은 복잡합니다. 고객이 질문을 하면 시스템이 하나의 로봇에게 답변을 요청하는 것이 아닙니다. 이는 마치 팀원들이 협력하는 것과 같습니다:
- 전문가 A(임베딩 모델) 고객의 기록을 조회합니다.
- 전문가 B(LLM) 응답을 작성합니다.
- 전문가 C(SQL 실행기) 데이터베이스를 확인합니다.
- 전문가 D(분류기) 고객이 실제로 무엇을 원하는지 결정합니다.
과거의"정적"설정에서는 이러한 모든 전문가들이 동일한 하드웨어에 있는 같은 방에 갇혀 있었습니다.
- 병목 현상: 데이터베이스 전문가가 느리면 전체 주문이 지연되었습니다.
- 낭비: 새벽 3 시에"야채 다지기"전문가만 필요하더라도 모든 전문가를 깨어 있고 준비된 상태로 24 시간 유지해야 했습니다.
- "콜드 스타트"악몽: 레스토랑이 1 시간 동안 문을 닫았다가 다시 열면, 모든 전문가가 깨어나고 스트레칭을 하며 도구를 준비해야 했습니다. 고객은 가장 느린 전문가가 깨어날 때까지 기다려야만 음식을 받을 수 있었습니다.
2. 해결책:"스마트 배달 네트워크"
Salesforce 는 스마트하고 역동적인 배달 서비스처럼 작동하는 새로운 아키텍처를 구축했습니다.
- 주문 접수자(예측 서비스) 고객이 주문하면 스마트 디스패처는 주문을 하나의 거대한 주방으로 보내지 않습니다. 대신 주문을 부분으로 나누어 해당 작업에 가장 적합한 특정 전문가들에게 보냅니다.
- 독립적 확장: 100 명이"스테이크"(LLM 호출) 를 주문하면 시스템은 즉시 스테이크 셰프 100 명을 고용합니다. 5 명만"샐러드"(임베딩 호출) 를 주문하면 샐러드 셰프 5 명만 고용합니다. 그들은 같은 주방의 공간을 위해 다투지 않습니다.
- 서버리스(종량제) 전문가들은 주문을 기다리며 건물에 앉아 있지 않습니다. 주문이 들어오면 나타나고 작업이 끝나면 떠나는"클라우드 근로자"입니다. 실제로 일한 시간만큼만 비용을 지불합니다.
3."깨어남"문제 해결 (연쇄적 콜드 스타트)
이 논문은 까다로운 문제를 발견했습니다: 컴파운드 시스템에서 전문가들은 서로 의존합니다. 전문가 A 가 완료되어야 전문가 B 가 시작할 수 있습니다.
- 과거 방식: 레스토랑이 문을 열면 전문가 A 가 깨어납니다 (30 초), 그 다음 전문가 B 가 깨어납니다 (150 초), 그 다음 전문가 C 가 깨어납니다 (20 초). 고객은 총 180 초를 기다려야 합니다.
- 새로운"예열"기법: 시스템은 레시피를 알고 있습니다. 전문가 A 가 호출되는 즉시 시스템은 백그라운드에서 전문가 B 와 C 를 동시에 깨웁니다.
- 결과: 180 초를 기다리는 대신 고객은 약 65 초만 기다리면 됩니다. 논문은 이로 인해"깨어남"시간이 65% 단축되었다고 말합니다.
4. 결과: 더 빠르고, 저렴하며, 매끄러움
실제 고객과 함께 이 새로운 시스템을 1 년 이상 운영한 후 다음과 같은 결과가 나타났습니다:
- 속도: "테일 레이턴시"(느린 고객을 위한 최악의 대기 시간) 가 50% 감소했습니다. 과거 37 초가 걸리던 주문이 이제 약 10~11 초가 걸립니다.
- 용량: 시스템은 기존 주방과 비교해 동시에 3.9 배 더 많은 주문을 처리할 수 있습니다.
- 비용: 유휴 근로자에 대한 지출을 중단했으므로 비용이 30~40% 절감되었습니다.
- 신뢰성: 한 전문가가 아파서 (실패) 도 시스템이 레스토랑 전체를 중단시키지 않습니다. 대신 주문을 그 사람을 우회합니다 (예:"데이터베이스를 확인할 수 없으므로 일반적인 답변을 드리겠습니다"). 레스토랑은 일부 구성 요소가 고장 나더라도 95% 의 시간 동안 문을 엽니다.
5. 주요 교훈 (셰프의 비법)
저자들은 이러한 시스템을 구축하는 모든 사람을 위한 몇 가지 주요 교훈을 공유했습니다:
- 콜드 스타트는 단순히 더해지는 것이 아니라 곱해집니다. 작업 체인이 있다면 대기 시간이 누적됩니다. 하나씩 깨우는 것이 아니라 전체 체인을 한 번에 깨워야 합니다.
- 개별 근로자가 아닌 전체 파이프라인을 관찰하세요. 근로자 자신이 빠를지라도 다른 사람을 기다리며 멈춰 있다면 전체 주문은 느려집니다. 주문의"큰 그림"을 볼 필요가 있습니다.
- 부품을 개별적으로 테스트하세요. 시스템이 모듈식이므로"스테이크 셰프"를 해고하지 않고도"샐러드 셰프"만 새로운 것으로 교체할 수 있습니다. 이를 통해 AI 모델을 주가 아닌일 단위로 개선할 수 있습니다.
- 완벽함보다 점진적 저하가 낫습니다. 시스템의 작은 부분이 고장 나더라도 전체가 충돌해서는 안 됩니다. 전혀 답변을 주지 않는 것보다 약간 덜 자세한 답변을 주는 것이 더 낫습니다.
요약
이 논문은 경직되고 비싼"하나의 주방"AI 설정에서 유연하고"긱 이코노미"스타일의 네트워크로 전환하는 것에 관한 것입니다. 모든 AI 도구를 즉시 확장하거나 축소할 수 있는 별도의 온디맨드 근로자로 취급함으로써 Salesforce 는 수천 명의 기업 사용자를 위해 AI 에이전트를 더 빠르고, 저렴하며, 훨씬 더 신뢰할 수 있게 만들었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.