Accelerating PayPal's Commerce Agent with Speculative Decoding: An Empirical Study on EAGLE3 with Fine-Tuned Nemotron Models
이 논문은 페이팔 커머스 에이전트에서 EAGLE3 기반의 스펙큘레이티브 디코딩을 적용하여 단일 H100 GPU 만으로 두 개의 H100 이 필요한 NVIDIA NIM 과 동등하거나 더 나은 성능을 달성하면서도 처리량을 최대 49% 향상시키고 지연 시간을 33% 단축하며 GPU 비용을 50% 절감할 수 있음을 실증적으로 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
페이팔의 '쇼핑 비서'를 더 빠르게 만든 비밀: 한 장의 종이를 여러 번 읽는 마법
이 논문은 페이팔 (PayPal) 이 운영하는 **'커머스 에이전트'**라는 AI 쇼핑 비서의 속도를 어떻게 획기적으로 높였는지 설명하는 연구 보고서입니다.
기존의 AI 는 한 번에 한 마디씩 천천히 말했지만, 이 연구팀은 "미리 여러 마디를 예상해서, 맞으면 한 번에 내뱉는" 새로운 기술을 도입하여 속도를 2 배 가까이 높이고 비용은 절반으로 줄였습니다.
이 복잡한 내용을 일상적인 비유로 쉽게 풀어보겠습니다.
1. 배경: 느린 AI 비서와 급한 고객
페이팔의 쇼핑 비서 (AI) 는 고객이 "빨간색 운동화를 찾고 싶어"라고 말하면, 이를 분석해서 상품 정보를 찾아주는 일을 합니다.
- 기존 방식 (NIM): 비서가 한 마디씩 생각하며 답을 냅니다. 마치 한 글자씩 써가는 작가처럼, "빨... 빨간... 빨간색..."이라고 천천히 진행합니다. 이 과정이 너무 느려서 고객이 기다리는 시간이 길어졌습니다.
- 목표: 2 초 안에 답을 해야 하는데, 하드웨어 (GPU) 비용은 너무 비쌉니다.
2. 해결책: '예측'을 하는 마법 (Speculative Decoding)
연구팀은 **'스펙큘레이티브 디코딩 (Speculative Decoding)'**이라는 기술을 도입했습니다. 이를 **'예측하는 조수'**가 있는 상황으로 비유해 볼까요?
- 주인장 (주요 AI 모델): 지혜롭지만 느린 고수입니다.
- 조수 (EAGLE3 모델): 똑똑하지만 가볍고 빠른 신참입니다.
기존 방식:
주인장이 한 번에 한 글자씩 씁니다. "사과"라고 말하려면 3 번의 시간이 걸립니다.
새로운 방식 (이 연구의 핵심):
- 조수가 먼저 예측합니다: "주인장님, 아마도 '사' '과' '🍎' 이렇게 세 글자를 말할 것 같아요!"라고 조수가 미리 3 개를 나열합니다.
- 주인장이 한 번에 확인합니다: 주인장은 조수가 쓴 3 개를 한 번에 훑어봅니다.
- 맞으면? "오케이, 다 맞네!"라고 3 개를 한 번에 내뱉습니다. (시간 1 배로 3 배 속도!)
- 틀리면? "아, 두 번째 글자가 틀렸네."라고 수정하고 다시 씁니다.
이 과정에서 **조수가 맞춘 비율 (Acceptance Rate)**이 중요했습니다.
3. 실험 결과: 무엇이 가장 잘 먹혔나?
연구팀은 다양한 조건 (동시 접속자 수, 예측 글자 수) 으로 실험을 해보았습니다.
가장 좋은 조합 (γ=3): 조수가 한 번에 3 개를 예측하는 것이 가장 효과적이었습니다.
- 속도: 기존보다 22%~49% 더 빨라졌습니다.
- 지연 시간: 고객이 기다리는 시간이 18%~33% 줄었습니다.
- 안정성: 사람이 많든 적든, 예측이 맞을 확률이 **약 35.5%**로 매우 일정하게 유지되었습니다. (날씨나 상황에 따라 변하지 않는 '불변의 법칙'처럼!)
너무 많이 예측하면 안 됨 (γ=5): 조수가 한 번에 5 개를 예측하게 했더니, 오히려 속도가 느려졌습니다.
- 이유: 5 개 중 4 개가 틀리면, 주인장이 다시 처음부터 고쳐야 하니까 오히려 시간 낭비가 됩니다. (너무 많은 일을 맡기면 오히려 비효율적이라는 교훈!)
4. 놀라운 발견: 비용 절감의 비밀
가장 흥미로운 점은 하드웨어 비용입니다.
- 기존: 2 대의 고성능 그래픽카드 (H100) 를 써야 했습니다.
- 새로운 방식: 1 대의 그래픽카드만 써도 2 대를 쓸 때보다 성능이 같거나 더 좋았습니다.
- 비유: 원래는 트럭 2 대를 써서 화물을 실어야 했는데, 이제는 트럭 1 대에 '예측 조수'를 태우면 같은 양의 화물을 더 빨리 실을 수 있게 된 것입니다.
- 결과: 하드웨어 비용이 50% 절감되었습니다.
5. 품질은 괜찮은가요? (질문: "속도가 빨라지면 말이 달라지나?")
많은 사람이 "속도를 내면 AI 가 헛소리를 하지 않을까?"라고 걱정합니다. 하지만 연구팀은 **'AI 판사 (LLM-as-Judge)'**를 세워 비교해 보았습니다.
- 결론: 완벽하게 똑같습니다.
- 예측이 틀렸을 때만 다시 고치는 방식이라, 최종적으로 나오는 답변의 품질은 기존과 전혀 차이가 없었습니다.
6. 요약: 이 연구가 우리에게 주는 메시지
- 예측은 중요하다: AI 가 다음 말을 미리 예측해서 한 번에 처리하면 속도가 비약적으로 빨라집니다.
- 적당히 예측하는 게 최고: 너무 적게 예측하면 효과가 없고, 너무 많이 예측하면 실패 확률이 높아집니다. 3 개 정도가 가장 적당했습니다.
- 돈을 아낄 수 있다: 똑같은 성능을 내면서 서버 (하드웨어) 를 절반만 써도 됩니다.
- 품질은 유지된다: 속도를 높였다고 해서 AI 의 지능이 떨어지지 않습니다.
한 줄 요약:
"페이팔은 AI 비서에게 **'미리 3 마디를 예상해 보라'**는 훈련을 시켰더니, 서버 비용은 절반으로 줄면서 고객은 더 빨리 쇼핑을 즐길 수 있게 되었습니다."
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.