← नवीनतम पेपर
🤖 machine learning

Accelerating PayPal's Commerce Agent with Speculative Decoding: An Empirical Study on EAGLE3 with Fine-Tuned Nemotron Models

यह अनुभवजन्य अध्ययन प्रदर्शित करता है कि PayPal के कॉमर्स एजेंट पर एक फाइन-ट्यून्ड नेमेट्रॉन (Nemotron) मॉडल के साथ EAGLE3 स्पेकुलेटिव डिकोडिंग को लागू करने से आउटपुट गुणवत्ता बनाए रखते हुए थ्रूपुट और लेटेंसी में महत्वपूर्ण सुधार प्राप्त होता है, जो अंततः मानक NVIDIA NIM डिप्लॉयमेंट की तुलना में GPU लागत में 50% की कमी सक्षम करता है।

मूल लेखक: Ally Qin, Jian Wan, Sarat Mudunuri, Srinivasan Manoharan

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ally Qin, Jian Wan, Sarat Mudunuri, Srinivasan Manoharan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि PayPal के "कॉमर्स एजेंट" (Commerce Agent) को एक अत्यधिक कुशल, सुपर-फास्ट पर्सनल शॉपर के रूप में। इसका काम आपके द्वारा टाइप किए गए शब्दों को सुनना है (जैसे "मुझे शादी के लिए $50 के अंदर एक लाल ड्रेस चाहिए") और तुरंत उसे उत्पादों की एक सटीक सूची में बदल देना है।

अतीत में, यह शॉपर पहले से ही बहुत तेज़ था क्योंकि टीम ने इसे विशेष रूप से खरीदारी के बारे में सिखाया था (फाइन-ट्यूनिंग)। लेकिन वे इसे और भी तेज़ और चलाने में सस्ता बनाना चाहते थे, बिना इसे कम बुद्धिमान बनाए।

यह पेपर एक चतुर ट्रिक के बारे में है जिसे उन्होंने स्पेक्युलेटिव डिकोडिंग (Speculative Decoding) कहा है, विशेष रूप से EAGLE3 का उपयोग करके। यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ समझाया गया है।

समस्या: "एक-एक कदम पर" की बाधा (The "One-Step-at-a-Time" Bottleneck)

सामान्य तौर पर, जब एक AI वाक्य लिखता है, तो यह एक बहुत ही सावधान लेखक की तरह होता है जो एक बार में एक शब्द लिखता है।

  1. वह पहले शब्द के बारे में सोचता है।
  2. वह उसे लिखता है।
  3. वह दूसरे शब्द के बारे में सोचता है।
  4. वह उसे लिखता है।
  5. और इसी तरह...

यह धीमा है क्योंकि कंप्यूटर को हर एक शब्द के लिए रुककर सोचना पड़ता है। AI की दुनिया में, इसे "ऑटोरिग्रेसिव जनरेशन" (autoregressive generation) कहा जाता है। यह एक ऐसे शेफ की तरह है जो सूप को चखता है, नमक का एक चुटकी डालता है, फिर से चखता है, फिर एक चुटकी डालता है, फिर से चखता है... बजाय इसके कि सही मात्रा का अंदाज़ा लगा ले और उसे एक ही बार में डाल दे।

समाधान: "ड्राफ्ट्समैन" और "एडिटर" (The "Draftsman" and the "Editor")

टीम ने एक स्पेक्युलेटिव डिकोडिंग सिस्टम पेश किया। इसे एक दो-सदस्यीय टीम के रूप में सोचें:

  1. ड्राफ्ट्समैन (EAGLE3): यह एक छोटा, सुपर-फास्ट, "लाइटवेट" AI है। यह मुख्य AI जितना स्मार्ट नहीं है, लेकिन यह अविश्वसनीय रूप से तेज़ है। इसका काम वाक्य के अगले कुछ शब्दों का एक साथ अनुमान लगाना है।
  2. एडिटर (मुख्य AI): यह बड़ा, स्मार्ट, महंगा AI है। यह शब्द खुद नहीं लिखता है। इसके बजाय, यह ड्राफ्ट्समैन के अनुमानों को देखता है और कहता है, "हाँ, यह सही है!" या "नहीं, यह गलत है।"

यह कैसे तेज़ करता है:

  • पुराना तरीका: एडिटर 1 शब्द लिखता है, रुकता है, सोचता है, 1 शब्द लिखता है, रुकता है। (10 शब्द = 10 रुकना)।
  • नया तरीका: ड्राफ्ट्समैन तुरंत 3 शब्द गेस करता है। एडिटर एक ही "एक नज़र" में उन सभी की जाँच करता है। यदि एडिटर उन सभी से सहमत है, तो वे सभी एक साथ स्वीकार कर लिए जाते हैं।
  • परिणाम: टीम को 1 शब्द की लागत पर 3 शब्द मिलते हैं। यह उस शेफ की तरह है जो पूरी रेसिपी का अंदाज़ा लगा लेता है और बस अंतिम स्वाद की जाँच करता है, बजाय इसके कि हर नमक की चुटकी के बाद चखता रहे।

प्रयोग: टीम का परीक्षण (The Experiment: Testing the Team)

शोधकर्ताओं ने इसे PayPal के वास्तविक शॉपिंग सिस्टम पर टेस्ट किया। उन्होंने एक दौड़ आयोजित की:

  • टीम A (बेसलाइन): मानक, शक्तिशाली AI जो दो विशाल सुपर-कंप्यूटर चिप्स (H100 GPUs) पर चल रहा है।
  • टीम B (स्पेक्युलेटिव टीम): वही शक्तिशाली AI, लेकिन "ड्राफ्ट्समैन" सहायक के साथ, जो उन्हीं दो चिप्स पर चल रहा है।

उन्होंने इसे विभिन्न स्थितियों में टेस्ट किया:

  • भीड़भाड़ (Crowdedness): क्या होता है जब 1 व्यक्ति सवाल पूछता है बनाम 32 लोग एक साथ सवाल पूछते हैं?
  • रचनात्मकता (Creativity): क्या होगा यदि AI को बहुत सख्त (Temperature 0) होना पड़े या थोड़ा रचनात्मक (Temperature 0.5) होना पड़े?
  • अनुमान की लंबाई (Guessing Length): क्या होगा यदि ड्राफ्ट्समैन एक बार में 3 शब्द गेस करता है (γ=3) बनाम 5 शब्द (γ=5)?

बड़ी जीत (The Big Wins - The Results)

1. "स्वीट स्पॉट" 3 शब्द है
जब ड्राफ्ट्समैन ने एक बार में 3 शब्दों का अनुमान लगाया, तो यह एक बड़ी सफलता रही।

  • गति: सिस्टम 22% से 49% तेज़ हो गया।
  • विश्वसनीयता: ड्राफ्ट्समैन 35.5% बार सही था। यह आश्चर्यजनक रूप से स्थिर है! चाहे सिस्टम व्यस्त हो या शांत, ड्राफ्ट्समैन ने उसी सफलता दर को बनाए रखा।
  • 5 क्यों नहीं? जब उन्होंने 5 शब्द गेस करने की कोशिश की, तो ड्राफ्ट्समैन अधिक भ्रमित हो गया (केवल 25% बार सही)। उसने गलत शब्द गेस करने में बहुत समय बिताया जिन्हें एडिटर को खारिज करना पड़ा। यह एक ऐसे ड्राफ्ट्समैन की तरह था जो एक पूरा पैराग्राफ लिखता है जो ज्यादातर निरर्थक होता है; एडिटर को उसे काटने में बहुत समय बर्बाद करना पड़ता है।

2. गुणवत्ता में गिरावट नहीं आई
AI के साथ एक बड़ा डर यह है कि "तेज़" का मतलब "बेवकूफ" होता है। उन्होंने पुराने धीमे उत्तरों और नए तेज़ उत्तरों की तुलना करने के लिए एक अन्य AI को जज के रूप में इस्तेमाल किया।

  • फैसला: उत्तरों की गुणवत्ता एक समान थी। तेज़ विधि ने कोई गलती नहीं की; इसने बस उत्तर तक पहुँचने का तरीका तेज़ कर दिया।

3. "एक चिप" का चमत्कार
यह पैसे बचाने के लिए सबसे रोमांचक हिस्सा है।

  • "स्टैंडर्ड टीम" को लोड संभालने के लिए दो सुपर-चिप्स की आवश्यकता थी।
  • "स्पेक्युलेटिव टीम" उसी मात्रा में काम करने के लिए केवल एक सुपर-चिप का उपयोग कर सकती थी।
  • उपमा: यह एक डिलीवरी कंपनी की तरह है जिसे समय पर पैकेज डिलीवर करने के लिए आमतौर पर दो ट्रकों की आवश्यकता होती है। एक स्मार्ट रूटिंग सिस्टम (स्पेक्युलेटिव डिकोडिंग) का उपयोग करके, उन्होंने महसूस किया कि वे बिल्कुल वही काम केवल एक ट्रक से कर सकते हैं, जिससे ईंधन और ड्राइवर की लागत में 50% की बचत हुई।

यह इतना अच्छा क्यों काम किया?

आप सोच सकते हैं, "ड्राफ्ट्समैन अन्य अध्ययनों की तरह 80% बार सही क्यों नहीं हुआ?"

  • सख्त नियम: PayPal के AI को बहुत सख्त फॉर्मेट (जैसे विशिष्ट ब्रैकेट और कॉमा के साथ JSON कोड ब्लॉक) में उत्तर देना होता है। जब आपको सख्त व्याकरण नियमों का पालन करना होता है, तो अगले शब्द का अनुमान लगाना एक सामान्य कहानी लिखने की तुलना में कठिन होता है।
  • विशेष प्रशिक्षण: मुख्य AI को विशेष रूप से खरीदारी के लिए प्रशिक्षित किया गया था। ड्राफ्ट्समैन को शॉपिंग डेटा पर प्रशिक्षित नहीं किया गया था, इसलिए वह थोड़ा बाहरी व्यक्ति जैसा था।
  • लेकिन फिर भी यह काम कर गया! भले ही इसकी सफलता दर (35%) कम थी, तथ्य यह है कि ड्राफ्ट्समैन बहुत सस्ता और तेज़ है, जिसका अर्थ है कि कुछ सही अनुमान भी बहुत सारा समय बचा लेते हैं।

निचोड़ (The Bottom Line)

PayPal ने एक तरीका खोज निकाला जिससे उनके शॉपिंग असिस्टेंट को बिना AI के "दिमाग" को बदले, काफी तेज़ और सस्ता बनाया जा सके।

एक "बिजली की तरह तेज़ गेसर" (EAGLE3) को जोड़कर जो मुख्य AI के लिए अगले कुछ शब्दों का सुझाव देता है, उन्होंने अपने प्रतीक्षा समय को आधा कर दिया और संभावित रूप से अपने हार्डवेयर खर्चों को आधा कर सकते हैं। यह काम को बेहतर तरीके से करने के लिए स्मार्ट तरीके से काम करने का एक आदर्श उदाहरण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →