← नवीनतम पेपर
🤖 AI

Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack

यह शोध पत्र फ्रॉड और एएमएल (AML) अनुपालन के लिए विशेष रूप से तैयार किया गया एक वर्कलोड-अवेयर एलएलएमओप्स (LLMOps) स्टैक प्रस्तुत करता है जो ओपन-वेट मॉडल्स, पेज्डअटेंशन (PagedAttention) और प्रीफिक्स कैशिंग (prefix caching) जैसे उन्नत सर्विंग अनुकूलनों और कठोर गुणवत्ता गेटिंग का लाभ उठाता है ताकि जेनेरिक एलएलएम (LLM) सर्विंग दृष्टिकोणों की तुलना में थ्रूपुट, लेटेंसी और जीपीयू (GPU) उपयोगिता में महत्वपूर्ण सुधार प्राप्त किया जा सके।

मूल लेखक: Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, उच्च-गति वाली लाइब्रेरी चला रहे हैं जहाँ लक्ष्य केवल किताबें पढ़ना नहीं है, बल्कि लाखों पन्नों के वित्तीय लेनदेन में विशिष्ट, खतरनाक पैटर्न को खोजना है ताकि मनी लॉन्ड्रिंग करने वालों को पकड़ा जा सके। यह फ्रॉड और एंटी-मनी लॉन्ड्रिंग (AML) की दुनिया है।

इस शोध पत्र के लेखक तर्क देते हैं कि सामान्य "लाइब्रेरी" (AI सिस्टम) जिसे हम आमतौर पर दोस्तों के साथ चैट करने के लिए बनाते हैं, इस विशिष्ट कार्य के लिए बहुत खराब है। यह ऐसा है जैसे नाजुक, भारी, पहले से पैक किए गए क्रेटों को ले जाने के लिए एक सामान्य उद्देश्य वाले डिलीवरी ट्रक का उपयोग करना। आपको एक विशेष वाहन की आवश्यकता है।

यहाँ उनके समाधान का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "एक ही आकार के सभी" (One-Size-Fits-All) वाला ट्रक

अधिकांश AI सिस्टम चैटिंग के लिए बनाए जाते हैं। एक चैट में, हर बातचीत अद्वितीय, लंबी और अप्रत्याशित होती है।

  • फ्रॉड की वास्तविकता: फ्रॉड डिटेक्शन अलग है। AI को भेजी जाने वाली हर एक रिक्वेस्ट लगभग एक जैसी दिखती है। यह एक फॉर्म भेजने जैसा है जहाँ पेज का ऊपर का 80% हिस्सा हमेशा एक ही कानूनी नियम और निर्देश (जिसे "प्रिफिक्स" कहा जाता है) होता है, और केवल नीचे का 20% बदलता है (विशिष्ट लेनदेन का विवरण)।
  • परिणाम: मानक AI सिस्टम बार-बार एक ही कानूनी नियमों को पढ़ने में बहुत समय बर्बाद करते हैं, जैसे कि एक छात्र हर होमवर्क प्रश्न से पहले अपनी पाठ्यपुस्तक का वही अध्याय बार-बार पढ़ता है। यह उन्हें धीमा और महंगा बना देता है।

2. समाधान: एक "स्मार्ट" सर्विंग स्टैक (Serving Stack)

लेखकों ने एक विशेष "सर्विंग स्टैक" (वह इंजन जो AI को चलाता है) बनाया है जो विशेष रूप से इन दोहराव वाले, नियम-प्रधान कार्यों के लिए डिज़ाइन किया गया है। इसे एक मानक डिलीवरी ट्रक से अपग्रेड करके एक उच्च-गति, स्वचालित छंटाई सुविधा (automated sorting facility) में बदलने के रूप में सोचें।

यहाँ उनके द्वारा किए गए प्रमुख अपग्रेड दिए गए हैं:

  • "चीट शीट" (Prefix Caching):
    हर बार 2,000 शब्दों के कानूनी निर्देशों को फिर से पढ़ने के बजाय, सिस्टम उन्हें याद रखता है। यह दीवार पर चिपकी हुई एक चीट शीट होने जैसा है। जब कोई नया मामला आता है, तो AI बस चीट शीट पर एक नज़र डालता है (जो मेमोरी में पहले से लोड है) और केवल नए लेनदेन के विवरणों पर ध्यान केंद्रित करता है। इससे बहुत सारा समय बचता है।

  • "स्मार्ट फाइलिंग कैबिनेट" (PagedAttention):
    मानक AI मेमोरी एक बिखरी हुई मेज की तरह है जहाँ आप सब कुछ इधर-उधर किए बिना नए कागजात नहीं रख सकते। लेखकों ने एक "पेज्ड" (Paged) सिस्टम का उपयोग किया है, जो एक पूरी तरह से व्यवस्थित फाइलिंग कैबिनेट की तरह है। यह मेमोरी को छोटे, प्रबंधनीय ब्लॉकों में तोड़ देता है ताकि AI अपने वर्कस्पेस को अव्यवस्थित या क्रैश हुए बिना हजारों मामलों को फिट कर सके।

  • "ग्रुपिंग रणनीति" (Multi-Adapter Batching):
    कल्पना कीजिए कि एक पोस्ट ऑफिस है जहाँ आपको 10 अलग-अलग शहरों के लिए मेल छाँटना है। एक साधारण सिस्टम पहले शहर A का एक पत्र छाँटता है, फिर शहर B का एक पत्र, और फिर वापस शहर A पर आता है।
    लेखकों का सिस्टम उन सभी "शहर A" के पत्रों को एक साथ समूहबद्ध करता है, फिर सभी "शहर B" के पत्रों को, और फिर उन्हें एक ही बैच में प्रोसेस करता है। AI के संदर्भ में, वे उन अनुरोधों को समूहबद्ध करते हैं जिन्हें एक ही विशिष्ट "अडैप्टर" (एक विशिष्ट कार्य के लिए विशेष उपकरण) की आवश्यकता होती है। यह पुराने तरीके की तुलना में 3.9 गुना तेज़ है।

  • "स्लीप मोड" (Lifecycle Management):
    कभी-कभी, एक फ्रॉड जांच के लिए तीन अलग-अलग AI मॉडल को एक लाइन में काम करने की आवश्यकता होती: एक सबूत खोजने के लिए, एक वर्गीकृत करने के लिए, और एक रिपोर्ट लिखने के लिए। इन तीनों को 24/7 पूरी गति से चालू रखना बिजली (और पैसे) की बर्बादी है। लेखकों का सिस्टम अप्रयुक्त मॉडलों को सोने (मेमोरी खाली करने) में डाल देता है और जरूरत पड़ने पर उन्हें तुरंत जगा देता है। यह एक हाइब्रिड कार की तरह है जो रेड लाइट पर इंजन बंद कर देती है लेकिन लाइट हरी होते ही तुरंत गति पकड़ लेती है। यह "जागने" के समय को लगभग एक मिनट से घटाकर कुछ सेकंड कर देता है।

  • "स्पीड बूस्ट" (Speculative Decoding):
    छोटे उत्तरों (जैसे कि एक साधारण "हाँ/नहीं" या JSON कोड) के लिए, AI कभी-कभी सोचने में बहुत अधिक समय लेता है। लेखकों ने एक "ड्राफ्टिंग" चरण जोड़ा है जहाँ एक छोटा, तेज़ AI उत्तर का अनुमान लगाता है, और बड़ा AI बस उसकी जाँच करता है। यह एक स्पीड-रीडर होने जैसा है जो टेक्स्ट को सरसरी निगाह से पढ़ता है और प्रोफेसर द्वारा सत्यापन के लिए उत्तर को हाइलाइट करता है।

3. "क्वालिटी गेट" (न्यायाधीश)

गति बेकार है यदि AI गलतियाँ करता है। फ्रॉड डिटेक्शन में, एक गलत उत्तर का मतलब अपराधी को छोड़ देना या किसी निर्दोष पर आरोप लगाना हो सकता है।

  • लेखकों ने एक "जज" सिस्टम बनाया है। किसी भी AI अपडेट को लाइव होने से पहले, AI जजों (और मानव विशेषज्ञों) का एक पैनल उनके काम की जाँच करता है।
  • वे केवल यह नहीं देखते कि AI तेज़ है या नहीं; वे यह भी देखते हैं कि आउटपुट वैध (valid) है या नहीं (उदाहरण के लिए, क्या यह उचित JSON है? क्या इसने नियमों का पालन किया?)।
  • यह एक फैक्ट्री में सुरक्षा निरीक्षक (safety inspector) की तरह है। यदि उत्पाद तेज़ है लेकिन टूटा हुआ है, तो वह निर्माण से बाहर नहीं जाएगा।

4. परिणाम: "मैजिक" नंबर

सार्वजनिक, नकली डेटा (ताकि उन्होंने वास्तविक बैंक रहस्य लीक न किए हों) का उपयोग करके, उन्होंने इस नए सिस्टम का परीक्षण किया। परिणाम नाटकीय थे:

  • गति: वे प्रति घंटे लगभग 600 अनुरोधों को संभालने से बढ़कर 3,600 अनुरोधों प्रति घंटा तक पहुँच गए (5.5x से 6x सुधार)।
  • प्रतीक्षा समय: उत्तर प्राप्त करने में लगने वाला समय 31-38 सेकंड से घटकर 6-8 सेकंड रह गया।
  • दक्षता: कंप्यूटर हार्डवेयर (GPUs) 88% समय खाली रहने के बजाय 78% समय व्यस्त रहा।
  • लागत: क्योंकि उन्होंने समान हार्डवेयर के साथ बहुत अधिक काम किया, इसलिए उन्हें समान काम करने के लिए आधे से भी कम कंप्यूटरों की आवश्यकता पड़ी।

निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि मनी लॉन्डरों को पकड़ने जैसे उच्च-दांव वाले कार्यों के लिए, आप केवल "सर्वश्रेष्ठ" AI मॉडल का उपयोग नहीं कर सकते। आपको एक विशेष वितरण प्रणाली (specialized delivery system) बनानी होगी जो समझती है कि काम दोहराव वाला, नियम-प्रधान और सख्त सटीकता की आवश्यकता वाला है। "प्रिफिक्स" (नियमों) को पुन: प्रयोज्य मानकर और वर्कफ़्लो को एक स्मार्ट फैक्ट्री की तरह व्यवस्थित करके, आप अंतर्निहित AI मस्तिष्क को बदले बिना सिस्टम को तेज़, सस्ता और अधिक विश्वसनीय बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →