Efficient LLM-based Advertising via Model Compression and Parallel Verification
यह शोध पत्र एक कुशल जनरेटिव टारगेटिंग (Efficient Generative Targeting) फ्रेमवर्क का प्रस्ताव करता है जो अनुकूलित समूह क्वांटाइजेशन (adaptive group quantization), लेयर-एडेप्टिव पदानुक्रमित विरलीकरण (layer-adaptive hierarchical sparsification), और प्रीफिक्स-ट्री समानांतर सत्यापन (prefix-tree parallel verification) को संयोजित करता है ताकि स्वीकार्य जनरेशन गुणवत्ता बनाए रखते हुए वास्तविक समय के विज्ञापन अनुप्रयोगों के लिए एलएलएम (LLM) इन्फरेंस को महत्वपूर्ण रूप से त्वरित किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक अत्यंत प्रतिभाशाली, सुपर-स्मार्ट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो विज्ञापन लिखने और ग्राहकों के लिए बेहतरीन उत्पाद चुनने में अविश्वसनीय रूप से कुशल है। समस्या यह है कि यह सहायक एक विशाल, भारी विश्वकोश की तरह है: उत्तर खोजने के लिए इसके पन्ने पलटने में बहुत समय लगता है, और इसे चालू रखने के लिए भारी मात्रा में ऊर्जा की आवश्यकता होती है। ऑनलाइन विज्ञापन की तेज़ रफ्तार दुनिया में, जहाँ आपको एक सेकंड के भीतर उत्तर की आवश्यकता होती है, यह "भारी विश्वकोश" वाला दृष्टिकोण बहुत धीमा और महंगा है।
बाइडू (Baidu) के इस शोध पत्र के लेखकों ने एक नया सिस्टम बनाया है ताकि वे इस सहायक को कम बुद्धिमान बनाए बिना इसे तेज़ और हल्का बना सकें। उन्होंने यह दो मुख्य तरीकों से किया: सहायक को छोटा (shrink) करके और उसे एक शॉर्टकट मैप (shortcut map) देकर।
ट्रिक 1: सहायक को छोटा करना (मॉडल कंप्रेशन)
AI मॉडल को ज्ञान के एक विशाल पुस्तकालय के रूप में सोचें। इस पुस्तकालय की अधिकांश पुस्तकें शायद ही कभी उपयोग की जाती हैं, और कुछ पन्ने ऐसे नंबरों से भरे होते हैं जो ज्यादा बदलते नहीं हैं।
- "स्मार्ट पैकिंग" (क्वांटाइजेशन - Quantization): कल्पना कीजिए कि आपके पास उच्च-डेफिनिशन (HD) तस्वीरों से भरा एक भारी सूटकेस है (मूल डेटा)। मूल भारी फाइलों को ले जाने के बजाय, टीम ने यह पता लगाया कि कैसे उन्हें बिना स्पष्टता खोए छोटी, हल्की JPEG फाइलों (कम सटीक नंबरों) में कंप्रेस किया जाए। उन्होंने सब कुछ एक ही तरह से कंप्रेस नहीं किया; वे "अनुकूली" (adaptive) थे। उन्होंने पुस्तकालय के सबसे महत्वपूर्ण और संवेदनशील हिस्सों को बहुत सावधानी से पैक किया, लेकिन कम महत्वपूर्ण हिस्सों को अधिक आक्रामक रूप से कंप्रेस किया। इसने भारी सूटकेस को एक हल्के बैकपैक में बदल दिया।
- "खाली शेल्फ" रणनीति (स्पैरसिटी - Sparsity): कल्पना कीजिए कि पुस्तकालय में हजारों खाली शेल्फ हैं। टीम ने उन शेल्फों से किताबें हटाने का निर्णय लिया जिन्हें कोई कभी नहीं देखता। उन्होंने केवल रैंडम तरीके से किताबें नहीं हटाईं; उन्होंने देखा कि कौन से शेल्फ महत्वपूर्ण (संवेदनशील परतें) थे और उन्हें भरा रखा, जबकि कम महत्वपूर्ण शेल्फों को खाली कर दिया। इससे पुस्तकालय बहुत छोटा और नेविगेट करने में तेज़ हो गया।
- कस्टम टूल: यह सुनिश्चित करने के लिए कि इन कंप्रेस किए गए और खाली किए गए शेल्फों को अभी भी तेज़ी से पढ़ा जा सके, उन्होंने एक कस्टम "स्कैनर" (एक विशेष कंप्यूटर कर्नल) बनाया, जो मानक उपकरणों की तुलना में इन हल्के, स्पारस (sparse) किताबों को बहुत तेज़ी से पढ़ सकता है।
ट्रिक 2: शॉर्टकट मैप (प्रिफिक्स ट्री पैरेलल वेरिफिकेशन)
आमतौर पर, जब AI एक विज्ञापन बनाता है, तो वह एक बार में एक शब्द लिखता है, जैसे कोई व्यक्ति धीरे-धीरे वाक्य टाइप कर रहा हो। "मुझे... यह... कार... पसंद... है..." यह धीमा है।
- ट्री मैप (Tree Map): टीम ने सभी संभावित विज्ञापन विकल्पों को एक विशाल, शाखाओं वाले पेड़ की संरचना (जैसे कि एक फैमिली ट्री या डिसीजन ट्री) में व्यवस्थित किया। पेड़ का ऊपरी हिस्सा चौड़ा है (कई विकल्प), लेकिन जैसे-जैसे आप नीचे जाते हैं, शाखाएं सबसे संभावित विकल्पों की ओर संकरी होती जाती हैं।
- "अनुमान और जाँच" की दौड़ (Guess and Check Race): एक-एक शब्द लिखने के बजाय, AI अब पूरे पेड़ को देखता है। वह एक साथ कई शब्दों का "अनुमान" लगाता है (पैरेलल डिकोडिंग) और फिर जल्दी से जाँच करता है कि क्या उसके अनुमान मैप पर सही बैठते हैं।
- टाइमिंग स्विच: सबसे स्मार्ट बात यह जानना है कि इस शॉर्टकट का उपयोग कब करना है। सिस्टम लगातार गणना करता है: "क्या शब्द-दर-शब्द लिखना तेज़ है, या एक साथ कई अनुमान लगाना और उन्हें जाँच लेना तेज़ है?" यदि अनुमान लगाने और जाँचने वाला तरीका तेज़ है, तो यह तुरंत उस मोड में स्विच कर जाता है। यह AI को वाक्य के अंत तक पहुँचने के लिए कदम-दर-कदम चलने के बजाय, एक ही स्टेप में "जंप" करने की अनुमति देता है।
परिणाम
टीम ने इस सिस्टम का परीक्षण दो वास्तविक परिदृश्यों में किया:
- विज्ञापन क्रिएटिव लिखना: विज्ञापनों के लिए आकर्षक टेक्स्ट बनाना।
- लक्षित विज्ञापन (Targeted Advertising): किसी विशिष्ट उपयोगकर्ता के लिए सही विज्ञापन चुनना।
परिणाम:
- गति: वास्तविक दुनिया के परीक्षणों में नया सिस्टम 1.8 गुना तेज़ था। कुछ विशिष्ट परीक्षणों में, गति में सुधार और भी अधिक (78% से अधिक तेज़) था।
- गुणवत्ता: बहुत हल्का और तेज़ होने के बावजूद, इसके द्वारा बनाए गए विज्ञापन अभी भी भारी, धीमे संस्करण जितने ही अच्छे थे। "गुणवत्ता" (सटीकता) में कोई महत्वपूर्ण गिरावट नहीं आई।
- वास्तविक उपयोग: यह केवल एक सिद्धांत नहीं है; इसे बाइडु के वास्तविक विज्ञापन प्लेटफॉर्म पर तैनात किया गया है, जो अभी वास्तविक ट्रैफिक को संभाल रहा है।
सारांश में
यह शोध पत्र बताता है कि कैसे एक धीमे, भारी AI को उसकी याददाश्त को कंप्रेस करके (डेटा को छोटा करके) और उसकी सोचने की प्रक्रिया को व्यवस्थित करके (एक साथ कई परिणामों का अनुमान लगाने के लिए ट्री मैप का उपयोग करके) एक तेज़, हल्के AI में बदला जा सकता है। परिणाम एक ऐसा विज्ञापन सिस्टम है जो लगभग तुरंत सही व्यक्ति को सही विज्ञापन पहुँचाता है, बिना सिफारिश की गुणवत्ता से समझौता किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।