← नवीनतम पेपर
💬 NLP

Efficient LLM-based Advertising via Model Compression and Parallel Verification

यह शोध पत्र एक कुशल जनरेटिव टारगेटिंग (Efficient Generative Targeting) फ्रेमवर्क का प्रस्ताव करता है जो अनुकूलित समूह क्वांटाइजेशन (adaptive group quantization), लेयर-एडेप्टिव पदानुक्रमित विरलीकरण (layer-adaptive hierarchical sparsification), और प्रीफिक्स-ट्री समानांतर सत्यापन (prefix-tree parallel verification) को संयोजित करता है ताकि स्वीकार्य जनरेशन गुणवत्ता बनाए रखते हुए वास्तविक समय के विज्ञापन अनुप्रयोगों के लिए एलएलएम (LLM) इन्फरेंस को महत्वपूर्ण रूप से त्वरित किया जा सके।

मूल लेखक: Wenxin Dong, Chang Gao, Guanghui Yu, Xuewu Jiao, Mingqing Hu, Qiang Fu, Peng Xu, Penghui Wei, Hui Xu, Yue Xing, Shuanglong Li, Lin Liu

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenxin Dong, Chang Gao, Guanghui Yu, Xuewu Jiao, Mingqing Hu, Qiang Fu, Peng Xu, Penghui Wei, Hui Xu, Yue Xing, Shuanglong Li, Lin Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत प्रतिभाशाली, सुपर-स्मार्ट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो विज्ञापन लिखने और ग्राहकों के लिए बेहतरीन उत्पाद चुनने में अविश्वसनीय रूप से कुशल है। समस्या यह है कि यह सहायक एक विशाल, भारी विश्वकोश की तरह है: उत्तर खोजने के लिए इसके पन्ने पलटने में बहुत समय लगता है, और इसे चालू रखने के लिए भारी मात्रा में ऊर्जा की आवश्यकता होती है। ऑनलाइन विज्ञापन की तेज़ रफ्तार दुनिया में, जहाँ आपको एक सेकंड के भीतर उत्तर की आवश्यकता होती है, यह "भारी विश्वकोश" वाला दृष्टिकोण बहुत धीमा और महंगा है।

बाइडू (Baidu) के इस शोध पत्र के लेखकों ने एक नया सिस्टम बनाया है ताकि वे इस सहायक को कम बुद्धिमान बनाए बिना इसे तेज़ और हल्का बना सकें। उन्होंने यह दो मुख्य तरीकों से किया: सहायक को छोटा (shrink) करके और उसे एक शॉर्टकट मैप (shortcut map) देकर।

ट्रिक 1: सहायक को छोटा करना (मॉडल कंप्रेशन)

AI मॉडल को ज्ञान के एक विशाल पुस्तकालय के रूप में सोचें। इस पुस्तकालय की अधिकांश पुस्तकें शायद ही कभी उपयोग की जाती हैं, और कुछ पन्ने ऐसे नंबरों से भरे होते हैं जो ज्यादा बदलते नहीं हैं।

  • "स्मार्ट पैकिंग" (क्वांटाइजेशन - Quantization): कल्पना कीजिए कि आपके पास उच्च-डेफिनिशन (HD) तस्वीरों से भरा एक भारी सूटकेस है (मूल डेटा)। मूल भारी फाइलों को ले जाने के बजाय, टीम ने यह पता लगाया कि कैसे उन्हें बिना स्पष्टता खोए छोटी, हल्की JPEG फाइलों (कम सटीक नंबरों) में कंप्रेस किया जाए। उन्होंने सब कुछ एक ही तरह से कंप्रेस नहीं किया; वे "अनुकूली" (adaptive) थे। उन्होंने पुस्तकालय के सबसे महत्वपूर्ण और संवेदनशील हिस्सों को बहुत सावधानी से पैक किया, लेकिन कम महत्वपूर्ण हिस्सों को अधिक आक्रामक रूप से कंप्रेस किया। इसने भारी सूटकेस को एक हल्के बैकपैक में बदल दिया।
  • "खाली शेल्फ" रणनीति (स्पैरसिटी - Sparsity): कल्पना कीजिए कि पुस्तकालय में हजारों खाली शेल्फ हैं। टीम ने उन शेल्फों से किताबें हटाने का निर्णय लिया जिन्हें कोई कभी नहीं देखता। उन्होंने केवल रैंडम तरीके से किताबें नहीं हटाईं; उन्होंने देखा कि कौन से शेल्फ महत्वपूर्ण (संवेदनशील परतें) थे और उन्हें भरा रखा, जबकि कम महत्वपूर्ण शेल्फों को खाली कर दिया। इससे पुस्तकालय बहुत छोटा और नेविगेट करने में तेज़ हो गया।
  • कस्टम टूल: यह सुनिश्चित करने के लिए कि इन कंप्रेस किए गए और खाली किए गए शेल्फों को अभी भी तेज़ी से पढ़ा जा सके, उन्होंने एक कस्टम "स्कैनर" (एक विशेष कंप्यूटर कर्नल) बनाया, जो मानक उपकरणों की तुलना में इन हल्के, स्पारस (sparse) किताबों को बहुत तेज़ी से पढ़ सकता है।

ट्रिक 2: शॉर्टकट मैप (प्रिफिक्स ट्री पैरेलल वेरिफिकेशन)

आमतौर पर, जब AI एक विज्ञापन बनाता है, तो वह एक बार में एक शब्द लिखता है, जैसे कोई व्यक्ति धीरे-धीरे वाक्य टाइप कर रहा हो। "मुझे... यह... कार... पसंद... है..." यह धीमा है।

  • ट्री मैप (Tree Map): टीम ने सभी संभावित विज्ञापन विकल्पों को एक विशाल, शाखाओं वाले पेड़ की संरचना (जैसे कि एक फैमिली ट्री या डिसीजन ट्री) में व्यवस्थित किया। पेड़ का ऊपरी हिस्सा चौड़ा है (कई विकल्प), लेकिन जैसे-जैसे आप नीचे जाते हैं, शाखाएं सबसे संभावित विकल्पों की ओर संकरी होती जाती हैं।
  • "अनुमान और जाँच" की दौड़ (Guess and Check Race): एक-एक शब्द लिखने के बजाय, AI अब पूरे पेड़ को देखता है। वह एक साथ कई शब्दों का "अनुमान" लगाता है (पैरेलल डिकोडिंग) और फिर जल्दी से जाँच करता है कि क्या उसके अनुमान मैप पर सही बैठते हैं।
  • टाइमिंग स्विच: सबसे स्मार्ट बात यह जानना है कि इस शॉर्टकट का उपयोग कब करना है। सिस्टम लगातार गणना करता है: "क्या शब्द-दर-शब्द लिखना तेज़ है, या एक साथ कई अनुमान लगाना और उन्हें जाँच लेना तेज़ है?" यदि अनुमान लगाने और जाँचने वाला तरीका तेज़ है, तो यह तुरंत उस मोड में स्विच कर जाता है। यह AI को वाक्य के अंत तक पहुँचने के लिए कदम-दर-कदम चलने के बजाय, एक ही स्टेप में "जंप" करने की अनुमति देता है।

परिणाम

टीम ने इस सिस्टम का परीक्षण दो वास्तविक परिदृश्यों में किया:

  1. विज्ञापन क्रिएटिव लिखना: विज्ञापनों के लिए आकर्षक टेक्स्ट बनाना।
  2. लक्षित विज्ञापन (Targeted Advertising): किसी विशिष्ट उपयोगकर्ता के लिए सही विज्ञापन चुनना।

परिणाम:

  • गति: वास्तविक दुनिया के परीक्षणों में नया सिस्टम 1.8 गुना तेज़ था। कुछ विशिष्ट परीक्षणों में, गति में सुधार और भी अधिक (78% से अधिक तेज़) था।
  • गुणवत्ता: बहुत हल्का और तेज़ होने के बावजूद, इसके द्वारा बनाए गए विज्ञापन अभी भी भारी, धीमे संस्करण जितने ही अच्छे थे। "गुणवत्ता" (सटीकता) में कोई महत्वपूर्ण गिरावट नहीं आई।
  • वास्तविक उपयोग: यह केवल एक सिद्धांत नहीं है; इसे बाइडु के वास्तविक विज्ञापन प्लेटफॉर्म पर तैनात किया गया है, जो अभी वास्तविक ट्रैफिक को संभाल रहा है।

सारांश में

यह शोध पत्र बताता है कि कैसे एक धीमे, भारी AI को उसकी याददाश्त को कंप्रेस करके (डेटा को छोटा करके) और उसकी सोचने की प्रक्रिया को व्यवस्थित करके (एक साथ कई परिणामों का अनुमान लगाने के लिए ट्री मैप का उपयोग करके) एक तेज़, हल्के AI में बदला जा सकता है। परिणाम एक ऐसा विज्ञापन सिस्टम है जो लगभग तुरंत सही व्यक्ति को सही विज्ञापन पहुँचाता है, बिना सिफारिश की गुणवत्ता से समझौता किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →