Fine-Tuned LLM as a Complementary Predictor Improving Ads System
यह शोध पत्र एक प्रोडक्शन-स्केल विज्ञापन प्रणाली प्रस्तुत करता है जो उपयोगकर्ता प्रोफाइल से संभावित विज्ञापनदाताओं का पूर्वानुमान लगाने के लिए एक फाइन-ट्यून्ड ओपन-सोर्स LLM को एक पूरक सहायक प्रेडिक्टर के रूप में एकीकृत करती है, जिससे कैंडिडेट जनरेशन को बढ़ाया जाता है और डाउनस्ट्रीम रैंकिंग के लिए सूचनात्मक प्रायर्स (priors) प्रदान किए जाते हैं ताकि महत्वपूर्ण ऑफलाइन और ऑनलाइन व्यावसायिक सुधार प्राप्त किए जा सकें।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, हलचल भरे डिजिटल मार्केटप्लेस (जैसे Pinterest) को चला रहे हैं। आपके पास लाखों विज़िटर्स हैं, और आपका काम उन्हें वे सटीक विज्ञापन दिखाना है—ऐसे विज्ञापन जो उन उत्पादों के लिए हों जिन्हें वे वास्तव में खरीदना चाहते हैं।
पारंपरिक रूप से, आपका सिस्टम एक विशाल, कुशल लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह काम करता है। यह देखता है कि किसी व्यक्ति ने कल क्या क्लिक किया था और उसी तरह की किताबें (विज्ञापन) शेल्फ से ढूँढ निकालता है। यह तेज़ है और "वही चीज़ दोबारा दिखाने" में अच्छा है। लेकिन कभी-कभी, यह चूक जाता है क्योंकि यह व्यक्ति की गहरी इच्छाओं या उनकी ब्राउज़िंग आदतों और विशिष्ट ब्रांडों के बीच सूक्ष्म संबंधों को वास्तव में नहीं समझ पाता है।
यह पेपर एक नया टूल पेश करता है: एक स्मार्ट, सुशिक्षित सहायक (एक फाइन-ट्यून्ड लार्ज लैंग्वेज मॉडल, या LLM) जो लाइब्रेरियन की जगह नहीं लेता, बल्कि बेहतर अनुमान लगाने के लिए उनके साथ मिलकर काम करता है।
यहाँ यह सिस्टम कैसे काम करता है, इसे सरल चरणों में विभाजित किया गया है:
1. समस्या: लाइब्रेरियन को एक संकेत की ज़रूरत है
पारंपरिक सिस्टम गणित में बहुत अच्छा है, लेकिन इसे "विश्व ज्ञान" (world knowledge) के साथ संघर्ष करना पड़ता है। वह जानता है कि एक यूजर ने हाइकिंग बूट पर क्लिक किया है, लेकिन वह सहज रूप से उस चीज़ को किसी विशिष्ट ऊर्जा बार (energy bar) या स्थानीय आउटडोर गियर शॉप से नहीं जोड़ पाएगा, जब तक कि उसने पहले से वह सटीक संयोजन न देखा हो।
2. समाधान: "एड प्रेडिक्टर" (विज्ञापन भविष्यवक्ता) सहायक
AI को पूरा विज्ञापन लिखने या हर एक आइटम को रैंक करने के लिए कहने के बजाय (जो बहुत धीमा और महंगा है), टीम ने AI से एक बहुत ही विशिष्ट प्रश्न पूछा:
"इस व्यक्ति की प्रोफाइल और उन्होंने जो कुछ भी देखा है, उसके आधार पर, वे अगली बार किन विशिष्ट विज्ञापनदाताओं (advertisers) से खरीदने की सबसे अधिक संभावना रखते हैं?"
इस AI को एक ब्रांडों के लिए भविष्यवक्ता के रूप में सोचें। यह यूजर का इतिहास (सर्च, क्लिक, ऑफ-साइट शॉपिंग) पढ़ता है और 20 विशिष्ट कंपनियों (जैसे "Nike," "Sephora," या "Home Depot") की एक छोटी सूची की भविष्यवाणी करता है जिनसे यह यूजर जुड़ने के लिए तैयार है।
3. उन्होंने सहायक को कैसे प्रशिक्षित किया
आप केवल एक सामान्य AI से यह काम नहीं करवा सकते; इसे आपके मार्केटप्लेस के विशिष्ट नियमों को सीखने की आवश्यकता है।
- होमवर्क (SFT): सबसे पहले, उन्होंने AI को यूजर का इतिहास देखने और केवल एक ब्रांड का अनुमान लगाने के लिए सिखाया जिसे वे शायद खरीद सकते हैं। यह एक छात्र को एक एकल गणित की समस्या सही ढंग से हल करना सिखाने जैसा था।
- अभ्यास सत्र (GRPO): फिर, उन्होंने इसे कठिन बना दिया। उन्होंने AI को 20 ब्रांड और 5 यूजर इंटरेस्ट की सूची बनाने के लिए कहा, लेकिन उन्होंने इसे एक "स्कोरकार्ड" दिया। यदि AI ने सही ब्रांड का अनुमान लगाया और उसे सूची में ऊपर रखा, तो उसे उच्च स्कोर मिला। यदि इसने गलत अनुमान लगाया या बहुत अधिक आइटम सूचीबद्ध किए, तो इसे दंड (penalty) मिला। इसने AI को सटीक होने और नियमों का पालन करने के लिए प्रशिक्षित किया।
- गुप्त कोड (Semantic IDs): इसे और भी सटीक बनाने के लिए, उन्होंने इसे एक विशेष "शॉर्टहैंड" भाषा (Semantic IDs) सिखाई जो छवियों और उत्पादों का प्रतिनिधित्व करती है। यह सहायक को "लाल ड्रेस" शब्दों के बजाय एक अद्वितीय कोड के माध्यम से लाल ड्रेस की तस्वीर पहचानने के समान है, जो अन्य लाल ड्रेस और फैशन ट्रेंड्स से जुड़ता है।
4. काम में लाना: दो तरीके से मदद करना
एक बार जब AI प्रशिक्षित हो गया, तो उन्होंने इसे पूरा नियंत्रण नहीं दिया। इसके बजाय, उन्होंने इसके भविष्यवाणियों का उपयोग दो विशिष्ट तरीकों से किया:
तरीका A: फ़िल्टर (Retrieval)
कल्पना कीजिए कि लाइब्रेरियन अरबों वस्तुओं वाले गोदाम में खोज कर रहा है। AI कहता है, "हे, इस यूजर के लिए, केवल इन 20 विशिष्ट ब्रांडों से संबंधित गलियारों (aisles) में ही देखें।" यह खोज को तुरंत सीमित कर देता है, जिससे यह सुनिश्चित होता है कि सिस्टम अप्रासंगिक विज्ञापन दिखाने में समय बर्बाद न करे। यह लाइब्रेरियन को पहले चेक करने के लिए स्टोर की एक वीआईपी लिस्ट देने जैसा है।तरीका B: सुराग (Ranking)
जब सिस्टम यह तय कर रहा होता कि कौन सा विज्ञापन सबसे पहले दिखाया जाए, तो वह AI की भविष्यवाणियों को अंतिम निर्णय लेने वाले को देता है। यह जज के कान में फुसफुसाने जैसा है, "इस यूजर को वास्तव में ब्रांड X पसंद है, इसलिए इस विज्ञापन को उच्च स्कोर दें।"
5. परिणाम: क्या यह काम कर गया?
टीम ने वास्तविक दुनिया में (Pinterest के वास्तविक ट्रैफिक पर) इसका परीक्षण किया।
- ऑफलाइन टेस्ट: AI पुराने सिस्टम या "जीरो-शॉट" AI (वह जो इस विशिष्ट कार्य के लिए प्रशिक्षित नहीं था) की तुलना में सही ब्रांडों का अनुमान लगाने में बहुत बेहतर रहा।
- ऑनलाइन टेस्ट: जब उन्होंने इसे वास्तविक उपयोगकर्ताओं के लिए चालू किया, तो परिणाम स्पष्ट थे। दिखाए गए विज्ञापन अधिक प्रासंगिक थे, और रिटर्न ऑन एड स्पेंड (RoAS) लगभग 5% से 6% बढ़ गया। इसका मतलब है कि विज्ञापनदाताओं को उनके निवेश पर अधिक मूल्य मिला क्योंकि विज्ञापन उन लोगों को दिखाए गए जो वास्तव में उनमें रुचि रखते थे।
मुख्य निष्कर्ष
पेपर यह तर्क देता है कि आपको अपने पूरे अनुशंसा सिस्टम (recommendation system) को एक विशाल, धीमे AI के साथ बदलने की आवश्यकता नहीं है। इसके बजाय, आप एक विशेषज्ञ, फाइन-ट्यून्ड AI को एक "पूरक भविष्यवक्ता" (complementary predictor) के रूप में उपयोग कर सकते हैं।
इसे एक स्पोर्ट्स टीम की तरह सोचें: आपके पास आपके स्टार खिलाड़ी (पारंपरिक एल्गोरिदम) हैं जो तेज़ और विश्वसनीय हैं। अब, आपने एक रणनीतिक कोच (LLM) जोड़ा है जो प्रतिद्वंद्वी के इतिहास का अध्ययन करता है और खिलाड़ियों को बताता है, "इन विशिष्ट रणनीतियों पर ध्यान केंद्रित करें।" कोच खेल नहीं खेलता, लेकिन उनकी सलाह टीम को अधिक बार जीतने में मदद करती है।
संक्षेप में: उन्होंने एक स्मार्ट AI का उपयोग यह अनुमान लगाने के लिए किया कि यूजर को कौन से ब्रांड पसंद हैं, उन भविष्यवाणियों का उपयोग विज्ञापनों को फ़िल्टर करने और रैंक करने के लिए किया, और सफलतापूर्वक विज्ञापनदाताओं द्वारा कमाए जाने वाले धन की मात्रा को बढ़ाया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।