HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising
यह शोध पत्र HOBA का प्रस्ताव करता है, जो एक पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) ढांचा है जो अनुकूलनशील हाइपरपैरामीटर ट्यूनिंग के लिए एक बड़े भाषा मॉडल, गतिशील विशेषज्ञ मॉडल चयन के लिए एक बायस-करेक्टेड SARSA एजेंट, और बोली निष्पादन के लिए एक विविध विशेषज्ञ पूल को एकीकृत करता है, जिससे महत्वपूर्ण ऑनलाइन अनुकूलन क्षमता और बड़े पैमाने पर तैनाती में सिद्ध व्यावसायिक मूल्य के माध्यम से ऑफलाइन-प्रशिक्षित बिडिंग सिस्टम की सीमाओं को दूर किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक विशाल, उच्च-गति वाले नीलामी घर की कल्पना करें जहाँ लाखों लोग हर सेकंड ध्यान के छोटे से हिस्से को खरीदने की कोशिश कर रहे हैं। यह ऑनलाइन विज्ञापन की दुनिया है। विज्ञापनदाता अपने विज्ञापनों को सही लोगों तक पहुँचाना चाहते हैं बिना अपना पूरा बजट एक ही मिनट में खर्च किए। ऐसा करने के लिए, वे "बिडिंग एजेंट" (bidding agents) का उपयोग करते हैं—वे कंप्यूटर प्रोग्राम जो यह तय करते हैं कि एक विज्ञापन स्लॉट के लिए कितना भुगतान किया जाए। इन एजेंटों को रेस कार ड्राइवरों की तरह समझें। कुछ ड्राइवर बहुत सावधान होते हैं और एक सख्त नियम पुस्तिका का पालन करते हैं (जैसे कि एक PID कंट्रोलर), जबकि अन्य ग्रैंडमास्टर्स की तरह होते हैं जिन्होंने अपनी बेहतरीन चालें सीखने के लिए हजारों पिछले रेसों का अध्ययन किया है (जैसे कि ऑफलाइन रीइन्फोर्समेंट लर्निंग)।
समस्या यह है कि रेस का ट्रैक लगातार बदलता रहता है। मौसम बदल जाता है, अन्य ड्राइवर तेज हो जाते हैं, और सड़क के नियम विकसित हो जाते हैं। एक ड्राइवर जो केवल एक स्थिर नियम पुस्तिका का पालन करता है, वह फिसलते हुए ट्रैक पर दुर्घटनाग्रस्त हो सकता है। एक ड्राइवर जो 200 मील प्रति घंटे की रफ्तार से दौड़ते समय नई चालें सीखने की कोशिश करता है, वह नियंत्रण खो सकता है और कुछ ही सेकंड में ईंधन (बजट) खत्म कर सकता है। वैज्ञानिक एक ऐसा ड्राइवर बनाने की कोशिश कर रहे हैं जो सुरक्षित भी हो और वास्तविक समय में अनुकूलन करने के लिए पर्याप्त स्मार्ट भी हो, लेकिन यह एक कठिन संतुलन है। यदि आप कंप्यूटर को बहुत अधिक स्वतंत्र रूप से सीखने देते हैं, तो वह एक विनाशकारी गलती कर सकता है। यदि आप उसे बिल्कुल भी नहीं सीखने देते हैं, तो वह बाजार बदलने पर पीछे छूट जाएगा।
यहीं पर पेपर "HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising" काम आता है। कुआईशौ टेक्नोलॉजी (Kuaishou Technology) के शोधकर्ताओं ने इन रेसिंग ड्राइवरों को प्रबंधित करने का एक नया तरीका प्रस्तावित किया है जिसे HOBA कहा जाता है। एक एकल ड्राइवर को सब कुछ सिखाने के बजाय, वे एक तीन-स्तरीय टीम बनाते हैं जो पिट क्रू, एक रणनीतिकार और एक ड्राइवर की तरह मिलकर काम करती है।
टीम के शीर्ष पर एक "रणनीतिकार" (Strategist) है जो एक लार्ज लैंग्वेज मॉडल (LLM) द्वारा संचालित है। इसकी कल्पना एक बुद्धिमान कोच के रूप में करें जो हर एक घंटे में बड़े परिदृश्य को देखता है। यह कोच हर मोड़ के लिए सटीक गति तय नहीं करता है; इसके बजाय, यह मौसम, ईंधन के स्तर और प्रतिस्पर्धा को देखता है, और फिर टीम के लिए निर्देशों का एक नया सेट लिखता है। वे कह सकते हैं, "आज, थोड़े आक्रामक रहें," या "खर्च को धीमा और स्थिर रखें।" यह कोच पिछले रेसों के मेमोरी बैंक से सीखता है, और समय के साथ स्मार्ट बनने के लिए "सोचें-कार्य करें-अवलोकन करें-चिंतन करें" (Think-Act-Observe-Reflect) लूप का उपयोग करता है।
बीच में एक "टैक्टिकल मैनेजर" (Tactical Manager) है, जो एक स्मार्ट एजेंट है जो हर दो मिनट में जांच करता है। इसका काम पूर्व-प्रशिक्षित विशेषज्ञों के गैरेज से सबसे अच्छा "ड्राइवर" चुनना है। गैरेज में विभिन्न प्रकार के ड्राइवर शामिल हैं: एक त्वरित सुधार (PID) में माहिर है, दूसरा दीर्घकालिक योजना (MPC) में अच्छा है, और अन्य विशेषज्ञ हैं जिन्होंने विशाल डेटासेट (जैसे IQL या डिसीजन ट्रांसफॉर्मर) से सीखा है। टैक्टिकल मैनेजर केवल अनुमान नहीं लगाता; यह सुनिश्चित करने के लिए कि वह भाग्य से धोखा न खा जाए, एक विशेष "कॉज़ल एडजस्टमेंट" (causal adjustment) टूल का उपयोग करता है। उदाहरण के लिए, यदि किसी ड्राइवर ने केवल इसलिए रेस जीती क्योंकि मौसम बहुत अनुकूल था, तो मैनेजर जानता है कि उस जीत के लिए ड्राइवर को दोष नहीं देना है। यह उस ड्राइवर को चुनता है जो वर्तमान क्षण के लिए वास्तव में सबसे उपयुक्त है।
सबसे नीचे स्वयं "ड्राइवर" हैं। ये वे विशेषज्ञ हैं जो हर एक विज्ञापन नीलामी के लिए हर मिलीसेकंड में बोली लगाते हैं। वे रणनीतिकार द्वारा निर्धारित नियमों और टैक्टिकल मैनेजर द्वारा किए गए चुनाव का पालन करते हैं। महत्वपूर्ण बात यह है कि ये ड्राइवर दौड़ते समय अपने मस्तिष्क को नहीं बदलते। वे सुरक्षित, पूर्व-परीक्षण किए गए उपकरण हैं। "सीखना" केवल मध्य परत में होता है, जहाँ टीम यह तय करती है कि किस ड्राइवर का उपयोग करना है। यह सिस्टम को बजट बिगाड़ने वाली बड़ी गलतियाँ करने से सुरक्षित रखता है, जबकि बदलते बाजार के अनुसार तेजी से अनुकूल होने की अनुमति भी देता है।
शोधकर्ताओं ने इस प्रणाली का परीक्षण दो तरीकों से किया। पहले, उन्होंने इसे 'ऑक्शननेट' (AuctionNet) नामक एक सिम्युलेटेड वातावरण में चलाया, जो विज्ञापन बाजार का एक वीडियो गेम जैसा संस्करण है। इन परीक्षणों में, HOBA ने मौजूदा सर्वोत्तम तरीकों को लगातार पछाड़ दिया, और कठिन, अप्रत्याशित परिदृश्यों में प्रदर्शन में 12% तक सुधार किया। दूसरा, और सबसे महत्वपूर्ण, उन्होंने इसे वास्तविक दुनिया में आजमाया। उन्होंने हजारों अभियानों और लाखों डॉलर के बजट के साथ एक लाइव विज्ञापन प्लेटफॉर्म पर एक बड़ा परीक्षण किया।
परिणाम प्रभावशाली थे। वास्तविक दुनिया के परीक्षण में, HOBA ने विज्ञापनदाताओं को पुराने सिस्टम की तुलना में 3.6% अधिक बार उनके लागत लक्ष्यों को प्राप्त करने में मदद की। इसका मतलब है कि उन्होंने अधिक खर्च किए बिना अपने पैसे का अधिक मूल्य प्राप्त किया। इस प्रणाली ने रूपांतरण (conversions) के कुल मूल्य को 8.1% बढ़ाया और निवेश पर रिटर्न (ROI) में 3.3% का सुधार किया। शायद सबसे महत्वपूर्ण बात यह है कि इसने यह सब बजट को खराब किए या अराजकता पैदा किए बिना किया। सिस्टम ने साबित कर दिया कि कार्यों को एक रणनीतिक कोच, एक टैक्टिकल मैनेजर और विशेषज्ञों की एक टीम में विभाजित करके, आप एक ऐसा विज्ञापन सिस्टम बना सकते हैं जो सुरक्षित और अविश्वसनीय रूप से अनुकूलनीय दोनों है। यह एक याद दिलाता है कि कभी-कभी जीतने का सबसे स्मार्ट तरीका एक सुपर-ड्राइवर होना नहीं है, बल्कि एक आदर्श टीम के रूप में मिलकर काम करना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।