← नवीनतम पेपर
🤖 machine learning

DRIVE: Distributional and Retrieval-Augmented Bidding with Value Evaluation

यह शोधपत्र DRIVE का प्रस्ताव करता है, जो ऑफलाइन ऑटो-बिडिंग के लिए एक एकीकृत ट्रांसफार्मर-आधारित फ्रेमवर्क है जो वितरण मॉडलिंग (distributional modeling), रिट्रीवल-ऑगमेंटेड ऐतिहासिक उदाहरणों और वैल्यू इवैल्यूएशन को जोड़कर कैंडिडेट एक्शन जनरेशन को निर्णय लेने से अलग करता है, ताकि पारंपरिक पैरामीट्रिक विधियों की सीमाओं को दूर किया जा सके और बजट बाधाओं के तहत प्रदर्शन में सुधार किया जा सके।

मूल लेखक: Miduo Cui, Haochen Wang, Shangqin Mao, Xun Yang, Qianlong Xie, Xingxing Wang, Xuri Ge, Ying Zhou, Zhiwei Xu

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Miduo Cui, Haochen Wang, Shangqin Mao, Xun Yang, Qianlong Xie, Xingxing Wang, Xuri Ge, Ying Zhou, Zhiwei Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पेशेवर जुआरी हैं जो हर दिन नीलामियों की एक श्रृंखला जीतने की कोशिश कर रहे हैं। आपके पास एक सख्त बजट है, और आपको वास्तविक समय में हजारों वस्तुओं पर बोली लगाने के लिए सटीक निर्णय लेना होगा। यदि आप बहुत कम बोली लगाते हैं, तो आप वस्तु खो देंगे। यदि आप बहुत अधिक बोली लगाते हैं, तो आप दिन खत्म होने से पहले अपने पैसे खत्म कर देंगे।

यह ऑनलाइन विज्ञापन में ऑटो-बिडिंग (Auto-bidding) की दुनिया है। कंपनियाँ इन बिजली जैसी तेज़ गति वाले निर्णय लेने के लिए कंप्यूटर प्रोग्रामों का उपयोग करती हैं। हालाँकि, इन कंप्यूटरों को सिखाना अविश्वसनीय रूप से जोखिम भरा है। आप उन्हें वास्तविक दुनिया में "करके सीखने" के लिए नहीं छोड़ सकते क्योंकि एक गलत अनुमान से कंपनी को हजारों डॉलर का नुकसान हो सकता है। इसलिए, हम उन्हें पिछले निर्णयों की एक "इतिहास की पुस्तक" (ऑफलाइन डेटा) का उपयोग करके सिखाते हैं।

यह पेपर DRIVE नामक एक नया सिस्टम पेश करता है ताकि इतिहास से सीखने में मौजूदा कंप्यूटरों के साथ आने वाली दो प्रमुख समस्याओं को हल किया जा सके।

दो बड़ी समस्याएँ

1. "औसत" का जाल (The "Average" Trap)
कल्पना कीजिए कि आप भीड़ की एक तस्वीर देख रहे हैं। कुछ लोगों ने लाल शर्ट पहनी है, और कुछ ने नीली। यदि आप एक मानक कंप्यूटर से उस भीड़ में "औसत" व्यक्ति का वर्णन करने के लिए कहते हैं, तो वह शायद बैंगनी शर्ट पहने हुए एक व्यक्ति की कल्पना कर लेगा।
वास्तविक दुनिया में, कभी-कभी सबसे अच्छी रणनीति आक्रामक रूप से बोली लगाना (लाल शर्ट) होती है, और कभी-कभी रूढ़िवादी तरीके से बोली लगाना (नीली शर्ट) होती है। पुराने कंप्यूटर मॉडल "मध्य मार्ग" खोजने की कोशिश करते हैं और एक "बैंगनी" राशि बोली लगा देते हैं जो रूढ़िवादी दिन के लिए बहुत अधिक और आक्रामक दिन के लिए बहुत कम होती है। वे सभी अच्छी रणनीतियों को एक ही खराब, औसत रणनीति में मिला देते हैं।

2. "लॉन्ग-टेल" अंधापन (The "Long-Tail" Blindness)
कल्पना कीजिए कि आप एक शेफ हैं जिसने 10,000 भोजन पकाए हैं। 9,900 में से साधारण पास्ता व्यंजन थे, लेकिन 100 जटिल, शानदार दावतें थीं। यदि आप केवल सबसे आम व्यंजनों पर ध्यान केंद्रित करते हैं, तो आप शानदार व्यंजनों को बनाना भूल जाते हैं।
विज्ञापन में, अधिकांश ट्रैफ़िक सामान्य होता है, लेकिन सबसे मूल्यवान अवसर अक्सर दुर्लभ, "लॉन्ग-टेल" स्थितियों में होते हैं। पुराने मॉडल इन दुर्लभ क्षणों में भ्रमित हो जाते हैं क्योंकि उन्होंने पर्याप्त उदाहरण नहीं देखे होते हैं, जिससे वे अविश्वसनीय अनुमान लगाने लगते हैं।

DRIVE का समाधान

लेखकों ने इन मुद्दों को ठीक करने के लिए DRIVE (डिस्ट्रीब्यूशनल एंड रिट्रीवल-अगमेंटेड बिडिंग विद वैल्यू इवैल्यूएशन) बनाया है। इसे एक स्मार्ट निर्णय लेने की तीन-चरणीय प्रक्रिया के रूप में समझें:

चरण 1: "कई विकल्पों" का जनरेटर (डिस्ट्रीब्यूशनल मॉडलिंग)
केवल एक औसत बोली का अनुमान लगाने के बजाय, DRIVE कंप्यूटर से एक साथ कई संभावित बोलियाँ कल्पना करने के लिए कहता है। यह एक शेफ से स्टेक पकाने के पांच अलग-अलग तरीके सोचने के लिए कहने जैसा है (दुर्लभ, मध्यम, अच्छी तरह पका हुआ, आदि) बजाय इसके कि केवल एक तापमान का अनुमान लगाया जाए। यह सुनिश्चित करता है कि सिस्टम सभी विभिन्न वैध रणनीतियों को जीवित रखता है, न कि उन्हें एक बेकार "बैlyनी शर्ट" में मिला देता है।

चरण 2: "चीट शीट" (रिट्रीवल-अगमेंटेशन)
जब कंप्यूटर किसी दुर्लभ या कठिन स्थिति का सामना करता है, तो वह केवल अनुमान नहीं लगाता है। वह एक "चीट शीट" (उच्च गुणवत्ता वाले पिछले निर्णयों का डेटाबेस) खोलता है। वह अतीत की उन स्थितियों को खोजता है जो वर्तमान वाली स्थिति के बिल्कुल समान दिखती हैं और कहता है, "हे, इस विशिष्ट स्थिति में, हमने पहले $50 की बोली सफलतापूर्वक लगाई थी!" यह कंप्यूटर को एक ठोस, वास्तविक दुनिया का उदाहरण देता है, जिससे डेटा की कमी होने पर वह गलत विचार पैदा करने से बच जाता है।

चरण 3: "रेफरी" (वैल्यू इवैल्यूएशन)
अब कंप्यूटर के पास विचारों की दो सूचियाँ हैं: वे जो उसने स्वयं उत्पन्न किए हैं (चरण 1) और वे जो उसने चीट शीट से प्राप्त किए हैं (चरण 2)। कोई भी चाल चलने से पहले, एक "रेफरी" (वैल्यू क्रिटिक) हर विकल्प की जाँच करता है। वह पूछता है, "यदि मैं यह बोली लगाता हूँ, तो क्या मैं बजट के भीतर रहूँगा और सर्वोत्तम परिणाम प्राप्त करूँगा?" वह पूरी सूची में से सबसे अच्छा विकल्प चुनता है, खराब विकल्पों को अनदेखा करते हुए।

परिणाम

लेखकों ने DRIVE का परीक्षण एक विशाल वास्तविक दुनिया के डेटासेट AuctionNet (एक वास्तविक विज्ञापन बाजार का अनुकरण) और कुछ मानक रोबोट-कंट्रोल टेस्ट (D4RL) पर किया।

  • बेहतर प्रदर्शन: DRIVE ने पिछले तरीकों की तुलना में लगातार अधिक पैसा (या "वैल्यू") बनाया।
  • जाल को सुलझाना: इसने सफलतापूर्वक "औसत" के जाल से बचने में सफलता प्राप्त की, और क्षण के अनुसार सही आक्रामक या रूढ़िवादी रणनीति चुनी।
  • दुर्लभ घटनाओं को संभालना: "स्पार्स" (कम डेटा वाली) स्थितियों में, जहाँ डेटा कम था, इसने "चीट शीट" फीचर के कारण बहुत बेहतर प्रदर्शन किया।
  • गति: भले ही यह अधिक सोच (विकल्प उत्पन्न करना, चीट शीट की जाँच करना और रेफरी से पूछना) करता है, फिर भी यह वास्तविक समय की बोली लगाने के लिए पर्याप्त तेज़ है (50 मिलीसेकंड से कम समय लेता है)।

मुख्य निष्कर्ष (The Bottom Line)

DRIVE एक ड्राइवर को अपग्रेड करने जैसा है जो केवल "ऑटोपायलट" (सड़क का औसत निकालना) पर गाड़ी चलाने वाले से बदलकर एक पेशेवर ड्राइवर बन जाता है जो:

  1. कई ड्राइविंग लाइनों (तेज़ बनाम सुरक्षित) पर विचार करता है।
  2. एक मानचित्र (मैप) चेक करता है कि समान ट्रैफ़िक में अन्य अच्छे ड्राइवरों ने कहाँ जाने का रास्ता चुना था।
  3. जिसके पास एक को-पायलट है जो स्टीयरिंग घुमाने से पहले सबसे अच्छे रास्ते की दोबारा जाँच करता है।

इसके परिणामस्वरूप एक ऐसा ड्राइवर मिलता है जो सुरक्षित, स्मार्ट और अधिक दौड़ जीतता है, खासकर जब सड़क कठिन या अपरिचित हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →