← नवीनतम पेपर
📊 statistics

A single algorithm for both restless and rested rotting bandits

यह शोध पत्र रोटिंग अडैप्टिव विंडो यूसीबीबी (RAW-UCB) को प्रस्तुत करता है, जो एक नवीन एल्गोरिदम है जो विशिष्ट वातावरण या रिवॉर्ड डिके (पुरस्कार क्षय) की प्रकृति के पूर्व ज्ञान की आवश्यकता के बिना, रेस्टेड और रेस्टलेस रोटिंग बैंडिट सेटिंग्स दोनों में निकट-इष्टतम रिग्रेट प्राप्त करता है।

मूल लेखक: Julien Seznec, Pierre Ménard, Alessandro Lazaric, Michal Valko

प्रकाशित 2026-04-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Julien Seznec, Pierre Ménard, Alessandro Lazaric, Michal Valko

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फूड ट्रक चला रहे हैं जिसके मेनू में 10 अलग-अलग व्यंजन हैं। आपका लक्ष्य यह पता लगाना है कि ग्राहक किस व्यंजन को सबसे ज्यादा पसंद करते हैं ताकि आप सबसे अधिक भोजन बेच सकें। यह एक क्लासिक "मल्टी-आर्म्ड बैंडिट" (Multi-Armed Bandit) समस्या है: आपको नए व्यंजनों को परखने के लिए एक्सप्लोरिंग (खोजबीन करने) और उस व्यंजन का एक्सप्लॉइटिंग (उपयोग करने) के बीच संतुलन बनाना होगा जिसे आप वर्तमान में सबसे अच्छा मानते हैं।

हालाँकि, वास्तविक दुनिया स्थिर नहीं होती है। यह शोध पत्र इस समस्या के एक विशिष्ट, कठिन संस्करण को संबोधित करता है जिसे "रॉटिंग बैंडिट्स" (सड़ने वाले बैंडिट्स) कहा जाता है।

मुख्य समस्या: "खराब होने वाला" मेनू

इस परिदृश्य में, हर बार जब आप कोई व्यंजन परोसते हैं, तो उसकी लोकप्रियता थोड़ी कम हो जाती है।

  • "रेस्टलेस" रॉटिंग (Restless Rotting): एक न्यूज़ फीड की कल्पना करें। भले ही आप किसी समाचार कहानी को उपयोगकर्ता को न दिखाएं, लेकिन समय बीतने के साथ वह पुरानी और कम दिलचस्प होती जाती है। इसका मूल्य अपने आप घटता जाता है।
  • "रेस्टेड" रॉटिंग (Rested Rotting): एक प्लेलिस्ट में गाने की कल्पना करें। यह केवल तभी उबाऊ होता है जब इसे बार-बार चलाया जाता है। यदि आप इसे कुछ समय के लिए छोड़ देते हैं, तो यह अभी भी ताज़ा हो सकता है, लेकिन यदि आप इसे बार-बार बजाते हैं, तो उपयोगकर्ता इससे थक जाता है। इसका मूल्य केवल तब घटता है जब आप "आर्म खींचते" हैं (व्यंजन परोसते हैं)।

बड़ी चुनौती:
पहले, कंप्यूटर वैज्ञानिकों का मानना था कि इन दोनों स्थितियों के लिए पूरी तरह से अलग रणनीतियों की आवश्यकता होती है।

  • यदि आप "रेस्टलेस" (समय-आधारित क्षय) की दुनिया के लिए डिज़ाइन की गई रणनीति को "रेस्टेड" (क्रिया-आधारित क्षय) की समस्या पर आज़माते हैं, तो यह बुरी तरह विफल हो जाती है।
  • यदि आप "रेस्टेड" रणनीति को "रेस्टलेस" समस्या पर आज़माते हैं, तो भी यह विफल हो जाती है।

यह समुद्र में मछली पकड़ने के लिए डिज़ाइन किए गए जाल का उपयोग आकाश में पक्षियों को पकड़ने के लिए करने जैसा है। उपकरण फिट नहीं बैठते।

समाधान: "एडेप्टिव विंडो" (Adaptive Window - RAW-UCB)

लेखक RAW-UCB (रॉटिंग एडेप्टिव विंडो अपर कॉन्फिडेंस बाउंड) नामक एक नया एल्गोरिदम पेश करते हैं।

RAW-UCB को एक अति-बुद्धिमान, अनुकूलन योग्य शेफ के रूप में सोचें जिसे रसोई के नियमों को पहले से जानने की आवश्यकता नहीं है।

  1. "विंडो" (खिड़की) का उदाहरण:
    कल्प-ना कीजिए कि आप एक कमरे के औसत तापमान का अनुमान लगाने की कोशिश कर रहे हैं।
  • यदि आप पिछले 5 मिनट देखते हैं, तो आपको बहुत सटीक रीडिंग मिल सकती है, लेकिन यह शोर भरी हो सकती है (शायद किसी ने दरवाज़ा खोला हो)।
  • यदि आप पिछले 5 घंटे देखते हैं, तो डेटा स्मूथ होता है, लेकिन यह पुराना हो सकता है (शायद सूरज डूब गया हो)।
  • RAW-UCB की तरकीब: यह एक साथ हर संभव विंडो साइज (पिछले 1 मिनट, पिछले 5 मिनट, पिछले एक घंटे, आदि) को देखता है। यह प्रत्येक विंडो के लिए एक "कॉन्फिडेंस स्कोर" की गणना करता है। फिर यह उस विंडो को चुनता है जो अभी किसी व्यंजन के कितने अच्छे होने का सबसे सटीक और विश्वसनीय अनुमान देती है।
  1. यह दोनों के लिए क्यों काम करता है:
  • "रेस्टलेस" दुनिया में (समय क्षय): एल्गोरिदम यह महसूस करता है कि समय बीतने के कारण पुराना डेटा कम प्रासंगिक है। यह हालिया डेटा देखने के लिए स्वाभाविक रूप से अपनी विंडो को छोटा कर देता है।
  • "रेस्टेड" दुनिया में (क्रिया क्षय): एल्गोरिदम को एहसास होता है कि यदि किसी व्यंजन को कुछ समय से नहीं परोसा गया है, तो उसका "सड़ना" रुक गया है। वह यह देखने के लिए पुराने डेटा का उपयोग कर सकता है कि वह व्यंजन थकने से पहले कैसा था।

यह एक गिरगिट की तरह है जो पर्यावरण के अनुसार अपना रंग बदल लेता है, बिना आपके उसे यह बताए कि वातावरण क्या है।

"असंभव" मिश्रण

यह पेपर यह भी सिद्ध करता है कि यदि आप इन दोनों प्रकार के क्षय को मिला देते हैं (जहाँ एक व्यंजन दोनों कारणों से उबाऊ हो जाता है—क्योंकि आप इसे चलाते हैं और क्योंकि समय बीतता है), तो यह गणितीय रूप से पूर्ण रूप से सीखना असंभव हो जाता है। "सर्वश्रेष्ठ" रणनीति को यह जानने के लिए भविष्य की जानकारी चाहिए होगी कि क्या किसी व्यंजन को अभी खेलना है (जब वह ताज़ा है) या प्रतीक्षा करनी है (इस मामले में कि वह बाद में और बेहतर हो जाए)। चूंकि आप भविष्य नहीं देख सकते, इसलिए आप हमेशा कुछ पैसा खो देंगे।

हालाँकि, यदि आप ऐसी दुनिया में हैं जहाँ चीजें केवल खराब होती हैं (कभी बेहतर नहीं होतीं), तो RAW-UCB नायक है।

वास्तविक दुनिया के परिणाम: Yahoo! News टेस्ट

कागज पर गणित साबित करने के बजाय, लेखकों ने Yahoo! Front Page (एक न्यूज़ रिकमेंडेशन डेटासेट) के वास्तविक डेटा पर RAW-UCB का परीक्षण किया।

  • परिदृश्य: उन्होंने एक न्यूज़ फीड का अनुकरण किया जहाँ लेख समय के साथ कम दिलचस्प हो जाते हैं (Restless) या बहुत अधिक क्लिक होने पर (Rested)।
  • प्रतिस्पर्धा: उन्होंने RAW-UCB को Exp3.S (एक सामान्यज्ञ) और GLR-UCB (एक विशेषज्ञ) जैसे प्रसिद्ध एल्गोरिदम के खिलाफ खड़ा किया।
  • परिणाम: RAW-UCB लगातार जीता। यह इतनी अच्छी तरह से अनुकूलित हुआ कि इसे यह बताने की आवश्यकता नहीं थी कि "हे, यह एक न्यूज़ फीड है!" या "हे, यह एक संगीत प्लेलिस्ट है!" इसने बस इसे समझ लिया और दूसरों की तुलना में तेज़ी से बेहतर सिफारिशें करना शुरू कर दिया।

संक्षेप में सारांश

  • समस्या: चीजें समय के साथ खराब होती हैं, या तो समय बीतने के कारण या आपके द्वारा उनके उपयोग के कारण। पुराने एल्गोरिदम केवल एक प्रकार के "खराब होने" को संभाल सकते थे।
  • नवाचार: एक नया एल्गोरिदम (RAW-UCB) एक लचीले लेंस की तरह काम करता है। यह स्वचालित रूप से तय करता है कि निर्णय लेने के लिए कितना "इतिहास" देखना है, चाहे क्षय समय के कारण हो या उपयोग के कारण।
  • लाभ: यह एक "वन-साइज़-फिट्स-ऑल" समाधान है जो पहले के तरीकों की तुलना में तेज़, सरल और अधिक सटीक है, जो इसे Spotify, Netflix या न्यूज़ फीड जैसे वास्तविक दुनिया के ऐप्स के लिए आदर्श बनाता है जहाँ उपयोगकर्ता की रुचि कम हो जाती है।

संक्षेप में, RAW-UCB निर्णय लेने के लिए एक यूनिवर्सल रिमोट कंट्रोल है, उस दुनिया में जहाँ सब कुछ अंततः थोड़ा पुराना और उबाऊ हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →