Impatient Bandits: Optimizing for the Long-Term Without Delay
यह शोध पत्र एक बेयसियन-फिल्टर्ड बैंडिट एल्गोरिदम पेश करके अनुशंसा प्रणालियों (recommender systems) में दीर्घकालिक उपयोगकर्ता संतुष्टि को अनुकूलित करने की चुनौती को संबोधित करता है जो धीमी दीर्घकालिक पुरस्कारों और अपूर्ण अल्पकालिक प्रॉक्सी के बीच के संतुलन को प्रभावी ढंग से प्रबंधित करता है, एक ऐसी विधि जो सैद्धांतिक रिग्रेट बाउंड्स और पॉडकास्ट अनुशंसाओं के लिए एक बड़े पैमाने के A/B टेस्ट दोनों में मौजूदा दृष्टिकोणों से काफी बेहतर प्रदर्शन करने में सिद्ध हुई है।