When and why randomised exploration works (in linear bandits)
यह शोध-पत्र रैंडमाइज्ड एक्सप्लोरेशन एल्गोरिदम, जैसे कि थॉम्पसन सैंपलिंग, के लिए एक नवीन विश्लेषण ढांचे को प्रस्तुत करता है जो स्मूथ, स्ट्रॉन्गली कॉनवेक्स -डायमेंशनल लीनियर बैंडिट सेटिंग्स में यह सिद्ध करने के लिए मजबूर आशावाद (forced optimism) या पोस्टीरियर इन्फ्लेशन से बचता है कि वे एक इष्टतम रिग्रेट बाउंड प्राप्त करते हैं।