Algorithms for Adaptive Experiments that Trade-off Statistical Analysis with Reward: Combining Uniform Random Assignment and Reward Maximization
यह शोध पत्र TS-PostDiff प्रस्तुत करता है, जो एक अनुकूलन योग्य एल्गोरिदम है जो थॉम्पसन सैंपलिंग को भुजाओं (arms) के बीच छोटे अंतरों की पश्च संभाव्यता (posterior probability) के आधार पर समान यादृच्छिक असाइनमेंट के साथ मिश्रित करके उपयोगकर्ता पुरस्कार और सांख्यिकीय अनुमान को गतिशील रूप से संतुलित करता है, जिससे लाभ को अधिकतम करने और सांख्यिकीय शक्ति बनाए रखने के बीच के संतुलन को अनुकूलित किया जाता है।