On the Convergence of Thompson Sampling to Nash Equilibria in Multi-Agent Models
تثبت هذه الورقة وتبرهن أن خوارزمية "تومسون سامبلينج" (Thompson Sampling)، عند دمجها مع آلية محاكاة بسيطة في لعبة برتراند للتسعير متعددة الوكلاء المتماثلة، تتقارب بشكل موثوق نحو توازن ناش بطريقة لامركزية وخالية من النماذج، مما يقدم نهجاً عملياً للتعلم التعزيزي في البيئات المعقدة متعددة الوكلاء.