Modelling Customer Trajectories with Reinforcement Learning for Practical Retail Insights
यह शोध पत्र रिटेल स्थानों में ग्राहक प्रक्षेपवक्र (ट्रैजेक्टरीज) के मॉडलिंग के लिए एक मैक्सिमम एंट्रॉपी सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि यह महंगी वास्तविक दुनिया के डेटा संग्रह की आवश्यकता के बिना स्टोर लेआउट अनुकूलन और लाभ अधिकतमकरण के लिए अधिक सटीक, व्यवहारिक रूप से आधारित अंतर्दृष्टि प्रदान करके TSP और PNN जैसे पारंपरिक ह्यूरिस्टिक्स से बेहतर प्रदर्शन करता है।