Actor-Critic Learning for Extended Mean Field Control with Deterministic Policies
यह शोधपत्र नियतकालिक नीतियों (deterministic policies) के साथ विस्तारित मीन फील्ड कंट्रोल (mean field control) के लिए एक मॉडल-मुक्त, निरंतर-समय एक्टर-क्रिटिक सुदृढीकरण शिक्षण ढांचे का प्रस्ताव करता है, जो माप व्युत्पन्न (measure derivatives) से जुड़े एक परिष्कृत पॉलिसी ग्रेडिएंट फॉर्मूला का लाभ उठाता है ताकि उन समस्याओं के लिए कुशल और सुदृढ़ समाधान सक्षम किए जा सकें जहाँ गतिकी (dynamics) और पुरस्कार संयुक्त अवस्था-क्रिया वितरण (joint state-action distribution) पर निर्भर करते हैं।