Failure Modes of Deep Multi-Agent RL in Asynchronous Pricing: Reproducible Triggers, Trace Diagnostics, and a Partial Fix
यह शोध पत्र निरंतर-समय मूल्य निर्धारण बाजारों में डीप मल्टी-एजेंट सुदृढीकरण शिक्षण (डीप मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग) के दो पुनरुत्पादनीय विफलता मोडों—गुप्त कार्टेल गठन और एक्टर-क्रिटिक अस्थिरता—की पहचान और विश्लेषण करता है—यह प्रदर्शित करते हुए कि अतुल्यता (एसिंक्रोनी) और अवलोकन विलंबता को पेश करने से मिलीभगत (कोल्यूजन) आंशिक रूप से कम हो जाती है, लेकिन यह प्रतिस्पर्धी मूल्य निर्धारण को पूरी तरह से बहाल करने में विफल रहता है और उच्च घटना दरों पर क्रिटिक विचलन को रोकने में सक्षम नहीं है।