Proximal Policy Optimization for Amortized Discrete Sampling
यह शोध पत्र GFlowNets और एंट्रॉपी-रेगुलराइज्ड सुदृढीकरण शिक्षण (reinforcement learning) के बीच सैद्धांतिक संबंध स्थापित करता है ताकि विभिन्न बेंचमार्क पर संरचित असतत वितरणों (structured discrete distributions) से नमूने लेने के लिए स्टोकेस्टिक नीतियों को प्रशिक्षित करने हेतु प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO) की बेहतर अभिसरण (convergence) और डेटा दक्षता को व्युत्पन्न और प्रदर्शित किया जा सके।