Sample-efficient Neuro-symbolic Proximal Policy Optimization
यह शोध पत्र प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO) के एक सैंपल-एफिशिएंट न्यूरो-सिंबोलिक विस्तार का प्रस्ताव करता है जो जटिल, स्पार्स-रिवॉर्ड वातावरण में सीखने के मार्गदर्शन के लिए आंशिक तार्किक पॉलिसी विनिर्देशों (logical policy specifications) का लाभ उठाता है, और दो विशिष्ट एकीकरण रणनीतियों के माध्यम से मानक PPO और रिवॉर्ड मशीन बेसलाइनों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।