Physics-Guided Policy Optimization with Self-Distillation
यह शोध पत्र फिजिक्स-गाइडेड पॉलिसी ऑप्टिमाइज़ेशन (PGPO) का प्रस्ताव करता है, जो विस्कस-फ्लुइड डायनेमिक्स (viscous-fluid dynamics) से प्रेरित एक सेल्फ-डिस्टिलेशन विधि है जो स्टेप साइज़ को नियंत्रित करने के लिए म्यूचुअल इंफॉर्मेशन का उपयोग करती है, जिससे प्रशिक्षण स्थिर होता है और साइंस-QA डेटासेट पर मानक SDPO से बेहतर प्रदर्शन करता है।