Dropout-GRPO: Variational Stochasticity for Continuous Latent Reasoning
यह शोध पत्र Dropout-GRPO का प्रस्ताव करता है, जो एक ऐसी विधि है जो निरंतर लेटेंट-रीजनिंग (latent-reasoning) मॉडल्स में आवश्यक ट्राजेक्टरी वेरिएंस (trajectory variance) उत्पन्न करने के लिए स्ट्रक्चर्ड ड्रॉपआउट को पेश करती है, जिससे प्रभावी ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (Group Relative Policy Optimization) सक्षम होता है और GSM8K पर बेहतर प्रदर्शन प्रदर्शित होता है।