LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning
यह शोध पत्र LaDi-RL का प्रस्ताव करता है, जो एक सुव्यवस्थित तर्क प्रक्षेप पथ (reasoning trajectories) उत्पन्न करने के लिए लेटेंट डिफ्यूजन मॉडल का उपयोग करता है और पदानुक्रमित लेटेंट-टेक्स्ट रोलआउट्स (hierarchical latent-text rollouts) को नियोजित करता है ताकि लेटेंट प्लानिंग की गुणवत्ता को टेक्स्ट डिकोडिंग त्रुटियों से अलग किया जा सके, जिससे एंट्रॉपी कोलैप्स (entropy collapse) को रोका जा सके और कोड एवं गणितीय तर्क कार्यों पर पारंपरिक टोकन-स्तरीय RL की तुलना में काफी बेहतर प्रदर्शन किया जा सके।