SAPO: Step-Aligned Policy Optimization for Reasoning-Based Generative Recommendation
SAPO (Step-Aligned Policy Optimization) वैश्विक परिणाम पुरस्कारों (global outcome rewards) को स्टेप-अलाइन्ड, ग्रुप-रिलेटिव एडवांटेज से बदलकर जनरेटिव रिकमेंडेशन को बेहतर बनाता है, जो व्यक्तिगत रीजनिंग स्टेप्स और उनके संबंधित सिमेंटिक आइडेंटिफायर टोकन्स को क्रेडिट असाइन करता है, जिससे बड़े-कैटलॉग वाले परिदृश्यों में प्रशिक्षण को स्थिर करने और प्रदर्शन में सुधार करने में मदद मिलती है जहाँ सटीक-मैच फीडबैक अपर्याप्त होता है।