Value-Free Policy Optimization via Reward Partitioning
यह शोध पत्र रिवॉर्ड पार्टीशन ऑप्टिमाइज़ेशन (RPO) को प्रस्तुत करता है, जो एक सरल और स्केलेबल सिंगल-ट्रैजेक्टरी प्रेफरेंस लर्निंग विधि है जो प्रॉम्प्ट-लेवल डिस्ट्रीब्यूशन के माध्यम से रिवॉर्ड्स को नॉर्मलाइज़ करके वैल्यू फंक्शन एस्टीमेशन की आवश्यकता को समाप्त करती है, जिससे यह DRO और KTO जैसे मौजूदा बेसलाइन्स की तुलना में बेहतर एलाइनमेंट, डाइवर्सिटी और स्टेबिलिटी प्राप्त करती है।