DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
यह शोध पत्र डायनेमिक वेरिएंस-एडेप्टिव एडवांटेज ऑप्टिमाइज़ेशन (DVAO) का प्रस्ताव करता है, जो एक नवीन विधि है जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन में मानक स्केलर केशन की प्रशिक्षण अस्थिरता और स्थिर सीमाओं को दूर करने के लिए अनुभवजन्य वेरिएंस के आधार पर मल्टी-रिवॉर्ड कॉम्बिनेशन वेट्स को गतिशील रूप से समायोजित करती है, जिससे कई उद्देश्यों के साथ बड़े भाषा मॉडलों को संरेखित करने में बेहतर प्रदर्शन और स्थिरता प्राप्त होती है।