REAR: Test-time Preference Realignment through Reward Decomposition
यह शोधपत्र REAR को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) टेस्ट-टाइम फ्रेमवर्क है जो रिवॉर्ड फंक्शन्स को विघटित करके रिवॉर्ड घटकों को चुनिलेक्टिव रूप से रीस्केल करता है, जिससे लार्ज लैंग्वेज मॉडल्स को विविध उपयोगकर्ता प्राथमिकताओं के साथ संरेखित किया जाता है, और इस प्रकार सत्यापन योग्य डोमेन से परे जटिल प्राथमिकता संरेखण कार्यों तक कुशल टेस्ट-टाइम स्केलिंग का विस्तार किया जाता है।