REAR: Test-time Preference Realignment through Reward Decomposition
यह शोधपत्र REAR को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) टेस्ट-टाइम फ्रेमवर्क है जो रिवॉर्ड फंक्शन्स को विघटित करके रिवॉर्ड घटकों को चुनिलेक्टिव रूप से रीस्केल करता है, जिससे लार्ज लैंग्वेज मॉडल्स को विविध उपयोगकर्ता प्राथमिकताओं के साथ संरेखित किया जाता है, और इस प्रकार सत्यापन योग्य डोमेन से परे जटिल प्राथमिकता संरेखण कार्यों तक कुशल टेस्ट-टाइम स्केलिंग का विस्तार किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, अच्छी तरह से प्रशिक्षित रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल) है। इस रोबोट ने उस विशाल डेटा के आधार पर मददगार, विनम्र और सटीक होना सीखा है जिस पर इसे प्रशिक्षित किया गया था। हालाँकि, कभी-कभी आपकी कोई बहुत ही विशिष्ट, व्यक्तिगत मांग हो सकती है। शायद आप चाहते हैं कि रोबोट गणित को इस तरह समझाए जो "मजेदार हो लेकिन वीडियो गेम की तरह न हो," या आप चाहते हैं कि वह एक "चिड़चिड़े बूढ़े जासूस" की तरह व्यवहार करे।
समस्या यह है कि रोबोट की डिफ़ॉल्ट सेटिंग शायद आपके विशिष्ट मूड या पसंद से पूरी तरह मेल न खाती हो। आमतौर पर, इसे ठीक करने के लिए, आपको रोबोट को वापस "स्कूल" भेजना पड़ता है (रीट्रेनिंग), जो महंगा, धीमा और बहुत अधिक संसाधनों की मांग करने वाला काम है।
यह पेपर एक चतुर तकनीक पेश करता है जिसे REAR (रिवॉर्ड डिकंपोजिशन थ्रू रियललाइनमेंट) कहा जाता है, जो आपको रोबोट को वापस स्कूल भेजे बिना, उससे बात करते समय ही उसके व्यवहार को ठीक करने की अनुमति देता है।
यह कैसे काम करता है, इसे सरल उपमाओं में यहाँ तोड़कर समझाया गया है:
1. समस्या: रोबोट का "डिफ़ॉल्ट" बनाम आपकी "इच्छा"
रोबोट के मस्तिष्क को ऐसे समझें कि इसमें दो अलग-अलग आवाजें एक साथ बोल रही हैं:
- आवाज A (प्रश्न): "मैं इस गणित के सवाल का सही उत्तर कैसे दूँ?"
- आवाज B (पसंद): "मैं इस उत्तर को चिड़चिड़े अंदाज में और वीडियो गेम के रूपकों से बचते हुए कैसे दूँ?"
जब रोबोट को प्रशिक्षित किया जाता है, तो वह इन दोनों आवाजों का मिश्रण सीखता है। लेकिन जब आप कोई विशिष्ट प्रश्न पूछते हैं, तो यह मिश्रण गलत हो सकता है। शायद यह "सही होने" पर बहुत अधिक केंद्रित है और आपके "चिड़चिड़े" होने के अनुरोध को अनदेखा कर रहा है।
2. समाधान: "वॉल्यूम नॉब" (रिवॉर्ड डिकंपोजिशन)
लेखकों ने महसूस किया कि वे इन दो आवाजों को गणितीय रूप से अलग कर सकते हैं। वे रोबोट के आंतरिक "रिवॉर्ड" (अच्छा काम करने का अहसास) को दो अलग-अलग सामग्रियों के रूप में देखते हैं:
- प्रश्न की सामग्री: यह वह है कि वह प्रॉम्प्ट का उत्तर कितनी अच्छी तरह देता है?
- पसंद की सामग्री: यह वह है कि वह आपकी विशिष्ट शैली का कितनी अच्छी तरह पालन करता है?
REAR एक वॉल्यूम नॉब की तरह है जिसे आप बातचीत के दौरान घुमा सकते हैं।
- यदि आप नॉब को ऊपर घुमाते हैं, तो रोबोट आपकी "पसंद" वाली आवाज को अधिक सुनता है।
- यदि आप इसे नीचे घुमाते हैं, तो वह "प्रश्न" वाली आवाज को अधिक सुनता है।
जादू यह है कि उन्होंने यह कैसे गणना करना सीखा कि इस वॉल्यूम नॉब का उपयोग केवल रोबोट के अपने आंतरिक विचारों (इसके प्रोबेबिलिटी स्कोर) का उपयोग करके कैसे किया जाए। आपको किसी नए शिक्षक या नए डेटासेट की आवश्यकता नहीं है; आप बस रोबोट के मौजूदा मस्तिष्क का उपयोग करके उसे खुद को पुन: संतुलित करने के लिए करते हैं।
3. रणनीति: "कोशिश करो, कोशिश करो, फिर से कोशिश करो" (टेस्ट-टाइम स्केलिंग)
चूंकि रोबोट तुरंत यह नहीं जान सकता कि कौन सा उत्तर एकदम सही है, इसलिए REAR टेस्ट-टाइम स्केलिंग नामक रणनीति का उपयोग करता है। इसे इस प्रकार समझें:
- "बेस्ट ऑफ एन" दृष्टिकोण: कल्पना करें कि आपने रोबोट को एक कहानी लिखने के लिए कहा है। केवल एक ड्राफ्ट स्वीकार करने के बजाय, आप उसे एक ड्राफ्ट लिखने में लगने वाले समय में ही 16 अलग-अलग संस्करण लिखने के लिए कहते हैं।
- स्कोरकार्ड: उन 16 संस्करणों में से प्रत्येक के लिए, REAR एक जज के रूप में कार्य करता है। यह उस "वॉल्यूम नॉब" गणित का उपयोग करके उन्हें स्कोर देता है। यह पूछता है: "इन 16 कहानियों में से कौन सी कहानी प्रश्न का सबसे अच्छा उत्तर देती है और चिड़चिड़े जासूस की शैली का पालन करती है?"
- विजेता: रोबोट उच्चतम स्कोर वाला संस्करण चुनता है और वह आपको दे देता है।
वे एक अधिक उन्नत संस्करण भी उपयोग करते हैं जिसे ट्री सर्च (एक जासूस की तरह जो भूलभुलैया में अलग-अलग रास्तों की खोज करता है) कहा जाता है। केवल 16 पूर्ण कहानियाँ लिखने के बजाय, रोबोट वाक्य-दर-वाक्य अलग-अलग विकल्पों की खोज करता है, और लगातार स्कोर की जांच करता रहता है ताकि यह सुनिश्चित हो सके कि वह सही रास्ते पर बना रहे।
4. यह एक बड़ी बात क्यों है
- कोई प्रशिक्षण आवश्यक नहीं: आपको रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यह रेडियो सुनते समय रेडियो स्टेशन को ट्यून करने जैसा है, न कि नया रेडियो खरीदने जैसा।
- किसी भी चीज़ पर काम करता है: उन्होंने दिखाया कि यह न केवल "चिड़चिड़े जासूसों" के लिए, बल्कि जटिल गणितीय समस्याओं और यहाँ तक कि विजुअल कार्यों (जैसे किसी तस्वीर को देखकर सटीक रूप से उसका वर्णन करना बिना कुछ मनगढ़ंत बनाए) के लिए भी काम करता है।
- कुशल: क्योंकि यह रोबोट के अपने आंतरिक गणित का उपयोग करता है, इसलिए इसे जवाबों की जांच करने के लिए किसी अलग, भारी "जज" प्रोग्राम को लोड करने की आवश्यकता नहीं होती है। यह पिछले तरीकों की तुलना में तेज़ और सस्ता है।
सारांश
REAR एक ऐसा उपकरण है जो आपको काम करते समय ही एक स्मार्ट AI के व्यक्तित्व या फोकस को तुरंत कस्टमाइज़ करने की अनुमति देता है। यह ऐसा करने के लिए "प्रश्न का उत्तर देने" को "आपकी शैली का पालन करने" से गणितीय रूप से अलग करता है, और फिर सबसे अच्छा रिस्पॉन्स खोजने के लिए "कई विकल्प आजमाएं और सर्वश्रेष्ठ चुनें" की रणनीति का उपयोग करता है। यह AI के व्यक्तित्व के लिए एक रिमोट कंट्रोल होने जैसा है जो बिना AI को फिर से बनाए तुरंत काम करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।