Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies
यह शोध पत्र प्रिफरेंस गोल ट्यूनिंग (PGT) को प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग फ्रेमवर्क है जो नीति मापदंडों को अपडेट करने के बजाय निरंतर लेटेंट गोल एम्बेडिंग्स को अनुकूलित करके फ्रोजन गोल-कंडीशन्ड पॉलिसियों को कार्य प्राथमिकताओं के साथ संरेखित करता है, जिससे Minecraft SkillForge बेंचमार्क पर विशेषज्ञ प्रॉम्प्ट्स और पूर्ण फाइन-ट्यूनिंग दोनों की तुलना में बेहतर प्रदर्शन और मजबूती प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक अत्यधिक कुशल, पूर्व-प्रशिक्षित (pre-trained) रोबोट शेफ है। इस शेफ ने करोड़ों कुकिंग वीडियो देखकर वर्षों बिताए हैं और उसे काटने, तलने और बेकिंग के भौतिक विज्ञान (physics) की किसी भी अन्य व्यक्ति से बेहतर समझ है। हालाँकि, जब आप उससे "सलाद बनाने" के लिए कहते हैं, तो वह टमाटरों को बहुत बारीक काट सकता है या ड्रेसिंग डालना भूल सकता है, क्योंकि आपका मौखिक निर्देश उसके विशिष्ट स्टाइल के लिए बिल्कुल सही ट्रिगर नहीं था।
आमतौर पर, इसे ठीक करने के लिए, आपके पास दो बुरे विकल्प होते हैं:
- निर्देशों को फिर से लिखना: आप सैकड़ों अलग-अलग वाक्यांशों ("टमाटर काटें," "टमाटर के टुकड़े करें," "टमाटर स्लाइस करें") को आज़माते हैं जब तक कि आपको वह शब्द न मिल जाए जो काम करे। यह सही पासवर्ड का अनुमान लगाने जैसा है; यह धीमा है और अक्सर विफल हो जाता है।
- शेफ को फिर से प्रशिक्षित करना: आप शेफ को आपकी पसंद के अनुसार सब कुछ फिर से सीखने के लिए वापस कुकरी स्कूल ले जाते हैं। यह महंगा है, इसमें बहुत समय लगता है, और इसमें यह जोखिम भी है कि शेफ आपके विशिष्ट सलाद के अलावा कुछ और बनाना भूल जाए (जिसे "कैटास्ट्रोफिक फॉरगेटिंग" या विनाशकारी विस्मृति कहा जाता है)।
यह पेपर "प्रेफरेंस गोल ट्यूनिंग" (PGT) नामक एक तीसरे, स्मार्ट तरीके का परिचय देता है।
मुख्य विचार: "रिमोट कंट्रोल" रूपक
शेफ के मस्तिष्क (पॉलिसी) को फिर से लिखने या सटीक शब्दों का अनुमान लगाने के बजाय, लेखक इसके लेटेंट गोल एम्बेडिंग (latent goal embedding) को एक निरंतर रिमोट कंट्रोल की तरह मानते हैं।
सोचिए कि शेफ का मस्तिष्क एक जमे हुए (frozen), हाई-एंड वीडियो गेम कैरेक्टर की तरह है। आप उसके कोड या आंकड़ों (stats) को नहीं बदल सकते। हालाँकि, आप एक छिपे हुए "डायल" (लेटेंट गोल) को एडजस्ट कर सकते हैं जो आपको बताता है कि "भेड़ का शिकार करने" के कमांड की व्याख्या ठीक से कैसे करनी है।
- पुराना तरीका (प्रॉम्प्ट इंजीनियरिंग): आप अपने कैरेक्टर को अलग-अलग कमांड चिल्लाकर देते हैं इस उम्मीद में कि कोई काम कर जाए।
- पुराना तरीका (फाइन-ट्यूनिंग): आप कैरेक्टर को आपकी आज्ञा के अनुरूप अपनी पूरी पर्सनैलिटी को फिर से सीखने के लिए मजबूर करते हैं।
- PGT तरीका: आप कैरेक्टर की पर्सनैलिटी को बिल्कुल वैसा ही रखते हैं, लेकिन आप उनके व्यवहार को थोड़ा बदलने के लिए एक "प्रेफरेंस डायल" का उपयोग करते हैं। आप डायल को थोड़ा बाईं ओर घुमाते हैं, वे टमाटरों को पूरी तरह से काटते हैं। आप डायल को थोड़ा दाईं ओर घुमाते हैं, वे ड्रेसिंग डाल देते हैं।
यह कैसे काम करता है: "टेस्ट टेस्टर" लूप
पेपर एक बहुत ही कुशल "टेस्ट-टेस्टिंग" सत्र की प्रक्रिया का वर्णन करता है:
- सेटअप: आप एक बुनियादी निर्देश (जैसे, "लकड़ी इकट्ठा करें") के साथ शुरू करते हैं। फ्रीज़ किया हुआ रोबोट इसे करने की कोशिश करता है।
- ट्रायल: रोबोट कुछ प्रयास (trajectories) उत्पन्न करता है। कुछ बिखरे हुए होते हैं; कुछ अच्छे होते हैं।
- फीडबैक: एक इंसान (या रिवॉर्ड सिस्टम) उन प्रयासों को देखता है और कहता है, "मुझे यह वाला उस दूसरे वाले से बेहतर लग रहा है।" उन्हें एक परफेक्ट मैनुअल लिखने की ज़रूरत नहीं है; उन्हें बस एक विजेता और एक हारने वाला चुनना है।
- एडजस्टमेंट: सिस्टम इस "विजेता बनाम हारने वाला" फीडबैक का उपयोग छिपे हुए डायल को ट्यून करने के लिए करता है। यह पूछता है, "डायल में क्या सूक्ष्म बदलाव करने से रोबलेट 'विजेता' एक्शन के बजाय 'हारने वाला' एक्शन करेगा?"
- परिणाम: रोबट का मस्तिष्क अछूता रहता है, लेकिन डायल अब उस "स्वीट स्पॉट" पर सेट हो जाता है जो आपकी प्राथमिकताओं के साथ पूरी तरह मेल खाता है।
यह एक बड़ी बात क्यों है
पेपर ने इसे Minecraft (एक जटिल, ओपन-वर्ल्ड गेम) और रोबोटिक आर्म्स पर टेस्ट किया। यहाँ उन्होंने पाया (सरल शब्दों में):
- यह एक जादुई डायल है: केवल इस छिपे हुए डायल को घुमाकर, सिस्टम ने केवल अलग-अलग टेक्स्ट प्रॉम्प्ट आज़माने की तुलना में प्रदर्शन में 72% से 81% तक सुधार किया। इसने बेहतरीन मानव-लिखित निर्देशों को भी पीछे छोड़ दिया।
- यह रोबोट को खराब नहीं करता: क्योंकि रोबोट का मस्तिष्क (पॉलिसी) फ्रीज़ है, इसलिए वह अन्य चीजें करना नहीं भूलता है। यदि आप डायल को "लकड़ी इकट्ठा करने" के लिए ट्यून करते हैं, तो रोबोट बाद में "घर बनाने" के लिए डायल को वापस "बिल्ड" सेटिंग पर घुमाकर भी काम कर सकता है।
- यह आश्चर्यों को संभालता है: जब वातावरण बदल गया (जैसे, गेम की दुनिया अलग दिखने लगी, या रोबोट एक नए कमरे में था), तो "डायल" विधि ने रोबोट को फिर से प्रशिक्षित करने की तुलना में बहुत बेहतर काम किया। यह अधिक मजबूत (robust) था, जैसे एक अनुभवी ड्राइवर जो नई सड़क पर बिना दोबारा ड्राइविंग सीखे काम संभाल लेता है।
- यह सस्ता है: रोबोट के मस्तिष्क को फिर से प्रशिक्षित करने के लिए लाखों डॉलर की कंप्यूटिंग पावर की आवश्यकता होती है। इस एकल "डायल" को ट्यून करने में उसकी तुलना में बहुत कम शक्ति और डेटा लगता है।
निचोड़ (The Bottom Line)
लेखक इसे प्रेफरेंस गोल ट्यूनिंग (PGT) कहते हैं। यह एक पूर्व-प्रशिक्षित AI को उसके पुराने कौशल खोए बिना नए करतब सिखाने का एक तरीका है। AI को नए नियम रटाने के बजाय, आप बस उस "छिपे हुए सेटिंग" को ढूंढ लेते हैं जो आपके द्वारा चाही गई क्रिया को अनलॉक करता है, जिससे AI की मूल बुद्धिमत्ता सुरक्षित रहती है।
पेपर में बताई गई सीमाएँ:
- रोबोट के पास पहले से ही उस कार्य को करने की कुछ क्षमता होनी चाहिए। यदि रोबोट ने कभी भेड़ नहीं देखी है, तो डायल घुमाने से वह भेड़ का शिकार करना नहीं सीख जाएगा; उसे बस एक शुरुआती बिंदु की आवश्यकता है।
- आपको हर एक कार्य के लिए एक नया डायल ट्यून करना होगा (लकड़ी के लिए एक, पत्थर के लिए एक, आदि), लेकिन यह वास्तव में एक विशेषता (feature) है क्योंकि यह कार्यों को अलग रखता है और उन्हें एक-दूसरे में हस्तक्षेप करने से रोकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।