← नवीनतम पेपर
🤖 AI

Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies

यह शोध पत्र प्रिफरेंस गोल ट्यूनिंग (PGT) को प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग फ्रेमवर्क है जो नीति मापदंडों को अपडेट करने के बजाय निरंतर लेटेंट गोल एम्बेडिंग्स को अनुकूलित करके फ्रोजन गोल-कंडीशन्ड पॉलिसियों को कार्य प्राथमिकताओं के साथ संरेखित करता है, जिससे Minecraft SkillForge बेंचमार्क पर विशेषज्ञ प्रॉम्प्ट्स और पूर्ण फाइन-ट्यूनिंग दोनों की तुलना में बेहतर प्रदर्शन और मजबूती प्राप्त होती है।

मूल लेखक: Guangyu Zhao, Kewei Lian, Haoxuan Ru, Borong Zhang, Haowei Lin, Zhancun Mu, Haobo Fu, Qiang Fu, Shaofei Cai, Zihao Wang, Yitao Liang

प्रकाशित 2026-05-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guangyu Zhao, Kewei Lian, Haoxuan Ru, Borong Zhang, Haowei Lin, Zhancun Mu, Haobo Fu, Qiang Fu, Shaofei Cai, Zihao Wang, Yitao Liang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यधिक कुशल, पूर्व-प्रशिक्षित (pre-trained) रोबोट शेफ है। इस शेफ ने करोड़ों कुकिंग वीडियो देखकर वर्षों बिताए हैं और उसे काटने, तलने और बेकिंग के भौतिक विज्ञान (physics) की किसी भी अन्य व्यक्ति से बेहतर समझ है। हालाँकि, जब आप उससे "सलाद बनाने" के लिए कहते हैं, तो वह टमाटरों को बहुत बारीक काट सकता है या ड्रेसिंग डालना भूल सकता है, क्योंकि आपका मौखिक निर्देश उसके विशिष्ट स्टाइल के लिए बिल्कुल सही ट्रिगर नहीं था।

आमतौर पर, इसे ठीक करने के लिए, आपके पास दो बुरे विकल्प होते हैं:

  1. निर्देशों को फिर से लिखना: आप सैकड़ों अलग-अलग वाक्यांशों ("टमाटर काटें," "टमाटर के टुकड़े करें," "टमाटर स्लाइस करें") को आज़माते हैं जब तक कि आपको वह शब्द न मिल जाए जो काम करे। यह सही पासवर्ड का अनुमान लगाने जैसा है; यह धीमा है और अक्सर विफल हो जाता है।
  2. शेफ को फिर से प्रशिक्षित करना: आप शेफ को आपकी पसंद के अनुसार सब कुछ फिर से सीखने के लिए वापस कुकरी स्कूल ले जाते हैं। यह महंगा है, इसमें बहुत समय लगता है, और इसमें यह जोखिम भी है कि शेफ आपके विशिष्ट सलाद के अलावा कुछ और बनाना भूल जाए (जिसे "कैटास्ट्रोफिक फॉरगेटिंग" या विनाशकारी विस्मृति कहा जाता है)।

यह पेपर "प्रेफरेंस गोल ट्यूनिंग" (PGT) नामक एक तीसरे, स्मार्ट तरीके का परिचय देता है।

मुख्य विचार: "रिमोट कंट्रोल" रूपक

शेफ के मस्तिष्क (पॉलिसी) को फिर से लिखने या सटीक शब्दों का अनुमान लगाने के बजाय, लेखक इसके लेटेंट गोल एम्बेडिंग (latent goal embedding) को एक निरंतर रिमोट कंट्रोल की तरह मानते हैं।

सोचिए कि शेफ का मस्तिष्क एक जमे हुए (frozen), हाई-एंड वीडियो गेम कैरेक्टर की तरह है। आप उसके कोड या आंकड़ों (stats) को नहीं बदल सकते। हालाँकि, आप एक छिपे हुए "डायल" (लेटेंट गोल) को एडजस्ट कर सकते हैं जो आपको बताता है कि "भेड़ का शिकार करने" के कमांड की व्याख्या ठीक से कैसे करनी है।

  • पुराना तरीका (प्रॉम्प्ट इंजीनियरिंग): आप अपने कैरेक्टर को अलग-अलग कमांड चिल्लाकर देते हैं इस उम्मीद में कि कोई काम कर जाए।
  • पुराना तरीका (फाइन-ट्यूनिंग): आप कैरेक्टर को आपकी आज्ञा के अनुरूप अपनी पूरी पर्सनैलिटी को फिर से सीखने के लिए मजबूर करते हैं।
  • PGT तरीका: आप कैरेक्टर की पर्सनैलिटी को बिल्कुल वैसा ही रखते हैं, लेकिन आप उनके व्यवहार को थोड़ा बदलने के लिए एक "प्रेफरेंस डायल" का उपयोग करते हैं। आप डायल को थोड़ा बाईं ओर घुमाते हैं, वे टमाटरों को पूरी तरह से काटते हैं। आप डायल को थोड़ा दाईं ओर घुमाते हैं, वे ड्रेसिंग डाल देते हैं।

यह कैसे काम करता है: "टेस्ट टेस्टर" लूप

पेपर एक बहुत ही कुशल "टेस्ट-टेस्टिंग" सत्र की प्रक्रिया का वर्णन करता है:

  1. सेटअप: आप एक बुनियादी निर्देश (जैसे, "लकड़ी इकट्ठा करें") के साथ शुरू करते हैं। फ्रीज़ किया हुआ रोबोट इसे करने की कोशिश करता है।
  2. ट्रायल: रोबोट कुछ प्रयास (trajectories) उत्पन्न करता है। कुछ बिखरे हुए होते हैं; कुछ अच्छे होते हैं।
  3. फीडबैक: एक इंसान (या रिवॉर्ड सिस्टम) उन प्रयासों को देखता है और कहता है, "मुझे यह वाला उस दूसरे वाले से बेहतर लग रहा है।" उन्हें एक परफेक्ट मैनुअल लिखने की ज़रूरत नहीं है; उन्हें बस एक विजेता और एक हारने वाला चुनना है।
  4. एडजस्टमेंट: सिस्टम इस "विजेता बनाम हारने वाला" फीडबैक का उपयोग छिपे हुए डायल को ट्यून करने के लिए करता है। यह पूछता है, "डायल में क्या सूक्ष्म बदलाव करने से रोबलेट 'विजेता' एक्शन के बजाय 'हारने वाला' एक्शन करेगा?"
  5. परिणाम: रोबट का मस्तिष्क अछूता रहता है, लेकिन डायल अब उस "स्वीट स्पॉट" पर सेट हो जाता है जो आपकी प्राथमिकताओं के साथ पूरी तरह मेल खाता है।

यह एक बड़ी बात क्यों है

पेपर ने इसे Minecraft (एक जटिल, ओपन-वर्ल्ड गेम) और रोबोटिक आर्म्स पर टेस्ट किया। यहाँ उन्होंने पाया (सरल शब्दों में):

  • यह एक जादुई डायल है: केवल इस छिपे हुए डायल को घुमाकर, सिस्टम ने केवल अलग-अलग टेक्स्ट प्रॉम्प्ट आज़माने की तुलना में प्रदर्शन में 72% से 81% तक सुधार किया। इसने बेहतरीन मानव-लिखित निर्देशों को भी पीछे छोड़ दिया।
  • यह रोबोट को खराब नहीं करता: क्योंकि रोबोट का मस्तिष्क (पॉलिसी) फ्रीज़ है, इसलिए वह अन्य चीजें करना नहीं भूलता है। यदि आप डायल को "लकड़ी इकट्ठा करने" के लिए ट्यून करते हैं, तो रोबोट बाद में "घर बनाने" के लिए डायल को वापस "बिल्ड" सेटिंग पर घुमाकर भी काम कर सकता है।
  • यह आश्चर्यों को संभालता है: जब वातावरण बदल गया (जैसे, गेम की दुनिया अलग दिखने लगी, या रोबोट एक नए कमरे में था), तो "डायल" विधि ने रोबोट को फिर से प्रशिक्षित करने की तुलना में बहुत बेहतर काम किया। यह अधिक मजबूत (robust) था, जैसे एक अनुभवी ड्राइवर जो नई सड़क पर बिना दोबारा ड्राइविंग सीखे काम संभाल लेता है।
  • यह सस्ता है: रोबोट के मस्तिष्क को फिर से प्रशिक्षित करने के लिए लाखों डॉलर की कंप्यूटिंग पावर की आवश्यकता होती है। इस एकल "डायल" को ट्यून करने में उसकी तुलना में बहुत कम शक्ति और डेटा लगता है।

निचोड़ (The Bottom Line)

लेखक इसे प्रेफरेंस गोल ट्यूनिंग (PGT) कहते हैं। यह एक पूर्व-प्रशिक्षित AI को उसके पुराने कौशल खोए बिना नए करतब सिखाने का एक तरीका है। AI को नए नियम रटाने के बजाय, आप बस उस "छिपे हुए सेटिंग" को ढूंढ लेते हैं जो आपके द्वारा चाही गई क्रिया को अनलॉक करता है, जिससे AI की मूल बुद्धिमत्ता सुरक्षित रहती है।

पेपर में बताई गई सीमाएँ:

  • रोबोट के पास पहले से ही उस कार्य को करने की कुछ क्षमता होनी चाहिए। यदि रोबोट ने कभी भेड़ नहीं देखी है, तो डायल घुमाने से वह भेड़ का शिकार करना नहीं सीख जाएगा; उसे बस एक शुरुआती बिंदु की आवश्यकता है।
  • आपको हर एक कार्य के लिए एक नया डायल ट्यून करना होगा (लकड़ी के लिए एक, पत्थर के लिए एक, आदि), लेकिन यह वास्तव में एक विशेषता (feature) है क्योंकि यह कार्यों को अलग रखता है और उन्हें एक-दूसरे में हस्तक्षेप करने से रोकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →