← नवीनतम पेपर
🤖 machine learning

When Policies Cannot Be Retrained: A Unified Closed-Form View of Post-Training Steering in Offline Reinforcement Learning

यह शोध पत्र फ्रोजन ऑफलाइन रीइन्फोर्समेंट लर्निंग पॉलिसीज़ के लिए पोस्ट-ट्रेनिंग स्टीयरिंग का एक एकीकृत क्लोज्ड-फॉर्म विश्लेषण प्रदान करता है, जो यह प्रदर्शित करता है कि प्रोडक्ट-ऑफ-एक्सपर्ट्स और KL-रेगुलराइज्ड अडैप्टेशन "एक्टर-एंकर्ड" सुरक्षा तंत्र के रूप में कार्य करते हैं जो तैनाती के उद्देश्यों में परिवर्तन होने पर गारंटीकृत प्रदर्शन लाभ के बजाय क्रमिक गिरावट (ग्रेसफुल डिग्रेडेशन) प्रदान करते हैं।

मूल लेखक: Elias Hossain, Mohammad Jahid Ibna Basher, Ivan Garibay, Ozlem Garibay, Niloofar Yousefi

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Elias Hossain, Mohammad Jahid Ibna Basher, Ivan Garibay, Ozlem Garibay, Niloofar Yousefi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक पेशेवर शेफ है जिसने क्लासिक बीफ वेलिंगटन (Beef Wellington) के लिए एक बहुत ही विशिष्ट, अत्यधिक विनियमित रेसिपी में महारत हासिल करने में वर्षों बिताए हैं। यह शेफ "फ्रोजन" (frozen) है—यानी आपको उनके प्रशिक्षण, उनके उपकरणों, या उनकी मौलिक तकनीकों को बदलने की अनुमति नहीं है क्योंकि उन्हें पहले ही एक सख्त खाद्य सुरक्षा बोर्ड द्वारा प्रमाणित किया जा चुका है।

अचानक, एक ग्राहक आता है और उसी व्यंजन के लिए पूछता है, लेकिन एक ट्विस्ट के साथ: "क्या आप इसे बहुत अधिक तीखा और कम मक्खन वाला बना सकते हैं?"

AI की दुनिया में, यह वही समस्या है जिसे यह पेपर हल करता है। आमतौर पर, यदि आप चाहते हैं कि कोई AI अपने व्यवहार को बदले, तो आपको उसे "रीट्रेन" (retrain) करना पड़ता है, जो महंगा, धीमा और अक्सर असंभव होता है यदि AI पहले से ही सख्त सुरक्षा नियमों के पीछे लॉक हो। यह पेपर उस फ्रोजन शेफ को "स्टीयर" (steer) करने का एक तरीका प्रस्तावित करता है, बिना उसके मूल प्रशिक्षण को बदले।

मुख्य विचार: "विशेषज्ञ और मार्गदर्शक" (The Expert and the Guide)

शोधकर्ता एक विधि का उपयोग करते हैं जिसे प्रोडक्ट-ऑफ-एक्सपर्ट्स (Product-of-Experts - PoE) कहा जाता है। इसे इस प्रकार समझें:

  1. फ्रोजन एक्सपर्ट (शेफ): यह मूल AI है। यह अविश्वसनीय रूप से विश्वसनीय है और जानता है कि ठीक से कैसे काम करना है, लेकिन यह केवल एक विशिष्ट चीज़ करना जानता है।
  2. गोल-कंडीशन्ड प्रायर (Sous-Chef/मार्गदर्शक): यह एक दूसरा, हल्का AI है। यह पूरा भोजन बनाना नहीं जानता, लेकिन यह नए लक्ष्य (जैसे "तीखापन") के बारे में थोड़ा बहुत जानता है।

शेफ को नया कौशल सीखने के लिए मजबूर करने के बजाय, आप शेफ और गाइड को बिल्कुल अंतिम क्षण में एक साथ काम करने देते हैं। जब शेफ कोई कदम उठाने वाला होता है, तो गाइड फुसफुसाता है, "हे, याद रखना, हमें यहाँ अधिक तीखापन चाहिए!" अंतिम क्रिया शेफ की विशेषज्ञता और गाइड के सुझाव का एक गणितीय मिश्रण होती है।

"सेफ्टी एंकर" (यह क्यों चतुर है)

सबसे महत्वपूर्ण हिस्सा यह है कि यह गलतियों को कैसे संभालता है।

कल्पthoughtना कीजिए कि यदि आप "गाइड" को पूरी तरह नियंत्रण लेने देते हैं। चूंकि गाइड एक मास्टर शेफ नहीं है, इसलिए वे कुछ पागलपन भरा सुझाव दे सकते हैं, जैसे पेस्ट्री में कच्चे मिर्च डाल देना। व्यंजन बर्बाद हो जाएगा।

शोधकर्ताओं ने पाया कि उनकी विधि एक सेफ्टी एंकर (Safety Anchor) के रूप में कार्य करती है। क्योंकि वे एक विशिष्ट गणितीय सूत्र (Product-of-Experts में "Product") का उपयोग करते हैं, अंतिम निर्णय ऐसा कुछ भी नहीं कर सकता जिसे मूल शेफ असंभव मानता है। यदि शेफ जानता है कि "पेस्ट्री में मिर्च डालना" शून्य-प्रतिशत संभावना है, तो गाइड उन्हें इसमें शामिल नहीं कर सकता। शेफ की विशेषज्ञता एक सीमा के रूप में कार्य करती है जो गाइड को AI को खाई में गिराने से रोकती है।

"सीलिंग" (वास्तविकता की जाँच)

शोधकर्ताओं ने यह भी कुछ बहुत ईमानदार खोजा: आप उस कार को स्टीयर नहीं कर सकते जिसमें इंजन ही न हो।

उन्होंने कठिन कार्यों पर इसका परीक्षण किया। उन्होंने पाया कि यदि मूल "शेफ" (फ्रोजन AI) पहले से ही ही संभव के पूर्णतम स्तर पर है, या यदि शेफ अक्षम है (जैसे ऐसा शेफ जिसे चूल्हा इस्तेमाल करना भी नहीं आता), तो कितना भी "गाइडिंग" (guiding) मदद नहीं करेगा। आप एक कुशल ड्राइवर को नए गंतव्य की ओर मोड़ सकते हैं, लेकिन आप एक मूर्ति को मोड़ नहीं सकते।

तीन बुलेट्स में सारांश:

  • समस्या: जब AI "फ्रोजन" हो और उसे दोबारा ट्रेन न किया जा सके, तो आप AI का लक्ष्य कैसे बदलते हैं?
  • समाधान: निर्णय के क्षण में "एक्सपर्ट" को धकेलने के लिए एक "गाइड" का उपयोग करें, एक ऐसे गणितीय सूत्र का उपयोग करके जो यह सुनिश्चित करता है कि एक्सपर्ट हमेशा सुरक्षा सीमाओं के भीतर रहे।
  • कैच (Catch): यह तभी काम करता है जब मूल AI पहले से ही सक्षम हो। यदि मूल AI खराब है, तो "स्टीयरिंग" उसे बचा नहीं पाएगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →