← नवीनतम पेपर
🤖 machine learning

Lyapunov-Guided Self-Alignment: Test-Time Adaptation for Offline Safe Reinforcement Learning

यह शोध पत्र SAS प्रस्तुत करता है, जो एक ट्रांसफार्मर-आधारित फ्रेमवर्क है जो एजेंट के व्यवहार को बिना पुन: प्रशिक्षित किए सुरक्षा की ओर पुनर्गठित करने के लिए इन-कॉन्टेक्स्ट प्रॉम्प्ट्स के रूप में लयापुनोव-अनुपालन (Lyapunov-compliant) काल्पनिक प्रक्षेप पथों को उत्पन्न करने और चुनने के माध्यम से ऑफलाइन सुरक्षित सुदृढीकरण लर्निंग (offline safe reinforcement learning) के लिए टेस्ट-टाइम अनुकूलन सक्षम करता है।

मूल लेखक: Seungyub Han, Hyungjin Kim, Jungwoo Lee

प्रकाशित 2026-04-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seungyub Han, Hyungjin Kim, Jungwoo Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक अत्यधिक कुशल रोबोट ड्राइवर को काम पर रखा है जिसने विशेषज्ञ ड्राइविंग वीडियो के हजारों घंटों को देखकर गाड़ी चलाना सीखा है। यह रोबोट सड़क का अनुसरण करने में बहुत अच्छा है, लेकिन इसकी एक समस्या है: इसे एक आदर्श, धूप वाले सिमुलेशन में प्रशिक्षित किया गया था। जब आप अंततः इसे वास्तविक सड़क पर रखते हैं जहाँ अप्रत्याशित बारिश, गड्ढे या अचानक कोई मोड़ आता है, तो रोबोट घबरा जाता है। यह अपने पुराने नियमों को एक नई स्थिति में लागू करने की कोशिश करता है और शायद दीवार या खाई में जा सकता है।

यह वह मुख्य समस्या है जिसे यह पेपर संबोधित करता है: ऑफलाइन सुदृढीकरण लर्निंग (Offline Reinforcement Learning - RL)। यह एक रोबोट को पिछले अनुभवों के विशाल डेटासेट पर प्रशिक्षित करने जैसा है बिना उसे वास्तविक दुनिया में अभ्यास करने देने के। जब वास्तविक दुनिया थोड़ी बदल जाती है, तो रोबोट असुरक्षित हो जाता है।

लेखक एक समाधान प्रस्तावित करते हैं जिसे SAS (Self-Alignment for Safety) कहा जाता है। SAS को एक नए शिक्षक के रूप में नहीं, बल्कि एक सेफ्टी कोच के रूप में सोचें जो रोबोट को गाड़ी चलाना शुरू करने से ठीक पहले बात करता है।

यहाँ बताया गया है कि SAS कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. "कल्पना" चरण (The "Imagination" Phase)

इससे पहले कि रोबोट वास्तविक कदम भी उठाए, SAS उससे अगले कुछ सेकंड के लिए कई अलग-अलग तरीकों से गाड़ी चलाने की कल्पना करने को कहता है।

  • रूपक (Metaphor): कल्पना कीजिए कि आप एक व्यस्त सड़क पार करने जा रहे हैं। कदम बाहर रखने से पहले, आप जल्दी से तीन परिदृश्य सोचते हैं: "यदि मैं बाईं ओर चलता हूँ, तो मैं कार से टकरा सकता हूँ," "यदि मैं दाईं ओर चलता हूँ, तो मैं लड़खड़ा सकता हूँ," और "यदि मैं सीधा चलता हूँ, तो मैं सुरक्षित हूँ।"
  • तकनीक: रोबोट अपने आंतरिक "वर्ल्ड मॉडल" (दुनिया कैसे काम करती है इसका मानसिक मानचित्र) का उपयोग करके इन काल्पनिक रास्तों, या "रोलआउट्स" (rollouts) को उत्पन्न करता है।

2. "ल्यपुनोव" सुरक्षा जांच (The "Lyapunov" Safety Check)

रोबोट को कैसे पता चलता है कि कौन सा काल्पनिक रास्ता सुरक्षित है? यह एक गणितीय उपकरण का उपयोग करता है जिसे ल्यपुनोव फंक्शन (Lyapunov function) कहते हैं।

  • रूपक: ल्यपुनोव जांच को एक ऐसी सेंसर के रूप में सोचें जो यह सुनिश्चित करती है कि गेंद हमेशा एक सुरक्षित घाटी (लक्ष्य) की ओर नीचे की ओर लुढ़क रही है और कभी भी एक चट्टान (खतरा) की ओर ऊपर की ओर नहीं लुढ़क रही है।
  • तकनीक: पेपर एक "सेफ्टी स्कोर" को परिभाषित करता है जो इस बात पर आधारित है कि रोबोट ने अपने प्रशिक्षण डेटा में कितनी बार समान स्थितियों को देखा है। यदि एक काल्पनिक रास्ता ऐसी जगह ले जाता है जिसे रोबोट ने पहले कभी नहीं देखा है (एक "लो-डेंसिटी" क्षेत्र), तो सुरक्षा स्कोर गिर जाता है, और उस रास्ते को खतरनाक के रूप में चिह्नित किया जाता है। रोबोट जाँचता है: "क्या यह रास्ता सुरक्षा स्कोर को नीचे (या सुरक्षित) रखता है?"

3. "सेल्फ-अलाइनमेंट" (The "Self-Alignment" - जादू का कमाल)

यह सबसे अनूठा हिस्सा है। आमतौर पर, किसी रोबोट को ठीक करने के लिए, आपको इसे शून्य से फिर से प्रशिक्षित करना पड़ता है, जिसमें बहुत समय और डेटा लगता है। SAS कुछ अधिक स्मार्ट करता है: यह रोबोट की अपनी कल्पना का उपयोग खुद को सुधारने के लिए करता है।

  • रूपक: कल्पना कीजिए कि रोबोट गाड़ी चलाने वाला है। उसे फिर से प्रशिक्षित करने के बजाय, SAS कहता है: "हे, इन तीन काल्पनिक रास्तों को देखो जो तुमने अभी बनाए हैं। दो में दीवार टकराती है। एक सुरक्षित है। आइए मान लें कि वह सुरक्षित रास्ता एक संकेत (hint) या एक प्रॉम्प्ट (prompt) है।"
  • रोबोट फिर उस सुरक्षित काल्पनिक पथ को लेता है और उसे अपने मस्तिष्क में एक "प्रदर्शन" (demonstration) के रूप में वापस फीड करता है। यह ऐसा है जैसे रोबोट कह रहा हो, "ठीक है, मैं अब सुरक्षित रास्ता देख सकता हूँ। मैं इस विशिष्ट उदाहरण का पालन करूँगा।"
  • परिणाम: रोबोट अपने मूल कोड या वेट्स (weights) को बदले बिना अपने व्यवहार को सुरक्षित बनाने के लिए संरेखित (align) करता है। यह एक प्रॉम्प्ट के माध्यम से किया गया "स्व-सुधार" है, जैसा कि आप किसी स्मार्ट AI से पूछ सकते हैं, "यहाँ एक सुरक्षित उदाहरण है, अब इसी तरह करो," बिना AI को फिर से प्रशिक्षित किए।

4. "हाइरार्किकल" मस्तिष्क (The "Hierarchical" Brain)

पेपर बताता है कि रोबोट का मस्तिष्क (एक ट्रांसफार्मर मॉडल) दो-स्तरीय प्रबंधक की तरह काम करता है।

  • रूपक: एक बॉस (हाई-लेवल पॉलिसी) है जो सामान्य रणनीति तय करता है (जैसे, "लक्ष्य तक जाओ"), और एक वर्कर (लो-लेवल पॉलिसी) है जो वास्तव में पहियों को घुमाता है।
  • तकनीक: SAS "बॉस" के रूप में कार्य करता है। सुरक्षित "कल्पना किए गए" पथ को प्रॉम्प्ट के रूप में फीड करके, SAS वास्तव में बॉस को एक नया निर्देश फुसफुसा रहा है: "इस विशिष्ट स्थिति के लिए, रणनीति 'इस सुरक्षित पथ का पालन करें' होनी चाहिए।" यह रोबोट को नए खतरों के प्रति तुरंत अनुकूल होने की अनुमति देता है।

हमने क्या पाया?

लेखकों ने विभिन्न रोबोट सिमुलेशन (जैसे बाधाओं के बीच कार, बिंदु या ड्रोन को चलाना) पर इसका परीक्षण किया।

  • परिणाम: SAS का उपयोग करने वाले रोबानों ने अपने मूल प्रशिक्षण का उपयोग करने वाले रोबोटों की तुलना में काफी कम गलतियाँ कीं और कम दुर्घटनाग्रस्त हुए।
  • बोनस: उन्होंने प्रदर्शन का बलिदान नहीं दिया। रोबोट अभी भी तेज़ थे और अपने लक्ष्यों तक पहुँचे, लेकिन उन्होंने इसे बहुत अधिक सुरक्षित तरीके से किया।
  • मुख्य निष्कर्ष: SAS एक रोबोट को अपने पुराने डेटा से प्रशिक्षित होकर, अपनी ही "कल्पना" का उपयोग करके एक सुरक्षित रास्ता खोजने और फिर उस पथ को एक नियम के रूप में पालन करके, तुरंत नई और खतरनाक स्थितियों के अनुकूल होने की अनुमति देता है।

सारांश

SAS एक सुरक्षा जाल की तरह है जो रोबोट के अपने विचारों से बना है। रोबोट को नए नियम सिखाने के (जो धीमा और कठिन है) के बजाय, SAS रोबोट से भविष्य की कल्पना करने, उस भविष्य के सबसे सुरक्षित संस्करण को चुनने और फिर उस सुरक्षित संस्करण को अभी क्या करना है, इसके मार्गदर्शन के रूप में उपयोग करने को कहता है। यह "क्या होगा अगर" को "क्या करना है" में बदल देता है, जिससे रोबोट को बिना एक सेकंड भी पुन: प्रशिक्षित किए सुरक्षित रखा जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →