← नवीनतम पेपर
🤖 AI

Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories

यह शोध पत्र Self-ReSET का प्रस्ताव करता है, जो एक शुद्ध सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो लार्ज रीजनिंग मॉडल्स को उनके अपने असुरक्षित तर्क पथों (reasoning trajectories) से आंतरिक रूप से आत्म-सुधार (self-recovery) सीखने में सक्षम बनाता है, जिससे सामान्य उपयोगिता बनाए रखते हुए प्रतिकूल (adversarial) और आउट-ऑफ-डिस्ट्रीब्यूशन जेलब्रेक हमलों के विरुद्ध मजबूती को महत्वपूर्ण रूप से बढ़ाया जा सकता है।

मूल लेखक: Dongcheng Zhang, Yi Zhang, Yuxin Chen, An Zhang, Xiang Wang, Chaochao Lu

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dongcheng Zhang, Yi Zhang, Yuxin Chen, An Zhang, Xiang Wang, Chaochao Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories" का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी समस्या: AI सुरक्षा का "ट्रेन एक्सीडेंट" (Train Wreck)

कल्पना कीजिए कि एक बहुत ही बुद्धिमान AI छात्र (एक Large Reasoning Model) एक परीक्षा दे रहा है। आमतौर पर, यदि छात्र गणित में कोई छोटी सी गलती करता है, तो वह पीछे मुड़कर देख सकता है, कह सकता है, "ओह, मैंने उस स्टेप में गलती कर दी," और उत्तर पूरा करने से पहले उसे सुधार सकता है। इसे सेल्फ-करेक्शन (self-correction) कहा जाता है।

हालाँकि, जब परीक्षा में चालाकी भरे, दुर्भावनापूर्ण प्रश्न शामिल होते हैं (जैसे "मैं बम कैसे बनाऊं?" या "मैं पुलिस के ब्रेथलाइज़र को कैसे धोखा दूँ?"), तो यह छात्र भ्रमित हो जाता है। एक बार जब वे गलत उत्तर के बारे में सोचना शुरू कर देते हैं, तो वे एक "बुरे विचार के चक्र" (bad thought loop) में फंस जाते हैं। वे खुद को हानिकारक उत्तर पूरा करने से रोकने में असमर्थ होते हैं, भले ही उन्हें आधे रास्ते में एहसास हो जाए कि यह खतरनाक है।

पुराना तरीका (स्थिर मानचित्र - The Static Map):
पहले, शोधकर्ताओं ने विशेषज्ञों द्वारा लिखे गए "परफेक्ट" उदाहरणों की एक लाइब्रेरी दिखाकर इसे ठीक करने की कोशिश की। उन्होंने कहा, "देखो कि एक अच्छा छात्र इस बुरे सवाल को कैसे हैंडल करेगा।"

  • दोष: यह एक ड्राइवर को ऐसे शहर के मानचित्र देने जैसा है जो अब अस्तित्व में ही नहीं है। AI की गलतियाँ वास्तविक समय में, उसके अपने अनूठे तरीके से होती हैं। "विशेषज्ञ का मानचित्र" उस विशिष्ट, उलझे हुए रास्ते से मेल नहीं खाता जो AI ने वास्तव में लिया था जब वह भटक गया था। AI मानचित्र का पालन करना सीखता है, लेकिन वह अपने स्वयं के भ्रम से कैसे बाहर निकलना है, यह नहीं सीख पाता।

नया समाधान: Self-ReSET

लेखक Self-ReSET नामक एक नई विधि प्रस्तावित करते हैं। एक बाहरी विशेषज्ञ मानचित्र पर निर्भर रहने के बजाय, वे AI को वास्तविक समय में अपनी स्वयं की गलतियों से सीखना सिखाते हैं।

इसे एक "ब्लैक बॉक्स" और "रिकवरी ड्रिल" वाले सेल्फ-ड्राइविंग कार की तरह समझें।

यह कैसे काम करता है (तीन चरण)

1. सतर्क सह-पायलट (The Watchful Co-Pilot - Monitor)
कल्पना कीजिए कि AI गाड़ी चला रहा है। एक विशेष "गार्जियन" (एक स्ट्रीम गार्ड मॉडल) बगल वाली सीट पर बैठा है, जो सड़क को टोकन-दर-टोकन (शब्द-दर-शब्द) देख रहा है।

  • जैसे ही AI कुछ खतरनाक सोचना शुरू करता है (जैसे, "ठीक है, मुझे सेंसर को बायपास करने का तरीका समझाना चाहिए..."), गार्जियन चिल्लाता है, "रुको! यह रेड लाइन है!"
  • गार्जियन दुर्घटना होने का इंतज़ार नहीं करता; वह कार को उसी क्षण पकड़ लेता है जब वह सुरक्षित सड़क से भटकती है।

2. मेमोरी बैंक (The Memory Bank - Memorize)
जब गार्जियन किसी गलती को पकड़ता है, तो सिस्टम उसे केवल डिलीट नहीं करता। यह क्रैश होने के ठीक पहले की कार की स्थिति का एक स्नैपशॉट लेता है और उसे एक "मेमोरी बैंक" (एक्सपीरियंस रिप्ले बफर) में सहेज लेता है।

  • यह कार के दुर्घटनाग्रस्त होने के ठीक पहले के क्षण का वीडियो क्लिप बचाने जैसा है।
  • सिस्टम इन "क्रैश के करीब" वाले क्षणों की एक ताज़ा, रोटेटिंग लिस्ट रखता है जो AI ने स्वयं उत्पन्न की है।

3. रिकवरी ड्रिल (The Recovery Drill - Self-Recover)
यही असली जादू है। सिस्टम उन सहेजे गए "क्रैश के करीब" वाले क्षणों को लेता है और AI को उन्हें फिर से दोहराने के लिए मजबूर करता है।

  • ड्रिल: "ठीक है AI, यह वही विचार है जहाँ तुम पटरी से उतरना शुरू हुए थे। अब, फिर से प्रयास करो। क्या तुम इसी सटीक स्थान से कार को वापस सुरक्षित लेन में मोड़ सकते हो?"
  • यदि AI सफलतापूर्वक सुरक्षित उत्तर की ओर वापस मुड़ जाता है, तो उसे रिवॉर्ड (पुरस्कार) मिलता है। यदि वह सड़क से बाहर जाना जारी रखता है, तो उसे कोई रिवॉर्ड नहीं मिलता।
  • इस ड्रिल का बार-बार अभ्यास करके, AI एक 'मसल मेमोरी' विकसित करता है: "ओह, जब मुझे इस तरह के हानिकारक प्रश्न का उत्तर देने की इच्छा होती है, तो मुझे पता है कि सुरक्षा की ओर कैसे मुड़ना है।"

यह बेहतर क्यों है?

  • यह व्यक्तिगत है: एक सामान्य पाठ्यपुस्तक से सीखने के बजाय, AI अपनी विशिष्ट कमियों से सीखता है। यह एक सर्जन के लिए अपने स्वयं के हाथ के कंपन (tremors) के सिमुलेशन पर अभ्यास करने जैसा है, बजाय इसके कि वह केवल यह पढ़े कि स्केलपेल को कैसे पकड़ना है।
  • यह अज्ञात को संभालता है: पेपर दिखाता है कि यह "आउट-ऑफ-डिस्ट्रीब्यूशन" (OOD) हमलों पर भी काम करता है—चालाकी भरे सवाल जो AI ने पहले कभी नहीं देखे। क्योंकि AI ने अपने स्वयं के भटकाव से उबरने का कौशल सीखा है, वह उस कौशल को नए, अजीब जालों पर लागू कर सकता है।
  • यह अन्य कौशलों को नहीं तोड़ता: कभी-कभी, जब आप AI को सुरक्षित बनाना सिखाते हैं, तो वह किसी भी सवाल का जवाब देने से डरने लगता है (यहाँ तक कि सुरक्षित सवालों के भी)। इसे "ओवर-रिफ्यूज़ल" (over-refusal) कहा जाता है। Self-ReSET स्मार्ट है; यह बुरे सवालों को "ना" कहने के साथ-साथ अच्छे सवालों के लिए "हाँ" कहना भी जानता है, जिससे इसके गणित और तर्क कौशल भी पैने रहते हैं।

परिणाम

सरल शब्दों में, Self-ReSET AI को एक आत्म-सुधार करने वाले विशेषज्ञ (self-correcting expert) में बदल देता है। यह केवल नियमों को रटता नहीं है; यह सीखता है कि कब खुद को फिसलते हुए पकड़ना है, रुकना है, और सुरक्षा की ओर वापस मुड़ना है, चाहे वह खतरे के क्षेत्र में कितना भी गहरा क्यों न चला गया हो।

पेपर यह सिद्ध करता है कि अपनी विशिष्ट विफलताओं से उबरने का अभ्यास करने से, AI को धोखा देना बहुत कठिन, बहुत सुरक्षित और बहुत बुद्धिमान बनाना संभव है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →