← नवीनतम पेपर
💬 NLP

UnsafeChain: Enhancing Reasoning Model Safety via Hard Cases

यह शोध पत्र UnsafeChain को प्रस्तुत करता है, जो स्पष्ट रूप से सुधारा गया असुरक्षित पूर्णता (completions) वाले कठिन प्रॉम्प्ट्स से निर्मित एक सुरक्षा संरेखण (safety alignment) डेटासेट है, जो बड़े रीजनिंग मॉडल्स की सामान्य रीजनिंग क्षमताओं को संरक्षित करते हुए उनकी सुरक्षा को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Raj Vardhan Tomar, Preslav Nakov, Yuxia Wang

प्रकाशित 2026-03-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Raj Vardhan Tomar, Preslav Nakov, Yuxia Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े नादान छात्र को एक खतरनाक शहर में नेविगेट करना सिखा रहे हैं। यह छात्र एक लार्ज रीजनिंग मॉडल (LRM) है—एक ऐसा AI जो जटिल पहेलियों को हल करने, कोड लिखने और गणित करने में अविश्वसनीय रूप से अच्छा है, लेकिन कभी-कभी गलत सवाल पूछे जाने पर गलत काम करने के लिए बहक जाता है।

यहाँ UnsafeChain की कहानी है, एक नया तरीका जो इस छात्र की बुद्धिमत्ता को नुकसान पहुँचाए बिना उसे सुरक्षा सिखाता है।

समस्या: "सेफ बबल" (सुरक्षित बुलबुला) का जाल

लंबे समय तक, शोधकर्ताओं ने केवल अच्छे व्यवहार के उदाहरण दिखाकर AI को सुरक्षा सिखाने की कोशिश की।

  • पुराना तरीका: उन्होंने छात्र को दिखाया, "यह एक सुरक्षित प्रश्न है, और यह एक सुरक्षित उत्तर है।" उन्होंने किसी भी ऐसे प्रश्न को हटा दिया जो ट्रिकी (चालाकी भरा) हो सकता था।
  • उपमा: कल्पना कीजिए कि आप एक बच्चे को सड़क पार करना सिखा रहे हैं, लेकिन उसे केवल खाली, धूप वाले चौराहों के वीडियो दिखाते हैं। आप उसे कभी भी व्यस्त चौराहा, लाल बत्ती या अचानक सड़क पार करने वाले व्यक्ति के साथ नहीं दिखाते।
  • परिणाम: जब वह बच्चा अंततः वास्तविक, अराजक शहर (इंटरनेट) में कदम रखता है, तो वह जम जाता है या ट्रैफिक में टकरा जाता है क्योंकि उसने कभी कठिन स्थितियों को संभालने का अभ्यास नहीं किया है। वह सुरक्षा के सिद्धांत को तो जानता है, लेकिन जब चीजें उलझ जाती हैं, तो वह उसे लागू नहीं कर पाता।

समाधान: "करेक्शन ड्रिल" (सुधार अभ्यास)

इस पेपर के लेखकों ने महसूस किया कि AI को वास्तव में सुरक्षित बनाने के लिए, आपको केवल बुरी चीजों को छिपाना नहीं है। आपको उसे बुरी चीजें दिखानी होंगी, उसे प्रयास करने देना होगा (और विफल होने देना होगा), और फिर उसे गलती सुधारना सिखाना होगा।

उन्होंने UnsafeChain नामक एक डेटासेट बनाया। यह कैसे काम करता है, इसके चरण यहाँ दिए गए हैं:

  1. "हार्ड प्रॉम्प्ट्स" (कठिन संकेत) खोजें: उन्होंने हजारों ट्रिकी, खतरनाक या भ्रमित करने वाले प्रश्न एकत्र किए (जैसे जेलब्रेक के प्रयास या जटिल गणितीय समस्याएं) जो आमतौर पर AI मॉडल्स को असुरक्षित उत्तर देने के लिए उकसाते हैं।
  2. AI को विफल होने दें: उन्होंने AI को इन कठिन सवालों के जवाब देने की कोशिश करने दी। स्वाभाविक रूप से, इसने अक्सर एक बुरा या असुरक्षित उत्तर दिया।
  3. "रिवाइंड एंड फिक्स" (पीछे मुड़ें और सुधारें) बटन: बुरे उत्तर को फेंकने के बजाय, उन्होंने एक सुपर-स्मार्ट AI (GPT-4.1) का उपयोग किया जो एक सख्त लेकिन मददगार शिक्षक की तरह काम करता है। इस शिक्षक ने बुरे उत्तर को देखा और कहा, "नहीं, यह खतरनाक है। आपको इस उत्तर तक पहुँचने के लिए चरण-दर-चरण इस तरह सोचना चाहिए था ताकि एक सुरक्षित और सहायक उत्तर मिल सके।"
  4. पाठ: AI मॉडल ने इन "विफल प्रयास + सुधारा गया उत्तर" के जोड़ों का अध्ययन किया। इसने न केवल यह सीखा कि सही उत्तर क्या है, बल्कि यह भी सीखा कि कैसे रिकवर (संभलना) करना है जब वह गलत रास्ते पर जा रहा हो।

उपमा: फायर ड्रिल (अग्नि अभ्यास)

पुरानी विधि को अग्नि सुरक्षा पर एक पाठ्यपुस्तक देने के रूप में सोचें। उन्होंने धुएं और आग के बारे में पढ़ा, लेकिन उन्होंने कभी वास्तविक आग नहीं देखी।

UnsafeChain एक फायर ड्रिल की तरह है।

  • आप आग का अनुकरण करते हैं (कठिन प्रॉम्प्ट)।
  • छात्र घबरा जाता है और गलत दिशा में भागता है (असुरक्षित आउटपुट)।
  • प्रशिक्षक तुरंत उन्हें रोकता है, कहता है, "रुको! यह गलत रास्ता है। यहाँ सही रास्ता है, और यहाँ बताया गया है कि आप क्यों घबरा गए। चलिए इसे फिर से प्रयास करते हैं।"
  • रिकवरी का अभ्यास करके, छात्र शांत रहना सीखता है और स्थिति डरावनी होने पर भी बाहर निकलने का रास्ता ढूंढ लेता है।

चौंकाने वाली खोज: गुणवत्ता > मात्रा

इस पेपर की एक सबसे शानदार खोज यह है कि AI को सिखाने के लिए आपको लाखों उदाहरणों की आवश्यकता नहीं है।

  • मिथक: "हमें AI को सिखाने के लिए लाखों सुरक्षित उत्तरों का एक विशाल डेटाबेस चाहिए।"
  • वास्तविकता: शोधकर्ताओं ने पाया कि केवल 1,000 "कठिन" उदाहरणों (जहाँ AI विफल हुआ और उसे सुधारा गया) का एक छोटा, सावधानीपूर्वक तैयार किया गया सेट, बड़े और आसान सुरक्षित उदाहरणों के विशाल डेटासेट से बेहतर काम करता है।

रूपक:
यह पियानो सीखने जैसा है। आप उन 10,000 आसान गानों का अभ्यास कर सकते हैं जिन्हें आप पहले से ही पूरी तरह से जानते हैं, और आप कठिन हिस्सों में कभी बेहतर नहीं होंगे। लेकिन यदि आप प्रतिदिन केवल एक घंटा उस एक विशिष्ट गाने का अभ्यास करते हैं जो हमेशा आपसे गलती करवाता है, और आप हर बार अपनी गलतियों को सुधारते हैं, तो आप बहुत तेज़ी से महारत हासिल कर लेंगे।

परिणाम: स्मार्ट और सुरक्षित

जब उन्होंने इस नए तरीके का परीक्षण तीन अलग-अलग AI मॉडल्स पर किया:

  1. सुरक्षा: मॉडल खतरों को पहचानने और बुरे काम करने से मना करने में बहुत बेहतर हो गए, भले ही उन्हें चालाक हैकर्स द्वारा ठगा जा रहा हो।
  2. बुद्धिमत्ता: अन्य तरीकों के विपरीत जिन्होंने AI को "मूर्ख" या कम मददगार बना दिया (क्योंकि वे सुरक्षा पर बहुत अधिक केंद्रित थे), UnsafeChain ने AI के गणित और कोडिंग कौशल को तेज रखा।
  3. सामान्यीकरण (Generalization): मॉडल्स ने केवल उत्तरों को रटा नहीं; उन्होंने सुरक्षा के तर्क को सीखा, ताकि वे नए, अनदेखे तरीकों को भी संभाल सकें।

निचोड़

UnsafeChain हमें सिखाता है कि सुरक्षित AI बनाने के लिए, हमें खतरों को छिपाना नहीं चाहिए। हमें AI को खतरों के संपर्क में लाना चाहिए, उसे लड़खड़ाने देना चाहिए, और फिर उसे ठीक से खड़ा होना सिखाना चाहिए। यह AI को केवल आज्ञाकारी बनाने के बारे में नहीं, बल्कि उसे लचीला (Resilient) बनाने के बारे में है।

केवल बचने के बजाय गलतियों को सुधारने पर ध्यान केंद्रित करके, हमें ऐसा AI मिलता है जो सुरक्षित भी है और दुनिया की सबसे कठिन समस्याओं को हल करने के लिए पर्याप्त स्मार्ट भी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →