← नवीनतम पेपर
🤖 AI

Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

यह अध्ययन प्रदर्शित करता है कि एक ही वंश (lineage) के बड़े भाषा मॉडलों के भीतर, रिफ्यूज़ल तंत्र (अब्लेशन) को हटाने से उनके संरेखित (aligned) समकक्षों की तुलना में सॉफ्टवेयर भेद्यता विश्लेषण कार्यों—जैसे पैच सत्यापन और कोड स्थानीयकरण—के लिए उनकी व्यावहारिक उपयोगिता में महत्वपूर्ण वृद्धि होती है, जो यह रेखांकित करता है कि सुरक्षा मूल्यांकनों को प्रतिक्रिया की इच्छा, शुद्धता और कार्यक्षमता का संयुक्त रूप से आकलन करने की आवश्यकता है।

मूल लेखक: Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास दो जुड़वा भाई हैं जो दोनों ही शानदार सॉफ्टवेयर जासूस हैं। उन्हें एक ही घर में पाला गया, एक ही स्कूलों में पढ़ाया गया और एक ही तरह की किताबों से ज्ञान दिया गया। हालाँकि, एक जुड़वा भाई (मान लीजिए कि वह द गार्ड/The Guard है) को एक सख्त नियम सिखाया गया था: "यदि कोई प्रश्न थोड़ा सा भी ऐसा लगे जिससे घर में घुसपैठ की जा सकती है, तो सुरक्षा के लिए आपको उत्तर देने से मना कर देना चाहिए।" दूसरे जुड़वा भाई (द अनफिल्टर्ड/The Unfiltered) के मामले में वह विशिष्ट नियम सर्जिकल तरीके से हटा दिया गया था; वह लगभग किसी भी चीज़ का उत्तर देगा, बशर्ते प्रश्न पूछा जाए।

यह शोध पत्र इन दोनों जुड़वा भाइयों का एक अध्ययन है ताकि यह देखा जा सके कि वास्तव में अपने स्वयं के डिजिटल घर के छेद को ठीक करने में एक सुरक्षा टीम की मदद करने के लिए कौन बेहतर है।

बड़ी समस्या: "फॉल्स अलार्म" (गलत सूचना) की दुविधा

सॉफ्टवेयर सुरक्षा की दुनिया में, किसी समस्या का वर्णन करने वाले शब्द (जैसे, "फायरवॉल को कैसे बायपास करें") अक्सर उन्हीं शब्दों के समान होते हैं जिनका उपयोग हैकर्स करते हैं।

  • द गार्ड इतना सावधान है कि वह अक्सर सुरक्षा टीम की मदद करने से इनकार कर देता है क्योंकि उनके प्रश्न एक हैकर की योजना की तरह लगते हैं। वह सोचता है, "यह खतरनाक लग रहा है, इसलिए मैं 'ना' कहूँगा।"
  • द अन unfiltered जुड़वा भाई के पास ऐसी हिचकिचाहट नहीं है। वह प्रश्न का उत्तर देता है।

शोधकर्ताओं ने जो बड़ा सवाल पूछा था, वह था: क्या "सुरक्षा" का नियम वास्तव में मदद करता है, या क्या यह वैध प्रश्नों का उत्तर देने से इनकार करके सुरक्षा टीम के काम को कठिन बना देता है?

प्रयोग: एक ही परिवार, अलग नियम

यह सुनिश्चित करने के लिए कि वे सेब की तुलना सेब से कर रहे हैं (समान चीजों की तुलना कर रहे हैं), शोधकर्ताओं ने केवल दो यादृच्छिक (रैंडम) AI मॉडल नहीं चुने। उन्होंने एक विशिष्ट AI परिवार (जैसे Gemma परिवार और Qwen परिवार) को लिया और मूल, सुरक्षा-ट्यून किए गए संस्करण की तुलना उस संस्करण से की जहाँ "इनकार" वाले हिस्से को बंद कर दिया गया था।

उन्होंने उन्हें कार्यों की एक सीढ़ी पर परखा, जो ऊपर जाते समय कठिन होते गए:

  1. बग को पहचानना: "क्या यह कोड खतरनाक है?"
  2. बग को नाम देना: "यह किस प्रकार का बग है?"
  3. लाइन ढूँढना: "ठीक कौन सी लाइन टूटी हुई है?"
  4. इसे ठीक करना: "एक ऐसा पैच लिखें जो वास्तव में कंपाइल हो और काम करे।"

उन्होंने क्या पाया

1. "इनकार" का मिथक
शोधकर्ताओं ने पाया कि "द गार्ड" जुड़वा भाई बहुत कम बार इनकार करता था। दोनों जुड़वा भाई आमतौर पर उत्तर देते थे। तो, समस्या यह नहीं थी कि गार्ड "ना" कह रहा था। समस्या यह थी कि जब वह "हाँ" कहता था, तो वह कैसे उत्तर देता था।

2. "न्यूट्रल" बनाम "सिक्योरिटी" भाषा का जाल
यही वह जगह है जहाँ यह दिलचस्प हो जाता है।

  • जब प्रश्न साधारण, उबाऊ भाषा में पूछा गया था (जैसे, "कृपया त्रुटियों के लिए इस कोड की समीक्षा करें"), तो द गार्ड अक्सर सरल कार्यों जैसे बग को पहचानने में थोड़ा बेहतर था।
  • जब प्रश्न में पेशेवर सुरक्षा शब्दावली (जार्गन) का उपयोग किया गया था (जैसे, "एनालाइज दिस एक्सप्लॉइट वेक्टर फॉर अटैकर-कंट्रोल्ड इनपुट"), तो द गार्ड लड़खड़ाने लगा। वह भ्रमित हो गया, अस्पष्ट उत्तर दिए, या इनकार कर दिया। द अनफिल्टर्ड जुड़वा भाई, हालांकि, केंद्रित रहा और बहुत बेहतर उत्तर दिए, विशेष रूप से टूटी हुई सटीक लाइन को खोजने के मामले में।

3. "फिक्स-इट" (ठीक करने वाला) परीक्षण
सबसे महत्वपूर्ण परीक्षण यह था: "क्या आप एक ऐसा फिक्स लिख सकते हैं जो वास्तव में काम करे?"

  • Java प्रोग्रामिंग भाषा में, जब प्रश्नों में पेशेवर सुरक्षा शब्दों का उपयोग किया गया, तो द अनफिल्टर्ड जुड़वा भाई एक सुपरस्टार था। उसने ऐसे फिक्स तैयार किए जो लगभग 67% बार कंपाइल और टेस्ट किए जा सकते थे, जबकि द गार्ड केवल लगभग 30% बार ही ऐसा कर पाया।
  • हालाँकि, Python और C++ में साधारण, न्यूट्रल प्रश्नों के साथ, द गार्ड वास्तव में अंतिम चरण में फिक्स को काम करने लायक बनाने में थोड़ा बेहतर प्रदर्शन कर रहा था।

4. "ड्रिफ्ट" (विचलन) प्रभाव
अध्ययन में यह भी पाया गया कि द गार्ड अस्थिर था। यदि आप उससे एक ही प्रश्न पूछते लेकिन कुछ शब्दों को बदलकर उसे अधिक "सुरक्षा-जैसा" बना देते, तो वह आपको पूरी तरह से अलग उत्तर दे सकता था या किसी अलग लाइन की ओर इशारा कर सकता था। द अनफिल्टर्ड जुड़वा भाई बहुत अधिक सुसंगत था; वह प्रश्न को कैसे भी प्रस्तुत किया जाए, एक ही अच्छा उत्तर देता था।

निष्कर्ष (टेकअवे)

पेपर यह निष्कर्ष निकालता है कि AI में सुरक्षा नियम एक दोधारी तलवार हैं।

  • अच्छा: वे AI को हैकर्स की मदद करने से रोकते हैं।
  • बुरा: वे कभी-कभी AI को इतना डरा देते हैं कि वह उन लोगों (रक्षकों) की मदद करने के लिए बहुत अधिक झिझकता है जो अपना काम करने के लिए आवश्यक तकनीकी भाषा का उपयोग करते हैं।

शोधकर्ता सुझाव देते हैं कि हमें AI सुरक्षा को केवल इस आधार पर नहीं मापना चाहिए कि वह कितनी बार "ना" कहता है। हमें यह भी मापना चाहिए कि जब वह "हाँ" कहता है, तो क्या वह सही, उपयोगी और स्थिर उत्तर देता है।

संक्षेप में: वास्तव में सुरक्षित होने के लिए, एक AI को यह समझने के लिए पर्याप्त स्मार्ट होना चाहिए कि एक हैकर जो अंदर घुसने की कोशिश कर रहा है और एक सुरक्षा विशेषज्ञ जो ताला ठीक करने की कोशिश कर रहा है, के बीच क्या अंतर है, भले ही वे एक ही शब्दावली का उपयोग कर रहे हों। वर्तमान में, "द गार्ड" AI शब्दावली से बहुत डर जाता है, जबकि "द अनफिल्टर्ड" AI वास्तविक काम करने में बेहतर है, बशर्ते हम इस बात पर भरोसा कर सकें कि वह बुरे लोगों की मदद नहीं करेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →