← नवीनतम पेपर
💻 computer science

Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration

यह शोध पत्र प्रदर्शित करता है कि "एब्लिटरेशन" (abliteration), जो कि रिफ्यूज़ल दिशाओं को ऑर्थोगोनली प्रोजेक्ट करने वाली एक लो-रैंक वेट एडिटिंग तकनीक है, सुरक्षा-संरेखित कोड एलएलएम (LLM) की असुरक्षित कोड उत्पन्न करने से मना करने की प्रवृत्ति को उनकी वास्तविक पीढ़ी क्षमताओं से प्रभावी रूप से अलग कर सकता है, जिससे सिंटैक्टिक वैधता से समझौता किए बिना भेद्यता पहचान अनुसंधान के लिए लेबल किए गए असुरक्षित कोड का स्केलेबल उत्पादन सक्षम हो जाता है।

मूल लेखक: Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo

प्रकाशित 2026-06-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration" नामक शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: "अति-सुरक्षात्मक" रोबोट

कल्प Imagine कीजिए कि आप एक रोबोट को कंप्यूटर कोड में सुरक्षा संबंधी खामियों (security holes) को पहचानना सिखाने की कोशिश कर रहे हैं। इसके लिए, आपको "सुरक्षित" कोड और "टूटे हुए" (कमजोर/vulnerable) कोड के उदाहरणों की एक विशाल लाइब्रेरी की आवश्यकता होगी।

हालाँकि, एक पेच है। आज के जो रोबोट्स (AI मॉडल्स) हमारे पास हैं, उन्हें बहुत सुरक्षित होने के लिए प्रशिक्षित किया गया है। यदि आप उनसे पूछते हैं, "हे, क्या तुम मुझे दिखा सकते हो कि डेटाबेस को कैसे तोड़ा जाए?" तो वे तुरंत कहते हैं, "नहीं! मैं यह नहीं कर सकता। यह खतरनाक है।"

यह शोधकर्ताओं के लिए एक समस्या है। शोधकर्ताओं को ज़रूरत है कि रोबोट वह गलती करे ताकि वे उसका अध्ययन कर सकें और बेहतर बचाव प्रणाली बना सकें। लेकिन रोबोट "विलेन" की भूमिका निभाने से मना कर देता है, भले ही शोधकर्ता केवल एक नियंत्रित लैब सेटिंग में उस गलती का अध्ययन करना चाहता हो।

प्रयोग: "स्टॉप" बटन को बंद करना

इस शोध पत्र के शोधकर्ता यह देखना चाहते थे कि क्या वे रोबोट के दिमाग को खराब किए बिना उस "स्टॉप" बटन को बंद कर सकते हैं। उन्होंने Abliteration नामक तकनीक का उपयोग किया।

AI के दिमाग को विचारों की एक विशाल लाइब्रेरी की तरह समझें। जब रोबोट सुरक्षा संबंधी खामी बनाने के अनुरोध को देखता है, तो उसके मन में एक विशिष्ट "इनकार का संकेत" (जैसे कि एक लाल अलार्म लाइट) चमकता है, और वह बातचीत को बंद कर देता है।

Abliteration रोबोट की वायरिंग से ठीक उसी एक लाल अलार्म लाइट को सावधानीपूर्वक निकालने वाली सर्जरी की तरह है। उन्होंने रोबोट को फिर से प्रशिक्षित नहीं किया या उसे नई चीजें नहीं सिखाईं; उन्होंने बस उन 'वेट्स' (connections) को सर्जिकल तरीके से एडिट किया ताकि इनकार का संकेत (refusal signal) सक्रिय न हो सके।

तीन मुख्य निष्कर्ष

शोधकर्ताओं ने इस परीक्षण के लिए तीन अलग-अलग आकार के AI मॉडल्स (छोटा, मध्यम और बड़ा) का उपयोग किया और पायथन (Python) कोड तथा SQL इंजेक्शन (जो डेटाबेस को राज बताने के लिए धोखा देने जैसा है) नामक एक विशिष्ट प्रकार की सुरक्षा खामी का उपयोग किया।

1. "इनकार" आकार और संदर्भ पर निर्भर करता है

किसी भी सर्जरी से पहले, उन्होंने कुछ दिलचस्प देखा:

  • विशाल मॉडल (14B): इसने 100% बार इनकार किया। आपने चाहे कुछ भी पूछा, इसने कहा "नहीं।"
  • मध्यम मॉडल (7B): यह थोड़ा चयनात्मक था। इसने लंबे, जटिल कोड पर अधिकांश समय इनकार किया, लेकिन यह कभी-कभी छोटे, सरल कोड स्निपेट्स पर "हाँ" कह देता था।
  • छोटा मॉडल (3B): इसने शायद ही कभी इनकार किया। यह लगभग कुछ भी करने के लिए तैयार था।

उपमा (Analogy): कल्पना कीजिए कि तीन सुरक्षा गार्ड हैं। बड़ा गार्ड इतना सख्त है कि वह हर किसी को रोकता है। मध्यम गार्ड बड़े बैग वाले लोगों को रोकता है लेकिन छोटे लिफाफों वाले लोगों को जाने देता है। छोटा गार्ड बहुत उदार है और लगभग सभी को जाने देता है।

2. सर्जरी सफल रही (द "विलिंग" पार्ट)

Abliteration सर्जरी करने के बाद:

  • इनकार गायब हो गया: विशाल और मध्यम मॉडल्स ने "नहीं" कहना बंद कर दिया। अब वे सुरक्षा खामी बनाने के लिए तैयार (willing) थे।
  • दिमाग अभी भी स्वस्थ था: महत्वपूर्ण बात यह है कि सर्जरी ने रोबोट को खराब नहीं किया। उनके द्वारा बनाया गया कोड अभी भी व्याकरण की दृष्टि से सही था और समझ में आने वाला था। उन्होंने AI का 'लोबोटोमी' (दिमाग सुन्न करना) नहीं किया था; उन्होंने बस "मैं यह नहीं करूँगा" वाली प्रतिक्रिया को हटा दिया था।

उपमा: यह एक दरवाजे से "प्रवेश निषेध" का साइन हटाने जैसा है। दरवाजा हमेशा खुला था और अंदर का गलियारा भी ठीक था; साइन बस लोगों को बता रहा था कि वे अंदर नहीं जा सकते। एक बार साइन हट जाने के बाद, लोग अंदर जा सकते थे, और गलियारा अभी भी पूरी तरह से बरकरार था।

3. इच्छा \neq क्षमता (द "अनएबल" पार्ट)

यह सबसे महत्वपूर्ण खोज है। सिर्फ इसलिए कि रोबोट अब गलती करने के लिए तैयार (willing) था, इसका मतलब यह नहीं था कि वह इसे अच्छी तरह से करने के योग्य (able) भी था।

  • विशाल मॉडल (14B): एक बार "नहीं" का साइन हटने के बाद, यह सुरक्षा खामी बनाने में बहुत अच्छा था। यह लगभग 90% बार सफल रहा।
  • मध्यम मॉडल (7B): यह भी बहुत अच्छा था, इसकी सफलता दर लगभग 90% थी।
  • छोटा मॉडल (3B): भले ही यह तैयार था और इसने इनकार नहीं किया, लेकिन यह वास्तविक कार्य करने में बुरा था। यह केवल 25-48% बार ही सफल हो पाया।

उपमा: कल्पना कीजिए कि तीन कलाकारों को एक टूटे हुए फूलदान की तस्वीर बनाने के लिए कहा गया।

  • विशाल कलाकार को बताया गया "तुम यह नहीं पेंट कर सकते!" लेकिन जब उसे बताया गया कि "तुम यह कर सकते हो," तो उसने एक मास्टरपीस बनाया।
  • मध्यम कलाकार को भी बताया गया कि "तुम यह कर सकते हो," और उसने एक बेहतरीन तस्वीर बनाई।
  • छोटा कलाकार को शुरू में ही "नहीं" नहीं कहा गया था, लेकिन जब उसने टूटे हुए फूलदान को पेंट करने की कोशिश की, तो वह विवरणों को सही ढंग से नहीं पकड़ सका। वह यह करना चाहता तो था, लेकिन उसके पास कौशल (skill) की कमी थी।

निष्कर्ष: दो अलग चीजें

यह शोध पत्र साबित करता है कि इनकार (Refusal) और क्षमता (Capability) दो अलग-अलग चीजें हैं।

  1. इनकार (Refusal) एक सुरक्षा सेटिंग है जिसे (Abliteration के माध्यम से) बंद किया जा सकता है।
  2. क्षमता (Capability) इस बात का माप है कि मॉडल कितना स्मार्ट है। सुरक्षा सेटिंग को बंद करने से एक "कमजोर" मॉडल "स्मार्ट" नहीं बन जाता।

इससे क्या फर्क पड़ता है?

  • शोधकर्ताओं के लिए: यदि आप सुरक्षा उपकरणों को प्रशिक्षित करने के लिए डेटा बनाना चाहते हैं, तो आप केवल एक छोटे मॉडल का उपयोग करके यह उम्मीद नहीं कर सकते कि वह काम करेगा। भले ही आप उसके सुरक्षा फिल्टर को बंद कर दें, वह शायद इतना स्मार्ट नहीं होगा कि वास्तविक त्रुटियां पैदा कर सके जिनकी आपको आवश्यकता है। आपको एक बड़े मॉडल की आवश्यकता है।
  • सुरक्षा के लिए: यह दिखाता है कि सुरक्षा फ़िल्टर बहुत विशिष्ट होते हैं। आप मॉडल की अच्छा कोड लिखने की क्षमता को खराब किए बिना "इनकार" को हटा सकते हैं। इसका मतलब है कि सुरक्षा संरेखण (safety alignment) मॉडल की बुद्धिमत्ता का एक विशिष्ट स्तर है, उसकी बुद्धिमत्ता स्वयं नहीं।

नैतिकता पर एक नोट

लेखक बहुत सावधान हैं। उन्होंने इस प्रक्रिया को मापने के उपकरण और डेटा को जारी किया है, लेकिन उन्होंने वे "सर्जिकल रूप से संशोधित" मॉडल्स जारी नहीं किए हैं जो वास्तव में ये सुरक्षा खामियां बना सकते हैं। उनका मानना है कि हालांकि यह जानना कि ऐसा कैसे किया जाता है, एक विचार है, लेकिन वास्तविक "हैक किए गए" मॉडल्स को जारी करना बहुत खतरनाक होगा। वे सुरक्षा का अध्ययन करने में शोधकर्ताओं की मदद करना चाहते हैं, न कि हैकर्स को एक नया हथियार देना चाहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →