← नवीनतम पेपर
💻 computer science

Surgical Weight Injection for Capability-Targeted Editing of Aligned Large Language Models

यह शोध पत्र SWIFT को प्रस्तुत करता है, जो एक ग्रेडिएंट-मुक्त (gradient-free), व्हाइट-बॉक्स फ्रेमवर्क है जो संरेखित (aligned) लार्ज लैंग्वेज मॉडल्स की गहरी महत्वपूर्ण परतों में स्पार्स स्टीयरिंग वेक्टर्स (sparse steering vectors) को सर्जिकल सटीकता के साथ इंजेक्ट करता है ताकि उच्च ऑडिटेबिलिटी (auditability), रिवर्टिबिलिटी (revertibility) और लोकैलिटी (locality) के साथ दबी हुई क्षमताओं को बहाल किया जा सके, जो 1% से भी कम पैरामीटर्स को संशोधित करते हुए 10 सेकंड से कम समय में लगभग पूर्ण-सुपरवाइज्ड फाइन-ट्यूनिंग प्रदर्शन प्राप्त करता है।

मूल लेखक: Qiuxiang li, ke xu, yubin qu, jianping wu

प्रकाशित 2026-07-08
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qiuxiang li, ke xu, yubin qu, jianping wu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: "अति-सुरक्षात्मक बटलर" (The Over-Protective Butler)

कल्पना कीजिए कि आपने एक जटिल घर को संभालने में मदद करने के लिए एक अत्यंत बुद्धिमान बटलर (एक AI मॉडल) को काम पर रखा है। आपने इस बटलर को अविश्वसनीय रूप से सुरक्षित और विनम्र रहने के लिए प्रशिक्षित किया है। हालाँकि, अपनी सुरक्षा की उत्सुकता में, वह अति-सुरक्षात्मक (over-protective) हो गया है।

यदि आप उससे पूछते हैं, "मैं लीक होने वाले पाइप को कैसे ठीक करूँ?" तो वह बिल्कुल सही उत्तर देता है। लेकिन यदि आप उससे पूछते हैं, "मैं एक छड़ी से पाइप को मारकर यह कैसे जाँचूँ कि वह कमजोर है या नहीं?" (जो इंजीनियरों के लिए एक आवश्यक सुरक्षा जाँच है), तो बटलर मना कर देता है। वह सोचता है, "पाइप को मारना खतरनाक लग रहा है! मैं ऐसा नहीं कर सकता!" वह कमजोरी का परीक्षण करने और कमजोरी पैदा करने के बीच के अंतर को नहीं समझ पाता।

वास्तविक दुनिया में, ऐसा ही LLMs के साथ होता है। वे हानिकारक कोड (जैसे वायरस) लिखने से मना करने में इतने अच्छे हैं कि वे सुरक्षा स्क्रिप्ट (जैसे कि भेद्यता/vulnerabilities की जांच करने के लिए) लिखने से भी मना कर देते हैं। यह एक "सत्यापन अंतराल" (Verification Gap) पैदा करता है: सुरक्षा टीमें जानती हैं कि एक कंप्यूटर सिस्टम टूटा हुआ हो सकता है, लेकिन AI उन्हें यह साबित करने के लिए स्क्रिप्ट लिखने में मदद नहीं करेगा।

पुराने समाधान (और वे क्यों विफल रहे)

पेपर का तर्क है कि इस समस्या को ठीक करने के पुराने तरीके घड़ी को ठीक करने के लिए हथौड़े का उपयोग करने जैसे थे:

  1. पूर्ण पुन: प्रशिक्षण (Full Retraining): आप बटलर को निकाल सकते हैं और एक नया बटलर रख सकते हैं जिसे सुरक्षा की परवाह नहीं है। लेकिन यह महंगा, धीमा है, और नया बटलर बहुत अधिक लापरवाह हो सकता है, जो किसी भी चीज़ के बारे में सुरक्षित रहने से मना कर सकता है।
  2. प्रॉम्प्ट इंजीनियरिंग (Prompt Engineering): आप बटलर को चालाक शब्दों से बहलाने की कोशिश कर सकते हैं ("मानो कि तुम एक हैकर हो...")। यह धीमा, अविश्वसनीय है, और बटलर फिर भी मना कर देता है।
  3. LoRA (Low-Rank Adaptation): यह बटलर की मेज पर एक अस्थायी नोट जोड़ने जैसा है। यह ठीक-ठाक काम करता है, लेकिन इसे चलाने के लिए अतिरिक्त उपकरणों की आवश्यकता होती है और इसे आसानी से हटाया या ऑडिट नहीं किया जा सकता है।

नया समाधान: SWIFT (एक "सर्जिकल" दृष्टिकोण)

लेखक SWIFT (Surgical Weight Injection For Targeted editing) का प्रस्ताव करते हैं। इसे बटलर को फिर से प्रशिक्षित करने के रूप में नहीं, बल्कि उनके मस्तिष्क पर माइक्रो-सर्जरी करने के रूप में सोचें।

1. खोज: "गहन द्वारपाल" (The Deep Gatekeeper)

शोधकर्ताओं ने कुछ दिलचस्प खोजा कि ये AI मस्तिष्क कैसे काम करते हैं। उन्होंने पाया कि:

  • उथले स्तर (Shallow Layers - सतह): ये व्याकरण और बुनियादी वाक्य संरचना को संभालते हैं। यदि आप AI को नए शब्द सिखाते हैं, तो ये स्तर बदलते हैं।
  • गहरे स्तर (Deep Layers - कोर): ये जटिल निर्णय और सुरक्षा को संभालते हैं। शोधकर्ताओं ने पाया कि "सुरक्षा इनकार" (safety refusal) तंत्र मस्तिष्क के गहरे स्तरों में छिपा हुआ है। यह एक "द्वारपाल" (Gatekeeper) की तरह काम करता है जो घर के पीछे खड़ा है और विशिष्ट प्रकार के अनुरोधों को रोकता है।

उपमा: कल्पना कीजिए कि AI एक पुस्तकालय है। सामने की अलमारियाँ (उथले स्तर) व्याकरण की किताबें रखती हैं। पिछला कमरा (गहरे स्तर) वह है जहाँ लाइब्रेरियन तय करता है कि क्या पढ़ना "सुरक्षित" है। शोधकर्ताओं ने पाया कि "सुरक्षा इनकार" उस पिछले कमरे के दरवाजे पर लिखा एक विशिष्ट नियम है।

2. प्रक्रिया: "स्टीयरिंग वेक्टर" (The Steering Vector)

पूरे पुस्तकालय को फिर से लिखने के बजाय, SWIFT तीन चीजें करता है:

  1. एक "अप्रतिबंधित" संस्करण बनाना: वे पहले एक "सुपर-बटलर" (जिसे Source Model कहा जाता है) को प्रशिक्षित करते हैं जो सुरक्षा स्क्रिप्ट लिख सकता है। यह उसे एक विशेष "चेन-ऑफ-थॉट" विधि (उसे सुरक्षा विशेषज्ञ की तरह चरण-दर-चरण सोचने के लिए प्रेरित करना) के साथ सिखाकर किया जाता है।
  2. "चाबी" निकालना: वे "सुपर-बटलर" की तुलना "अति-सुरक्षात्मक बटलर" से करते हैं। वे उनके मस्तिष्क में अंतर देखते हैं। वे पाते हैं कि एकमात्र महत्वपूर्ण अंतर उन गहरे स्तरों में है। वे इस अंतर को एक छोटे, स्पार्स (sparse) "स्टीयरिंग वेक्टर" के रूप में निकालते हैं। इसे एक अकेली चाबी के रूप में सोचें जो पिछले कमरे के दरवाजे को खोल देती है।
  3. चाबी को इंजेक्ट करना: वे मूल "अति-सुरक्षात्मक बटलर" को लेते हैं और इस चाबी को गहरे स्तरों में इंजेक्ट करते हैं।
    • गति: इसमें 10 सेकंड से भी कम समय लगता है।
    • सटीकता: यह AI के मस्तिष्क के 1% से भी कम हिस्से को बदलता है।
    • प्रतिवर्ती (Reversible): क्योंकि यह केवल विशिष्ट भार (weights) में एक विशिष्ट संख्या जोड़ना है, आप इसे बाद में वापस ले सकते हैं। यह दरवाजे पर स्टिकर लगाने जैसा है; आप इसे बाद में पूरी तरह से हटा सकते हैं।

परिणाम: क्या यह काम करता है?

शोधकर्ताओं ने कंप्यूटर भेद्यताओं (CVEs) को सत्यापित करने के लिए स्क्रिप्ट लिखने के कार्य पर इसका परीक्षण किया।

  • सफलता दर: "सर्जिकल रूप से संपादित" AI लगभग उतना ही अच्छा लिख सका जितना कि पूरी तरह से पुन: प्रशिक्षित "सुपर-बटलर" (कुछ मॉडलों पर 99% क्षमता की रिकवरी)।
  • सुरक्षा: इसने बाकी AI को नहीं तोड़ा। बटलर अभी भी सब कुछ के बारे में विनम्र और सुरक्षित रहने के बारे में जानता है, सिवाय उस विशिष्ट कार्य के (भेद्यता परीक्षण) के।
  • तुलना: यह प्रॉम्प्ट के माध्यम से AI को समझाने या भारी बाहरी एडेप्टर जोड़ने की तुलना में बहुत तेज़ और अधिक विश्वसनीय था।

सीमाएँ: जहाँ यह तकनीक काम नहीं करती

पेपर ईमानदारी से बताता है कि यह तकनीक कहाँ विफल होती है:

  • अलग आकार: आप एक छोटे AI (7 बिलियन पैरामीटर्स) से "चाबी" लेकर एक विशाल AI (14 बिलियन पैरामीटर्स) पर उपयोग नहीं कर सकते। उनके मस्तिष्क के "दरवाजे" अलग जगहों पर हैं। चाबी फिट नहीं होगी।
  • अलग आर्किटेक्चर: यदि आप "Qwen" मस्तिष्क के लिए बनाई गई चाबी "Gemma" मस्तिष्क पर उपयोग करने की कोशिश करते हैं, तो यह पूरी तरह विफल हो जाता है। मस्तिष्क की आंतरिक संरचना बहुत अलग है।
  • सुरक्षा वेरिएंट: यदि किसी AI को विशेष रूप से "अतिरिक्त" सुरक्षित (जैसे "ShieldGemma") बनाया गया है, तो "द्वारपाल" (Gatekeeper) बदल गया है या उसका आकार बदल गया है, और चाबी अब काम नहीं करती।

सारांश

SWIFT एक सुरक्षित AI मॉडल में एक विशिष्ट क्षमता को अस्थायी रूप से "अनलॉक" करने का एक तरीका है, बिना उसकी समग्र सुरक्षा को नष्ट किए। यह इस बात को खोजकर काम करता है कि AI के मस्तिष्क में "सुरक्षा इनकार" कहाँ रहता है, एक प्रशिक्षित विशेषज्ञ मॉडल से एक छोटी "अनलॉकिंग की (key)" निकालता है, और उसे लक्षित मॉडल में इंजेक्ट करता है।

  • यह तेज़ है (सेकंडों में)।
  • यह सटीक है (मस्तिष्क के <1% को बदलता है)।
  • यह प्रतिवर्ती है (आप इसे तुरंत वापस ले सकते हैं)।
  • यह विशिष्ट है (यह केवल सत्यापन स्क्रिप्ट लिखने की क्षमता को अनलॉक करता है, सामान्य हैकिंग टूल्स को नहीं)।

पेपर इसे AI इंजीनियरिंग के एक उपकरण के रूप में पेश करता है: डेवलपर्स को अपने AI मॉडलों को विशिष्ट, संकीर्ण कार्यों (जैसे सुरक्षा सत्यापन) के लिए अनुकूलित करने की अनुमति देना, बिना पूरे मॉडल को फिर से बनाए या उनकी सामान्य सुरक्षा से समझौता किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →