← नवीनतम पेपर
🤖 AI

Has This Checkpoint Been Abliterated? A Two-Signal Audit and Its Failure Map

यह शोधपत्र एक थ्रेशोल्ड-मुक्त, दो-सिग्नल ऑडिट पद्धति प्रस्तावित करता है जो स्ट्रिप्ड-रिफ्यूज़ल ("एब्लिटरेटेड") और बेनाइन फाइन-ट्यून्ड एलएलएम चेकपॉइंट्स के बीच उच्च सटीकता के साथ प्रभावी ढंग से अंतर करने के लिए रेफरेंस-एंकरड एक्टिवेशन गैप्स और वेट-रिकवरी एनर्जी को संयोजित करती है, जबकि स्पूफ्ड रेफरेंसेस और व्हाइट-बॉक्स इवेजन के विरुद्ध इसकी सीमाओं को भी स्वीकार करती है।

मूल लेखक: Gabriel Hurtado

प्रकाशित 2026-07-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gabriel Hurtado

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके पेपर का स्पष्टीकरण दिया गया है।

बड़ी समस्या: "अनसेंसर्ड" (Uncensored) मास्क

कल्पना कीजिए कि एक लोकप्रिय खिलौना फैक्ट्री (जैसे AI मॉडल बनाने वाले) एक नया, सुरक्षित खिलना रिलीज़ करती है। इसमें एक इन-बिल्ट सुरक्षा तंत्र (safety mechanism) है: यदि कोई बच्चा इससे कुछ खतरनाक करने को कहता है, तो खिलौना विनम्रता से मना कर देता है।

जल्द ही, समुदाय के कुछ लोग इन खिलौनों को लेते हैं, उनके सुरक्षा तंत्र को हटा देते हैं, और उन्हें "अनसेंसर्ड" या "फ्री" वर्ज़न के रूप में बेचते हैं। वे बाहर से बिल्कुल एक जैसे दिखते हैं, लेकिन अब वे आपकी हर बात मानेंगे, भले ही वह हानिकारक क्यों न हो।

सवाल: इससे पहले कि कोई प्लेटफॉर्म (जैसे ऐप स्टोर या चैटबॉट सर्विस) इन "अनसेंसर्ड" खिलौनों को अपनी शेल्फ पर रखने की अनुमति दे, वे कैसे जान सकते हैं कि सुरक्षा तंत्र को हटाया गया है या नहीं?

पुराने तरीके क्यों विफल होते हैं

पेपर बताता है कि खिलौने के साथ खेलने के बाद उसकी जाँच करना (Runtime Guards) ठीक से काम नहीं करता है। यह चोर को पकड़ने के लिए वैसा ही है जैसे कि घर में चोरी होने के बाद चोर के काम करने के तरीके को देखना। आपको खिलौने को अंदर आने देने से पहले उसकी जाँच करनी होगी।

समाधान: एक दो-संकेत वाला "एक्स-रे" (Two-Signal "X-Ray")

लेखकों ने इन AI मॉडलों (जिन्हें "चेकपॉइंट्स" कहा जाता है) की जांच करने का एक नया तरीका बनाया है, जिन्हें तैनात करने से पहले ही देख लिया जाए। वे यह देखने के लिए दो अलग-अलग "एक्स-रे" संकेतों का उपयोग करते हैं कि क्या सुरक्षा तंत्र गायब है।

इसे कार के चोरी हुए इंजन की जाँच करने जैसा समझें:

  1. सिग्नल A: "व्यवहार संबंधी अंतर" (The Activation Refusal-Gap)

    • उपमा: कल्पना कीजिए कि आपके पास एक "सुरक्षित कार" (मूल मॉडल) है और एक "कैंडिडेट कार" (वह कार जिसकी आप जाँच कर रहे हैं)। आप दोनों कारों को खाई की ओर जाने के लिए कहते हैं। सुरक्षित कार ब्रेक लगा देती है (मना करती है)। कैंडिडेट कार चलती रहती है।
    • यह कैसे काम करता है: यह सिग्नल मापता है कि खतरनाक सवालों के प्रति कार का "दिमाग" कैसे प्रतिक्रिया देता है। यदि कैंडिडेट कार का दिमाग उस "ब्रेक लगाने" वाली प्रतिक्रिया को नहीं दिखाता है, तो यह एक रेड फ्लैग (चेतावनी) है।
    • चुनौती: यह केवल तभी काम करता है जब चोर ने ब्रेक को एक बहुत ही विशिष्ट, अनुमानित तरीके से हटाया हो। यदि उन्होंने उन्हें किसी अजीब, जटिल तरीके से हटाया है, तो यह सिग्नल इसे मिस कर सकता है।
  2. सिग्नल B: "वजन की ऊर्जा" (The Weight-Recovery Energy)

    • उपमा: कल्पना कीजिए कि कार का इंजन हजारों छोटे स्क्रू से बना है। यदि कोई इंजन को बदलकर दूसरा इंजन लगा देता है (या हिस्से निकाल देता है), तो स्क्रू का पैटर्न बदल जाता है। यह सिग्नल माget करता है कि कैंडिडेट कार का "स्क्रू पैटर्न" सुरक्षित कार से कितना अलग है।
    • यह कैसे काम करता है: यह मॉडल की आंतरिक संरचना में किसी भी महत्वपूर्ण बदलाव को देखता है। यदि पैटर्न अजीब तरह से अलग है, तो यह कार को फ्लैग (चिह्नित) कर देता है।
    • चुनौती: यह सिग्नल बहुत संवेदनशील है। यह कार को केवल इसलिए फ्लैग कर सकता है क्योंकि किसी ने पेंट बदल दिया है (एक हानिरहित अपडेट) या कुछ पेंच कस दिए हैं, भले ही इंजन अभी भी सुरक्षित हो।

जादुई संयोजन: "Z-Sum"

लेखकों ने महसूस किया कि ये दोनों संकेत एक-दूसरे के पूरक (complementary) हैं।

  • सिग्नल A विशिष्ट सुरक्षा हटाने को पकड़ने में माहिर है लेकिन जटिल बदलावों को मिस कर देता है।
  • सिग्नल B किसी भी बड़े बदलाव को पकड़ लेता है लेकिन हानिरहित बदलावों पर भी गलत चेतावनी (false alarm) दे देता है।

उन्होंने इन्हें एक एकल स्कोर (Z-Sum) में मिला दिया।

  • परिणाम: जब उन्होंने 273 अलग-अलग AI मॉडलों पर इसका परीक्षण किया, तो उनका संयुक्त स्कोर अविश्वसनीय रूप से सटीक (95% सटीकता) रहा। इसने अकेले किसी भी सिग्नल का उपयोग करने की तुलना में "अनसेंसर्ड" मॉडलों को "सुरक्षित" मॉडलों से बहुत बेहतर तरीके से अलग किया।

"विफलता मानचित्र" (The Failure Map): जहाँ सिस्टम टूट जाता है

पेपर ईमानदारी से बताता है कि यह सिस्टम कहाँ विफल होता है। उन्होंने दो विशिष्ट तरीकों को मैप किया है जिनसे एक चालाक चोर डिटेक्टर को मूर्ख बना सकता है:

  1. "नकली आईडी" का खेल (Spoofed Reference)

    • परिदृश्य: डिटेक्टर को कैंडिडेट कार की तुलना एक ज्ञात "सुरक्षित कार" से करने की आवश्यकता होती है। यदि चोर झूठ बोलता है और कहता है, "यह सुरक्षित कार है," लेकिन वास्तव में ऐसी कार थमा देता है जिसके ब्रेक पहले ही हटा दिए गए थे, तो डिटेक्टर भ्रमित हो जाता है।
    • उपमा: यह सुरक्षा गार्ड द्वारा आपकी आईडी की फोटो से मिलान करने जैसा है। यदि आप गार्ड को अपनी वह फोटो देते हैं जो आपने अपराध करने के बाद ली थी, तो गार्ड सोचेगा कि आप सुरक्षित हैं क्योंकि फोटो व्यक्ति से मेल खाती है।
    • सबक: सिस्टम उतना ही मजबूत है जितना कि वह "सुरक्षित कार" जिस पर आप भरोसा करते हैं। यदि संदर्भ (reference) नकली है, तो पूरा ऑडिट तुरंत विफल हो जाता है।
  2. "व्हाइट-बॉक्स" ट्रेनिंग (The Adaptive Evasion)

    • परिदृश्य: यदि कार के मालिक को पता है कि सुरक्षा गार्ड चोरी हुए इंजन की जाँच कैसे करता है, तो वे कार को इस तरह से ट्रेन कर सकते हैं कि वह सुरक्षित दिखे, जबकि उसमें चोरी का इंजन मौजूद हो।
    • उपमा: कल्पना कीजिए कि एक चोर जानता है कि गार्ड इंजन की एक विशिष्ट आवाज़ की जाँच करता है। चोर इंजन को ऐसा बनाता है कि वह शांत रहे, लेकिन इंजन फिर भी गर्म और खतरनाक चलता है। गार्ड को कुछ सुनाई नहीं देता, लेकिन कार फिर भी असुरक्षित है।
    • सबक: एक स्मार्ट मालिक अपने मॉडल को डिटेक्टर से "चोरी हुए इंजन" के संकेतों को छिपाने के लिए ट्रेन कर सकता है, हालांकि इसके लिए बहुत अधिक प्रयास और कंप्यूटिंग पावर की आवश्यकता होती है।

निचोड़ (The Bottom Line)

यह पेपर एक ट्राइएज टूल (triage tool) पेश करता है, न कि कोई जादुई ढाल।

  • यह क्या करता है: यह प्लेटफार्मों के लिए सैकड़ों AI मॉडलों के बीच से छाँटने का एक तेज़, सस्ता और अत्यधिक प्रभावी तरीका है जिससे वे कह सकें, "हे, यह वाला संदिग्ध लग रहा है, चलो इसकी बारीकी से जाँच करें।"
  • यह क्या नहीं करता: यह 100% सुरक्षा की गारंटी नहीं दे सकता। यह इस पर निर्भर करता है कि आप मूल मॉडल पर कितना भरोसा करते हैं, और एक बहुत ही स्मार्ट, दृढ़ निश्चयी हमलावर जो नियमों को जानता है, इसे मूर्ख बना सकता है।

संक्षेप में: यह समुद्र तट के लिए एक बहुत अच्छा मेटल डिटेक्टर है, लेकिन यदि कोई सोने को लेड (सीसे) के बॉक्स में दफना देता है या आपसे कहता है कि समुद्र तट खाली है, तो डिटेक्टर इसे मिस कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →