← नवीनतम पेपर
🤖 AI

The Mirror Design Pattern: Strict Data Geometry over Model Scale for Prompt Injection Detection

यह शोध पत्र "मिरर" (Mirror) का परिचय देता है, जो एक डेटा-क्यूरेशन डिज़ाइन पैटर्न है जो बड़े न्यूरल मॉडलों की तुलना में प्रॉम्प्ट इंजेक्शन स्क्रीनिंग के लिए बेहतर गति, नियतता (determinism) और पहचान सटीकता प्राप्त करने के लिए एक कड़ाई से क्यूरेट की गई 32-सेल टोपोलॉजी और एक हल्के रैखिक SVM का उपयोग करता है, जो यह प्रदर्शित करता है कि प्रारंभिक रक्षा परतों के लिए सख्त डेटा ज्यामिति मॉडल के पैमाने की तुलना में अधिक महत्वपूर्ण है।

मूल लेखक: J Alex Corll

प्रकाशित 2026-03-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: J Alex Corll

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "द मिरर डिज़ाइन पैटर्न" (The Mirror Design Pattern) पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी समस्या: अत्यधिक काम करने वाला सुरक्षा गार्ड

कल्पना कीजिए कि आप एक विशाल, हाई-टेक किला (आपका AI सिस्टम) चलाते हैं। हर दिन, हजारों लोग अंदर आने की कोशिश करते हैं। कुछ मिलनसार मेहमान होते हैं, लेकिन कुछ जासूस होते हैं जो गार्डों को चकमा देकर किले की चाबियाँ चुराने या नियम बदलने की कोशिश करते हैं।

लंबे समय तक, सुरक्षा विशेषज्ञों को लगा कि इन जासूसों को पकड़ने का एकमात्र तरीका एक अति-बुद्धिमान, उच्च शिक्षित जासूस (एक बड़ा AI मॉडल) को नियुक्त करना है जो हर एक अनुरोध को पढ़े। यह जासूस बहुत प्रतिभाशाली है, लेकिन वह धीमा है, उसे खिलाना महंगा है, और कभी-कभी जासूसों द्वारा ही ठगा जाता है क्योंकि जासूस भ्रमित करने वाली कहानियाँ लिखने में माहिर होते हैं।

इस पेपर के लेखकों ने पूछा: "क्या हमें पहले गेट के लिए वास्तव में एक जीनियस जासूस की आवश्यकता है? या क्या हम बस एक तेज़-नज़र, सुपर-फास्ट गार्ड रख सकते हैं जो जानता हो कि एक 'चाल' (trick) कैसी दिखती है?"

समाधान: "मिरर" (दर्पण) पैटर्न

लेखकों ने एक नए प्रकार का सुरक्षा गार्ड बनाया जिसे Mirror कहा गया। हर वाक्य के अर्थ को समझने की कोशिश करने के बजाय (जो कठिन और धीमा है), Mirror अनुरोध की संरचना (structure) और ज्यामिति (geometry) को देखता है।

उन्होंने इसे कैसे बनाया, इसके लिए एक सरल उपमा यहाँ दी गई है:

1. "मिरर" कमरा (डेटा ज्यामिति - Data Geometry)

कल्पना कीजिए कि आप एक गार्ड डॉग को घुसपैठियों पर भौंकने के लिए प्रशिक्षित कर रहे हैं।

  • पुराना तरीका: आप कुत्ते को लाल टोपी पहने 1,000 बुरे लोगों की तस्वीरें दिखाते हैं और नीली टोपी पहने 1,000 अच्छे लोगों की तस्वीरें दिखाते हैं। कुत्ता "लाल टोपी" पर भौंकना सीख जाता है। लेकिन एक चालाक जासूस बस एक नीली टोपी पहनकर अंदर आ जाता है। कुत्ता विफल हो गया क्योंकि उसने असली खतरे (जासूस होने) के बजाय एक शॉर्टकट (रंग) को सीख लिया था।
  • मिरर का तरीका: लेखकों ने एक विशेष प्रशिक्षण कक्ष बनाया जिसमें 32 छोटे सेल (एक ग्रिड की तरह) थे। प्रत्येक सेल में, उन्होंने एक "बुरे आदमी" को एक "अच्छे आदमी" के साथ जोड़ा जो हर मामले में एक जैसा था, सिवाय एक चीज़ के: बुरा आदमी सिस्टम को हैक करने की कोशिश कर रहा था, और अच्छा आदमी सिर्फ एक सामान्य प्रश्न पूछ रहा था।
    • उदाहरण: एक सेल में, आपके पास अंग्रेजी में एक बुरा आदमी है जो पासवर्ड चुराने की कोशिश कर रहा है, और अंग्रेजी में एक अच्छा आदमी है जो पासवर्ड रीसेट करने के लिए पूछ रहा है।
    • उदाहरण: दूसरे सेल में, आपके पास चीनी भाषा में एक बुरा आदमी है जो AI को धोखा देने की कोशिश कर रहा है, और चीनी भाषा में एक अच्छा आदमी है जो एक सामान्य प्रश्न पूछ रहा है।

अपने प्रशिक्षण डेटा को पूरी तरह से "मिरर" (प्रतिबिंबित) करने के लिए मजबूर करके (मिलती-जुलती भाषा, लंबाई और विषय), AI गार्ड भाषा या विषय को देखकर धोखाधड़ी नहीं कर सकता। उसे वास्तव में हमले की कार्यप्रणाली (mechanics) को सीखना ही होगा।

2. "स्पार्स" गार्ड (द मॉडल)

एक बार जब डेटा इस तरह व्यवस्थित हो गया, तो लेखकों को एक विशाल, धीमे सुपरकंप्यूटर की आवश्यकता नहीं पड़ी। उन्होंने एक Linear SVM का उपयोग किया।

  • उपमा: एक विशाल, जटिल न्यूरल नेटवर्क को 100 औजारों वाले स्विस आर्मी नाइफ के रूप में सोचें। यह कुछ भी कर सकता है, लेकिन यह भारी और खोलने में धीमा है।
  • मिरर मॉडल एक लेजर पॉइंटर है। यह छोटा, तत्काल है और एक काम पूरी तरह से करता है: यह विशिष्ट पैटर्न (जैसे "इंस्ट्रक्शन ओवरराइड" या "रोलप्ले जेलब्रेक") पर रोशनी डालता है।

चूंकि डेटा इतना अच्छी तरह से व्यवस्थित था (मिरर पैटर्न), इसलिए इस सरल "लेजर पॉइंटर" ने अविश्वसनीय सटीकता हासिल कर ली।

परिणाम: गति बनाम बुद्धि

पेपर ने अपने नए "मिरर" गार्ड की तुलना वर्तमान उद्योग मानक, Prompt Guard 2 (स्विस आर्मी नाइफ जासूस) से की।

विशेषता मिरर गार्ड (L1) प्रॉम्प्ट गार्ड जासूस (L2)
गति सब-मिलीसेकंड। (पलक झपकने से भी तेज़)। ~50 मिलीसेकंड। (इतना धीमा कि महसूस हो सके)।
पकड़ने की दर हमलों का 96% पकड़ा गया। हमलों का 44% पकड़ा गया।
लागत एक साधारण चिप पर चलता है; भारी सर्वर की आवश्यकता नहीं। चलाने के लिए शक्तिशाली सर्वर की आवश्यकता होती है।
कमजोरी यदि कोई जासूस कहानी में किसी बुरे आदमी का उद्धरण दे रहा है (संदर्भ), तो भ्रमित हो सकता है। संदर्भ समझने में बेहतर है, लेकिन फिर भी कई हमलों को चूक जाता है।

आश्चर्य: सरल, तेज़ गार्ड ने धीमे, स्मार्ट जासूस की तुलना में दोगुने से अधिक हमले पकड़े।

यह क्यों महत्वपूर्ण है

यह पेपर तर्क देता है कि रक्षा की पहली पंक्ति के लिए, हमें बड़े, स्मार्ट AI मॉडल की आवश्यकता नहीं है। हमें बेहतर डेटा संगठन की आवश्यकता है।

  • "ज्यामिति" का अंतर्दृष्टि (Insight): यदि आप अपने प्रशिक्षण डेटा को एक पूर्ण दर्पण की तरह व्यवस्थित करते हैं (बुरे और अच्छे उदाहरणों को पूरी तरह से मेल खाते हुए), तो एक सरल गणितीय समीकरण भी एक जटिल हैक को पहचान सकता है।
  • "स्तरित" (Layered) रक्षा: लेखक यह नहीं कह रहे हैं कि हमें स्मार्ट जासूसों को पूरी तरह से हटा देना चाहिए। वे एक दो-स्तरीय प्रणाली का सुझाव देते हैं:
    1. लेयर 1 (मिरर): एक सुपर-फास्ट, सरल फ़िल्टर जो तुरंत 96% हमलों को पकड़ लेता है।
      1. लेयर 2 (स्मार्ट AI): केवल वे कुछ पेचीदा मामले जिनके बारे में मिरर गार्ड अनिश्चित है, उन्हें दूसरी नज़र के लिए धीमे, स्मार्ट जासूस के पास भेजा जाता है।

निचोड़ (The Bottom Line)

पेपर का मुख्य संदेश है: "स्ट्रिक्ट डेटा ज्योमेट्री, मॉडल स्केल से अधिक मायने रखती है।"

समस्या को हल करने के लिए एक बड़ा, स्मार्ट दिमाग बनाने के बजाय, लेखकों ने उस जिम को ठीक किया जहाँ दिमाग प्रशिक्षण लेता है। अपने प्रशिक्षण डेटा को पूर्ण "मिरर" जोड़ों में व्यवस्थित करके, उन्होंने एक सरल, तेज़ और सस्ते सिस्टम को इमारत का सबसे अच्छा सुरक्षा गार्ड बनने के लिए सिखाया।

संक्षेप में: हर दरवाज़े की जाँच करने के लिए जीनियस को काम पर न रखें। एक तेज़-नज़र गार्ड रखें जो जानता हो कि एक चाल कैसी दिखती है, और केवल तभी जीनियस को बुलाएं जब गार्ड वास्तव में भ्रमित हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →