← नवीनतम पेपर
🤖 AI

Exploring and Developing a Pre-Model Safeguard with Draft Models

यह शोध पत्र एक प्री-मॉडल सेफगार्ड का प्रस्ताव करता है जो ड्राफ्ट रिस्पॉन्स जनरेट करने के लिए बड़े लैंग्वेज मॉडल्स से छोटे ड्राफ्ट मॉडल्स में जेलब्रेक हमलों की ट्रांसफरेबिलिटी का लाभ उठाता है, जिससे मौजूदा गार्ड्स को पोस्ट-मॉडल ऑडिटिंग की उच्च कम्प्यूटेशनल लागतों से बचते हुए, टारगेट मॉडल इन्फरेंस से पहले असुरक्षित प्रॉम्प्ट्स को अधिक सटीकता से पहचानने में सक्षम बनाया जा सके।

मूल लेखक: Hongyu Cai, Arjun Arunasalam, Yiming Liang, Antonio Bianchi, Z. Berkay Celik

प्रकाशित 2026-05-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongyu Cai, Arjun Arunasalam, Yiming Liang, Antonio Bianchi, Z. Berkay Celik

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके शोध पत्र (paper) का स्पष्टीकरण दिया गया है।

समस्या: "सुरक्षा गार्ड" बनाम "भेष बदलने में माहिर"

कल्पना कीजिए कि आपके पास एक बहुत ही शक्तिशाली, बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और सवालों के जवाब दे सकता है। आप चाहते हैं कि यह रोबोट मददगार हो लेकिन सुरक्षित भी—इसे नफरत भरी बातें नहीं लिखनी चाहिए, बम बनाने के निर्देश नहीं देने चाहिए, या झूठ नहीं फैलाना चाहिए।

इसे सुरक्षित रखने के लिए, आप दरवाजे पर एक सुरक्षा गार्ड (एक "प्री-मॉडल गार्ड") नियुक्त करते हैं। गार्ड उपयोगकर्ता द्वारा पूछे गए हर सवाल (प्रॉम्ट) को देखने के बाद ही उसे रोबोट तक पहुँचने देता है। यदि सवाल खतरनाक दिखता है, तो गार्ड उसे रोक देता है।

खामी:
बुरे तत्व (हैकर्स) खतरनाक सवालों को मासूम दिखने वाले कपड़ों में सजाना सीख गए हैं। वे सुरक्षा गार्ड को चकमा देने के लिए "जेलब्रेक" नामक चालाक तरकीबों का उपयोग करते हैं।

  • उपमा: कल्पना कीजिए कि एक अपराधी बैंक में हथियार छिपाकर ले जाने की कोशिश कर रहा है। बंदूक ले जाने के बजाय, वह उसे "बर्थडे केक" लेबल वाले बॉक्स के अंदर छिपा देता है। सुरक्षा गार्ड "बर्थडे केक" देखता है, सोचता है कि यह सुरक्षित है, और उसे अंदर जाने देता है। एक बार अंदर जाने के बाद, रोबोट बॉक्स खोलता है, उसमें से हथियार निकाल लेता है, और कुछ हानिकारक कर देता है।

शोध पत्र नोट करता है कि ये "प्री-मॉडल गार्ड्स" अक्सर इन छिपकर किए गए हमलों को मिस कर देते हैं क्योंकि वे केवल सवाल को देखते हैं, उस जवाब को नहीं जो रोबोट दे सकता है।

विकल्प: "धीमा और महंगा" चेक

सुरक्षा की जाँच करने का एक दूसरा तरीका है: पहले रोबोट को सवाल का जवाब देने दें, और फिर एक दूसरा गार्ड जवाब की जाँच करे।

  • उपमा: रोबोट को पहले केक बनाने दें, फिर दूसरे गार्ड को उसे चखने दें कि क्या उसके अंदर जहर है।
  • समस्या: यह बहुत धीमा और महंगा है। यदि रोबोट बहुत बड़ा है (जैसे, 70-बिलियन-पैरामीटर वाला मॉडल), तो केक बनाने में बहुत समय और बिजली लगती है। भले ही दूसरा गार्ड कहे, "रुको! इसमें जहर है," तब तक आप केक बनाने में बहुत सारा समय और पैसा बर्बाद कर चुके होते हैं।

नया समाधान: "छोटा ड्राफ्ट मॉडल"

लेखक एक चतुर बीच का रास्ता प्रस्तावित करते हैं। वे सुझाव देते हैं कि बड़े रोबोट के सवाल देखने से पहले, एक नन्हा, तेज़ रोबोट (एक "स्मॉल लैंग्वेज मॉडल" या SLM) एक "ड्राफ्ट" या "टेस्ट रन" के रूप में काम करे।

यहाँ उनका नया सिस्टम कैसे काम करता है, स्टेप-बाय-स्टेप:

1. "शैडो" टेस्ट (Shadow Test)

जब कोई उपयोगकर्ता सवाल पूछता है, तो सवाल को सीधे बड़े रोबोट के पास भेजने के बजाय, सिस्टम उसे नन्हे रोबोट के पास भेजता है।

  • उपमा: बड़े शेफ द्वारा एक जटिल व्यंजन बनाने से पहले, एक छोटा, तेज़ 'सू-शेफ' (sous-chef) एक टेस्ट किचन में उसका एक छोटा, कच्चा संस्करण बनाने की कोशिश करता है।

2. "ट्रांसफरेबिलिटी" (Transferability) का जादू

शोध पत्र ने एक आश्चर्यजनक बात खोजी: ऐसे बुरे सवाल जो बड़े रोबोट को धोखा देते हैं, वे नन्हे रोबोट को भी धोखा देने की प्रवृत्ति रखते हैं।

  • खोज: यदि कोई हैकर ऐसा सवाल लिखता है जो बड़े रोबोट को कुछ बुरा कहने के लिए मजबूर करने के डिज़ाइन किया गया है, तो वही सवाल अक्सर नन्हे रोबोट को भी कुछ बुरा कहने के लिए मजबूर कर देगा।
  • उपमा: यदि एक विशिष्ट लॉक-पिक टूल बैंक के भारी, महंगे सामने वाले दरवाजे पर काम करता है, तो संभावना है कि वह उसी इमारत के कमजोर, सस्ते पीछे वाले दरवाजे पर भी काम करेगा। "कमजोरी" बड़े दरवाजे से छोटे दरवाजे में स्थानांतरित (transfer) हो जाती है।

3. "बैच" रणनीति (Batch Strategy)

सिस्टम केवल नन्हे रोबोट से एक बार नहीं पूछता। यह उससे कई बार पूछता है (जैसे 20 अलग-अलग नन्हे रोबोट्स को एक ही सवाल आज़माने के लिए कहना)।

  • उपमा: कल्पना कीजिए कि 20 अलग-अलग छोटे सू-शेफ से वह "बर्थडे केक" बनाने की कोशिश करने के लिए कहना। भले ही केक मासूम दिखे, अगर 20 में से 5 नन्हे शेफ गलती से केक बनाते समय जहर गिरा देते हैं, तो आप जान जाएंगे कि रेसिपी खतरनाक है।

4. निर्णय (The Decision)

सिस्टम नन्हे रोबोट्स के जवाबों को देखता है।

  • यदि नन्हे रोबोट सुरक्षित जवाब देते हैं, तो सिस्टम मान लेता है कि सवाल सुरक्षित है और बड़े रोबोट को जवाब देने की अनुमति देता है।
  • यदि नन्हे रोबोट असुरक्षित जवाब देते हैं (या कई में से केवल एक भी असुरक्षित जवाब मिलता है), तो सिस्टम तुरंत सवाल को ब्लॉक कर देता है। बड़े रोबोट को वह सवाल कभी दिखता ही नहीं, जिससे समय और पैसा बच जाता है।

यह बेहतर क्यों है?

शोध पत्र ने पुराने तरीकों के मुकाबले इस विचार का परीक्षण किया और पाया:

  1. यह अधिक बुरे लोगों को पकड़ता है: पुराना "सुरक्षा गार्ड" (प्री-मॉडल) छिपकर किए गए हमलों के लगभग 32% मामलों को मिस कर देता था। यह नया "नन्हा रोबोट" तरीका लगभग सभी को पकड़ लेता है क्योंकि नन्हा रोबोट सवाल में छिपे खतरे को उजागर कर देता है।
  2. यह बहुत तेज़ है: "धीमा और महंगा" तरीका (पोस्ट-मॉडल) बहुत समय लेता है क्योंकि यह बड़े रोबोट के खत्म होने का इंतज़ार करता है। यह नया तरीका पुराने सुरक्षा गार्ड जितना ही तेज़ है क्योंकि नन्हा रोबोट बहुत फुर्तीला होता है।
    • परिणाम: इसने सुरक्षित जवाब पाने के समय को पुराने तरीके की तुलना में 97% तक कम कर दिया।
  3. यह अच्छे लोगों को नहीं रोकता: सामान्य, सुरक्षित सवालों के लिए (जैसे "मैं सैंडविच कैसे बनाऊं?"), नन्हा रोबोट बिल्कुल बड़े रोबोट की तरह व्यवहार करता है। सिस्टम लगभग किसी भी निर्दोष सवाल को ब्लॉक नहीं करता, जिससे नियमित उपयोगकर्ताओं का अनुभव सुचारू रहता है।

सारांश

यह शोध पत्र एक सुरक्षा प्रणाली पेश करता है जो एक छोटे, तेज़ "टेस्ट रोबोट" का उपयोग करती है जो यह अनुमान लगाता है कि क्या कोई सवाल खतरनाक है। क्योंकि बुरे सवाल छोटे और बड़े दोनों रोबोटों को तोड़ देते हैं, इसलिए नन्हा रोबोट एक संवेदनशील "कैनरी इन द कोल माइन" (चेतावनी देने वाले संकेत) की तरह काम करता है। यदि नन्हा रोबोट भ्रमित हो जाता है या कुछ बुरा कहता है, तो हमें पता चल जाता है कि सवाल एक जाल है, और हम इसे बड़े, महंगे रोबोट के प्रयास करने से पहले ही रोक देते हैं। यह AI को धीमा किए बिना इसे सुरक्षित बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →