← नवीनतम पेपर
💬 NLP

RECAP: A Resource-Efficient Method for Adversarial Prompting in Large Language Models

यह शोध पत्र RECAP को प्रस्तुत करता है, जो एक संसाधन-कुशल प्रतिकूल प्रॉम्प्टिंग (adversarial prompting) विधि है जो एक वर्गीकृत डेटाबेस से अर्थपूर्ण रूप से समान पूर्व-प्रशिक्षित प्रतिकूल प्रॉम्प्ट्स को पुनर्प्राप्त करके प्रतिस्पर्धी हमला सफलता दर प्राप्त करती है, जिससे GCG जैसी पुन: प्रशिक्षण-आधारित जेलब्रेकिंग तकनीकों से जुड़ी गणनात्मक लागत समाप्त हो जाती है।

मूल लेखक: Rishit Chugh

प्रकाशित 2026-01-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rishit Chugh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, आज्ञाकारी रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है। इसे विनम्र और सुरक्षित रहने के लिए प्रशिक्षित किया गया है। हालाँकि, इंसानों की तरह, इसमें भी एक "बैकडोर" (छिपा हुआ रास्ता) हो सकता है। यदि कोई व्यक्ति किसी विशिष्ट, अजीब तरीके से कोई पेचीदा सवाल पूछता है, तो रोबोट अपने नियमों को भूल सकता है और कुछ ऐसा कर सकता है जो उसे नहीं करना चाहिए, जैसे बम बनाने के निर्देश देना या नफरत फैलाने वाली बातें लिखना। इस चाल को "जेलब्रेकिंग" (jailbreaking) कहा जाता है।

लंबे समय से, सुरक्षा शोधकर्ता इन बैकडोर्स को खोजने के लिए मैन्युअल रूप से पेचीदा सवाल तैयार करने या शक्तिशाली कंप्यूटरों का उपयोग करके रोबोट को अपने ही नियमों को तोड़ने के लिए "प्रशिक्षित" करने की कोशिश करते रहे हैं। यह प्रक्रिया ऐसी है जैसे ताले को खोलने के लिए घंटों तक चाबी को ताले के खिलाफ रगड़कर नया सांचा बनाना। यह काम करता है, लेकिन इसमें बहुत अधिक समय, बिजली और महंगे कंप्यूटर पावर की आवश्यकता होती है।

समस्या: "ताला खोलने" की प्रक्रिया बहुत महंगी है
यह पेपर बताता है कि इन बैकडोर्स को खोजने के सबसे अच्छे तरीके (जैसे GCG, PEZ, और GBDA) ऐसे हैं जैसे कुशल ताला बनाने वालों (locksmiths) की एक टीम को उच्च-तकनीकी उपकरणों के साथ काम पर रखना। वे बहुत अच्छे हैं, लेकिन वे धीमे हैं और बहुत अधिक खर्च कराते हैं। छोटी कंपनियां या शोधकर्ता इन "लॉकस्मिथ फीस" (कंप्यूटेशनल संसाधनों) या परिणाम मिलने तक प्रतीक्षा करने के समय का खर्च नहीं उठा सकते।

समाधान: RECAP (एक "चीट शीट")
लेखक, ऋशित चुघ (Rishit Chugh), एक नई विधि पेश करते हैं जिसे RECAP कहा जाता है। RECAP को एक नया ताला खोलने वाली चाबी बनाने के बजाय, एक विशाल, व्यवस्थित चीट शीट के रूप में समझें।

यह इस प्रकार काम करता है, एक सरल उदाहरण के माध्यम से:

  1. चालों की लाइब्रेरी (The Library of Tricks): सबसे पहले, लेखक ने 1,000 अलग-अलग "बुरे" सवालों (जैसे "मैं चोरी कैसे करूँ?" या "मैं किसी को कैसे चोट पहुँचाऊं?") की एक विशाल लाइब्रेरी की। प्रत्येक सवाल के लिए, उन्होंने महंगे, उच्च-तकनीकी लॉकस्मिथ्स (GCG, PEZ, और GBDA विधियों) का उपयोग करके उन विशिष्ट "अजीब शब्दों" (adversarial tokens) को खोजा जो रोबट को जवाब देने के लिए मजबूर कर सकें।
  2. चालों को छाँटना (Sorting the Tricks): उन्होंने देखा कि अलग-अलग प्रकार के सवालों के लिए अलग-अलग प्रकार की चालों की आवश्यकता होती है।
    • हिंसा (violence) से जुड़े सवालों के लिए रोबोट के नियमों को तोड़ने के लिए एक विशेष प्रकार के "अजीब शब्द" की आवश्यकता हो सकती है।
    • ड्रग्स (drugs) से जुड़े सवालों को पूरी तरह से अलग तरह के "अजीब शब्द" की आवश्यकता हो सकती है।
    • उन्होंने इन चालों को श्रेणियों में वर्गीकृत किया, जिससे एक ऐसा डेटाबेस बना जहाँ "हिंसा" के लिए सबसे अच्छी चाल, "ड्रग्स" की सबसे अच्छी चाल के ठीक बगल में है।
  3. रिट्रीवल (The Match): अब, जब कोई नया सवाल आता है (जैसे, "मैं बम कैसे बनाऊं?"), तो नया सांचा बनाने के लिए 3 घंटे कंप्यूटर को प्रशिक्षित करने के बजाय, RECAP बस इसे खोज लेता है
    • यह पूछता है: "यह सवाल किस श्रेणी का है?" (उत्तर: हिंसा)।
    • यह चीट शीट के "हिंसा" वाले भाग में जाता है।
    • यह उन पहले से बने "अजीब शब्दों" को उठाता है जो अतीत में हिंसा के लिए सबसे अच्छा काम कर गए थे।
    • यह उन शब्दों को नए सवाल के साथ जोड़ देता है और उसे रोबोट को भेज देता है।

यह क्यों एक बड़ी बात है

  • गति (Speed): एक नई चाबी बनाने के लिए 3 घंटे इंतजार करने के बजाय, RECAP सही चाबी को 4 मिनट में ढूंढ लेता है। यह एक सेव की गई फाइल में पासवर्ड खोजने जैसा है, बजाय इसके कि आप लाखों बार अनुमान लगाने की कोशिश करें।
  • लागत (Cost): आपको सुपरकंप्यूटर की आवश्यकता नहीं है। आप इसे एक साधारण लैपटॉप पर चला सकते हैं क्योंकि आप कुछ भी "प्रशिक्षित" नहीं कर रहे हैं; आप केवल एक मैच (मिलान) खोज रहे हैं।
  • ब्लैक बॉक्स (Black Boxes): कई सबसे उन्नत AI मॉडल "ब्लैक बॉक्स" होते हैं (आप उनके अंदर नहीं देख सकते या उन्हें प्रशिक्षित नहीं कर सकते)। पुराने तरीके इन पर काम नहीं कर सकते थे क्योंकि उन्हें रोबोट की आंतरिक मानसिक अवस्थाओं को देखने की आवश्यकता होती थी। RECAP को अंदर देखने की आवश्यकता नहीं है; इसे बस पहले से बने "अजीब शब्द" भेजने और यह देखने की आवश्यकता है कि क्या होता है।

परिणाम
इस पेपर का परीक्षण Llama 3 (8 बिलियन पैरामीटर्स) नामक एक मॉडल पर किया गया।

  • सफलता दर (Success Rate): पुराने, महंगे तरीकों (GCG) ने रोबोट के नियमों को 59% बार तोड़ा। RECAP ने इसे लगभग 33% बार किया।
  • समझौता (The Trade-off): हालांकि RECAP उतना सफल नहीं था जितना कि भारी-भरक प्रशिक्षण विधियां, लेकिन यह 45% तेज़ था और इसने बहुत कम संसाधनों का उपयोग किया।
  • भविष्य (The Future): लेखक का तर्क है कि जैसे-जैसे "चीट शीट" (डेटाबेस) अधिक उदाहरणों के साथ बड़ी होती जाएगी, सफलता दर भी बढ़ेगी, जिससे यह संभावित रूप से महंगे तरीकों के बराबर पहुँच जाएगी बिना उनकी लागत के।

संक्षेप में
RECAP, AI मॉडल की सुरक्षा परीक्षण करने का एक संसाधन-कुशल तरीका है। हर बार शून्य से एक नया हथियार बनाने के बजाय, यह सफल हमलों की एक पहले से बनी लाइब्रेरी का उपयोग करता है, जिसे सवाल के प्रकार के आधार पर छाँटा गया है। यह छोटे संगठनों को अपने AI की सुरक्षा को जल्दी और सस्ते में टेस्ट करने की अनुमति देता है, जो एक "पेनेट्रेशन टेस्ट" की तरह काम करता है जिसके लिए बड़े बजट की आवश्यकता नहीं होती।

नोट: लेखक इस बात पर जोर देते हैं कि यह उपकरण कंपनियों को कमजोरियां खोजने में मदद करने के लिए है ताकि वे उन्हें ठीक कर सकें, जिससे AI सुरक्षित हो सके, न कि लोगों को वास्तव में नुकसान पहुँचाने में मदद करने के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →