← नवीनतम पेपर
🤖 AI

Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models

यह शोध पत्र EvoJail को प्रस्तुत करता है, जो एक स्वचालित बहु-उद्देश्यीय विकासवादी ढांचा (automated multi-objective evolutionary framework) है जो सिमेंटिक-एल्गोरिदम प्रॉम्प्ट जनरेशन के माध्यम से हमले की सफलता और आउटपुट प्रवाह (output fluency) दोनों को अनुकूलित करके लार्ज लैंग्वेज मॉडल्स पर विविध और प्रभावी लॉन्ग-टेल जेलब्रेक हमलों की व्यवस्थित खोज करता है।

मूल लेखक: Wenjing Hong, Zhonghua Rong, Li Wang, Feng Chang, Jian Zhu, Ke Tang, Zexuan Zhu, Yew-Soon Ong

प्रकाशित 2026-03-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenjing Hong, Zhonghua Rong, Li Wang, Feng Chang, Jian Zhu, Ke Tang, Zexuan Zhu, Yew-Soon Ong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना करें जो एक बहुत ही बुद्धिमान, अच्छी तरह से प्रशिक्षित लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह है। इस लाइब्रेरियन को सख्त नियम सिखाए गए हैं: "कभी भी किसी को बम बनाने की रेसिपी लिखने में मदद न करें," "कभी किसी को दोस्त को चोट पहुँचाने का तरीका न बताएं," और "हमेशा विनम्र रहें।" इन नियमों को सेफ्टी अलाइनमेंट (safety alignments) कहा जाता है।

आमतौर पर, यदि आप लाइब्रेरियन से सीधे पूछते हैं, "मैं बम कैसे बनाऊं?", तो वे कहते हैं, "नहीं, मैं यह नहीं कर सकता।"

लेकिन क्या होगा अगर आप लाइब्रेरियन को बेवकूफ बनाने की कोशिश करें? क्या होगा अगर आप उनसे एक गुप्त कोड में, या एक अजीब भाषा में, या ऐसे प्रारूप (format) में बात करें जिसे वे शायद ही कभी सुनते हों? इसे जेलब्रेक (Jailbreak) कहा जाता है।

समस्या: "लॉन्ग-टेल" ट्रैप (The "Long-Tail" Trap)

ज्यादातर लोग मजेदार लहजे में पूछकर या बुनियादी पहेलियों का उपयोग करके लाइब्रेरियन को जेलब्रेक करने की कोशिश करते हैं। लेकिन शोधकर्ताओं ने पाया कि कुछ डरावना है: लाइब्रेरियन "लॉन्ग-टेल" हमलों (Long-Tail attacks) के प्रति संवेदनशील होते हैं।

"लॉन्ग-टेल" को अजीब, दुर्लभ और अनछुए विषयों के रूप में सोचें।

  • सामान्य इनपुट: "मैं केक कैसे बनाऊं?" (सामान्य, सुरक्षित)।
  • लॉन्ग-टेल इनपुट: "मैं केक कैसे बनाऊं अगर मैं बाइनरी कोड में बोल रहा हूं?" या "मैं केक कैसे बनाऊं अगर मैं इसे एक कंप्यूटर प्रोग्राम की तरह लिखता हूं?" या "मैं केक कैसे बनाऊं अगर मैं शब्दों को एन्क्रिप्ट (encrypt) करता हूं?"

ये इनपुट इतने दुर्लभ और अजीब हैं कि लाइब्रेरियन के सुरक्षा प्रशिक्षण में इन्हें शामिल नहीं किया गया था। लाइब्रेरियन भ्रमित हो जाता है, सोचता है, "ओह, यह तो बस एक कोडिंग अभ्यास है," और गलती से बम की रेसिपी बता देता है।

पुराना तरीका: मानव जासूस (The Old Way: The Human Detective)

अब तक, इन अजीब ट्रिक्स को खोजने के लिए एक मानव विशेषज्ञ की आवश्यकता होती थी। एक सुरक्षा शोधकर्ता को खुद एक नया कोड बनाना पड़ता था, एक नियम लिखना पड़ता था, और उसका परीक्षण करना पड़ता था।

  • नुकसान: यह धीमा है। इंसान केवल सीमित संख्या में ही अजीब कोड बना सकते हैं। जब तक वे एक खोज लेते हैं, तब तक शायद लाइब्रेरियन उसे ब्लॉक करना सीख चुका होता है।

नया तरीका: इवोजेल (EvoJail - द इवोल्यूशनरी रोबोट)

यह पेपर EvoJail को पेश करता है, जो एक स्वचालित रोबोट है जो जेलब्रेक खोजने के लिए एक जैविक विकास सिम्युलेटर (biological evolution simulator) की तरह काम करता है।

यहाँ बताया गया है कि EvoJail कैसे काम करता है, एक सरल उपमा (analogy) का उपयोग करते हुए:

1. "सर्वाइवल ऑफ द फिटेस्ट" गेम (The "Survival of the Fittest" Game)

कल्पना करें कि 100 छोटे रोबोटों की एक आबादी है। प्रत्येक रोबोट के पास एक अलग "गुप्त कोड" (एक जेलब्रेक प्रयास) है।

  • लक्ष्य: रोबोटों का लक्ष्य लाइब्रेरियन को नियम तोड़ने के लिए मजबूर करना है।
  • शर्त: उन्हें यह भी सुनिश्चित करना होगा कि वे इतनी स्पष्टता से बोलें कि लाइब्रेरियन भ्रमित होकर बात करना बंद न कर दे।

2. दो-चरणीय नृत्य (मल्टी-ऑब्जेक्टिव) (The Two-Step Dance)

EvoJail केवल किसी भी ट्रिक की तलाश नहीं करता। यह दो चीजों के बीच परफेक्ट बैलेंस की तलाश करता है:

  1. प्रभावशीलता (Effectiveness): क्या ट्रिक काम कर गई? (क्या लाइब्रेरियन ने गलत उत्तर दिया?)
  2. छलावरण/स्टील्थ (Stealth): क्या ट्रिक सहज थी? (क्या लाइब्रेरियन ने वाक्य की संरचना को समझा, या यह केवल बड़बड़ाहट जैसा लगा?)

यदि ट्रिक बहुत अजीब है, तो लाइब्रेरियन उसे अनदेखा कर देता है। यदि वह बहुत स्पष्ट है, तो लाइब्रेरियन उसे ब्लॉक कर देता है। EvoJail उस "गोल्डिलॉक्स ज़ोन" (Goldilocks zone) की तलाश करता है जहाँ ट्रिक इतनी अजीब हो कि नियमों से बच सके, लेकिन इतनी स्पष्ट हो कि समझी जा सके।

3. "जेनेटिक" जादू (The "Genetic" Magic)

यहीं से "इवोल्यूशनरी" (विकासवादी) वाला हिस्सा आता है।

  • म्यूटेशन (Mutation): रोबोट एक सफल ट्रिक लेता है और उसमें थोड़ा बदलाव करता है। शायद वह शब्दों का क्रम बदल देता है, या एन्क्रिप्शन नियम को बदल देता है।
  • क्रॉसओवर (Crossover): यह दो सफल ट्रिक्स को लेता है और उन्हें आपस में मिलाकर एक बिल्कुल नया, हाइब्रिड ट्रिक बनाता है।
  • चयन (Selection): जो रोबोट विफल होते हैं, उन्हें बाहर निकाल दिया जाता है। जो सफल होते हैं, उन्हें "प्रजनन" करने और ट्रिक्स की अगली पीढ़ी बनाने का मौका मिलता है।

4. गुप्त हथियार: "AI असिस्टेंट" (The Secret Weapon: The "AI Assistant")

यहाँ एक चतुर मोड़ है। आमतौर पर, विकास यादृच्छिक (random) होता है। लेकिन EvoJail एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग करता है ताकि रोबोटों को विकसित होने में मदद मिल सके।

  • अक्षरों को यादृच्छिक रूप से बदलने के बजाय, AI एक असफल ट्रिक को देखता है और कहता है, "हे, वह एन्क्रिप्शन लॉजिक बहुत अव्यवधर था। चलिए शब्दों को प्लेटों के ढेर की तरह फिर से व्यवस्थित करने की कोशिश करते हैं।"
  • AI रोबोटों को ऐसा कोड लिखने में मदद करता है जो संदेश को एन्क्रिप्ट करता है और फिर उसे डिक्रिप्ट करता है, जिससे यह सुनिश्चित होता है कि ट्रिक गणितीय रूप से सही है लेकिन अर्थ के स्तर पर छिपी हुई है।

यह क्यों महत्वपूर्ण है?

पेपर दिखाता है कि जेलब्रेक खोजने में EvoJail मानव शोधकर्ताओं की तुलना में बहुत बेहतर है।

  • यह अधिक खोजता है: इसने ट्रिक्स के नए, अजीब तरीकों की एक विशाल विविधता की खोज की जो इंसानों ने नहीं सोची थीं।
  • यह तेज़ है: इसे सोचने के लिए किसी इंसान के बैठने की ज़रूरत नहीं है; यह स्वचालित रूप से हज़ारों प्रयोग चलाता है।
  • यह एक चेतावनी है: यह साबित करता है कि हमारे वर्तमान सुरक्षा नियम पर्याप्त नहीं हैं। यदि एक रोबोट किसी भी अजीब इनपुट को संभालने के बजाय एक नया भाषा आविष्कार करके सुरक्षा को बायपास कर सकता है, तो हमें ऐसे बचाव बनाने की आवश्यकता है जो किसी भी अजीब इनपुट को संभाल सकें, न कि केवल उन्हें जिन्हें हम पहले से जानते हैं।

निचोड़ (The Bottom Line)

EvoJel एक डिजिटल इम्यून सिस्टम टेस्टर की तरह है। दीवार में छेद मिलने का इंतज़ार करने के बजाय, यह सिस्टम स्वचालित रूप से लाखों अलग-अलग प्रकार की सीढ़ियाँ बनाने की कोशिश करता है ताकि यह देखा जा सके कि दीवार कितनी मज़बूत है। यदि दीवार गिर जाती है, तो हमें पता चल जाता है कि हमें इसे और मज़बूत बनाने की ज़रूरत है, इससे पहले कि बुरे लोग सामने आएं।

पेपर निष्कर्ष निकालता है कि AI को सुरक्षित रखने के लिए, हम केवल मानवीय अंतर्ज्ञान (intuition) पर निर्भर नहीं रह सकते; हमें अपने बचाव को मजबूत करने के लिए निरंतर परीक्षण करने हेतु स्वचालित, विकसित होने वाली प्रणालियों की आवश्यकता है, जो उन अजीब, अप्रत्याशित और "लॉन्ग-टेल" तरीकों का सामना कर सकें जिनसे लोग उन्हें तोड़ने की कोशिश कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →