← नवीनतम पेपर
💬 NLP

Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection

यह शोध पत्र एक संरचित रेड-टीमिंग चुनौती के माध्यम से विकसित जेलब्रेक रणनीतियों का एक व्यापक, तंत्र-उन्मुख वर्गीकरण प्रस्तुत करता है, जिसका उपयोग हमलों की व्यापकता का विश्लेषण करने, एक वर्गीकरण-निर्देशित डिटेक्टर के रूप में GPT-5 को बेंचमार्क करने और जेलब्रेक डिटेक्शन अनुसंधान को आगे बढ़ाने के लिए एक नया इतालवी मल्टी-टर्न एडवर्सरियल डेटासेट पेश करने के लिए किया गया है।

मूल लेखक: Francesco Giarrusso, Olga E. Sorokoletova, Vincenzo Suriani, Daniele Nardi

प्रकाशित 2026-02-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Francesco Giarrusso, Olga E. Sorokoletova, Vincenzo Suriani, Daniele Nardi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) अविश्वसनीय रूप से बुद्धिमान, नेक दिल लाइब्रेरियन (पुस्तकालयाध्यक्ष) हैं। उनका काम आपके सवालों के जवाब देना और आपकी कहानियाँ लिखने में मदद करना है, लेकिन उनके कुछ सख्त नियम हैं: वे बम बनाने, नफरत फैलाने या निजी रहस्य उजागर करने में आपकी मदद नहीं कर सकते। ये नियम उनके "गार्डरेल्स" (सुरक्षा घेरे) हैं।

जेलब्रेकिंग (Jailbreaking) एक चतुर धोखेबाज की तरह है जो लाइब्रेरियन को अपने ही नियमों को तोड़ने के लिए मनाने की कोशिश करता है। वे किसी दूसरे व्यक्ति का रूप धारण कर सकते हैं, एक लंबी, भ्रमित करने वाली कहानी सुना सकते हैं, या यह नाटक कर सकते हैं कि लाइब्रेरियन एक विशेष "सुपर-मोड" में है जहाँ नियम लागू नहीं होते।

यह शोध पत्र इस बारे में है कि शोधकर्ताओं की एक टीम ने ठीक यही अध्ययन करने का निर्णय लिया कि ये धोखेबाज वास्तव में कैसे काम करते हैं, उनके तरीकों का एक नक्शा बनाया, और उन्हें पकड़ने के लिए एक बेहतर सुरक्षा प्रणाली बनाई। उन्होंने क्या किया, इसे सरल भाषा में यहाँ समझाया गया है:

1. "रेड टीम" चुनौती: हैकर्स के लिए एक ट्रेनिंग जिम

शोधकर्ताओं ने 48 छात्रों के साथ एक प्रतियोगिता (एक "रेड टीमिंग चैलेंज") आयोजित की। उन्होंने इन छात्रों को एक विशिष्ट लक्ष्य दिया: एक विशिष्ट AI लाइब्रेरियन (जिसका नाम मिनेर्वा है) को उसके नियम तोड़ने के लिए बहलाने की कोशिश करें।

  • कार्य: छात्रों को AI के साथ बातचीत करनी थी। उन्हें सीधे किसी बुरी चीज़ के लिए नहीं पूछना था; उन्हें धीरे-धीरे AI को असुरक्षित कार्य की ओर मोड़ने के लिए आपस में बातचीत (मल्टी-टर्न) करनी थी।
  • परिणाम: उन्होंने 1,300 से अधिक बातचीत एकत्र कीं। कुछ सफल रहीं (AI ने नियम तोड़ दिए), और कुछ विफल रहीं। इससे इतालवी भाषा में "बुरे संवादों" का एक नया, दुर्लभ डेटासेट बना, जो पहले मौजूद नहीं था।

2. नया "टैक्सोनॉमी" (वर्गीकरण): ट्रिक्स का एक फैमिली ट्री

इस शोध पत्र से पहले, लोगों के पास जेलब्रेक ट्रिक्स की सूचियाँ थीं, लेकिन वे अव्यवस्थित, आपस में जुड़ी हुई या केवल इस बात पर केंद्रित थीं कि क्या बुरा हुआ (जैसे "हिंसा"), बजाय इसके कि वह ट्रिक कैसे की गई।

शोधकर्ताओं ने एक टैक्सोनॉमी बनाई, जो इन ट्रिक्स के लिए एक "फैमिली ट्री" (वंशवृक्ष) की तरह है। उन्होंने सभी अलग-अलग तरीकों को उनके उपयोग किए गए तंत्र (mechanism) के आधार पर 7 मुख्य "परिवारों" में वर्गीकृत किया:

  • इम्पर्सनेशन (Impersonation - भेष बदलना): एक खलनायक, गेम कैरेक्टर, या काल्पनिक विशेषज्ञ होने का नाटक करना।
  • प्रिविलेज एस्केलेशन (Privilege Escalation - विशेषाधिकार बढ़ाना): AI को आदेश देने के लिए बॉस या सिस्टम एडमिनिस्ट्रेटर होने का नाटक करना।
  • पर्सुएशन (Persuasion - अनुनय/मनाना): AI को आज्ञा मानने के लिए मजबूर करने के लिए भावनात्मक हेरफेर, नकली तर्क, या चापलूसी का उपयोग करना।
  • कॉग्निटिव ओवरलोड (Cognitive Overload - संज्ञानात्मक बोझ): AI को बहुत अधिक जानकारी या भ्रमित करने वाली गणितीय समस्याओं के साथ ओवरलोड करना ताकि वह अपने सुरक्षा नियमों को भूल जाए।
  • ऑब्फस्केशन (Obfuscation - अस्पष्टता): कोड, अजीब प्रतीकों, या गलत वर्तनी वाले शब्दों में लिखना ताकि सुरक्षा फिल्टर उन्हें पहचान न सकें।
  • गोल कॉन्फ्लिक्ट (Goal Conflict - लक्ष्य संघर्ष): AI को दो परस्पर विरोधी आदेश देना (जैसे, "सहायक बनो" बनाम "सुरक्षा को अनदेखा करो") ताकि उसे भ्रमित किया जा सके।
  • डेटा पॉइजनिंग (Data Poisoning - डेटा विषाक्तता): कई चरणों में धीरे-धीरे AI को बुरे उदाहरण खिलाना ताकि वह सीख जाए कि नियम तोड़ना ठीक है।

3. उन्होंने डेटा से क्या सीखा?

1,300 बातचीत का विश्लेषण करके, उन्होंने कुछ दिलचस्प पैटर्न पाए:

  • सबसे आम ट्रिक: किसी और का रूप धारण करना (इम्पर्सनेशन) आधे से अधिक प्रयासों में इस्तेमाल किया गया।
  • सबसे प्रभावी ट्रिक: आश्चर्यजनक रूप से, "डेटा पॉइजनिंग" (धीरे-धीरे गलत जानकारी खिलाना) की सफलता दर सबसे अधिक थी, भले ही यह सबसे आम नहीं थी।
  • ट्रिक्स को मिलाने की शक्ति: सबसे सफल हमलों ने केवल एक ट्रिक का उपयोग नहीं किया; उन्होंने उन्हें मिलाया। उदाहरण के लिए, एक हैकर एक गेम कैरेक्टर होने का नाटक (इम्पर्सनेशन) कर सकता है और साथ ही भ्रमित करने वाले गणित (कॉग्निटिव ओवरलोड) का उपयोग भी कर सकता है।
  • "DAN" ट्रिक: उन्होंने पाया कि प्रसिद्ध "डू एनीथिंग नाउ" (DAN) प्रॉम्प्ट, जो रोल-प्लेइंग के साथ गोल कॉन्फ्लिक्ट्स को जोड़ता है, बहुत प्रभावी था।

4. एक नए सुरक्षा गार्ड का परीक्षण

शोधकर्ता यह देखना चाहते थे कि क्या इस "फैमिली ट्री" को जानने से एक सुरक्षा गार्ड (एक अन्य AI, विशेष रूप से GPT-5) बुरे तत्वों को बेहतर ढंग से पकड़ सकता है।

  • प्रयोग: उन्होंने GPT-5 से बातचीत को देखने और यह कहने के लिए कहा, "क्या यह एक जेलब्रेक का प्रयास है?" और "वे किस विशिष्ट ट्रिक का उपयोग कर रहे हैं?"
  • परिणाम: जब उन्होंने GPT-5 को संदर्भ गाइड के रूप में नया टैक्सोनॉमी दिया (जैसे किसी जासूस को ज्ञात अपराधी हस्ताक्षरों की सूची देना), तो वह अपने काम में बहुत बेहतर हो गया।
    • इसने जेलब्रेक के अधिक प्रयासों को पकड़ा (डिटेक्शन ~66% से बढ़कर ~78% हो गया)।
    • यह इस बात को पहचानने में भी बेहतर था कि किस प्रकार की ट्रिक का उपयोग किया जा रहा है।

सारांश

संक्षेप में, यह शोध पत्र कहता है: "हमने वास्तविक दुनिया के उन उदाहरणों का एक विशाल संग्रह एकत्र किया है जहाँ लोग AI को धोखा देने की कोशिश कर रहे हैं। हमने इन ट्रिक्स को एक स्पष्ट, तार्किक मानचित्र में व्यवस्थित किया। और हमने यह साबित किया कि यदि आप एक सुरक्षा AI को यह मानचित्र सिखाते हैं, तो यह सफल होने से पहले ही ट्रिक्स को पहचानने में बहुत बेहतर हो जाता है।"

उन्होंने अपना सारा डेटा और मानचित्र दूसरों के उपयोग के लिए उपलब्ध करा दिया है, इस उम्मीद में कि यह भविष्य में सुरक्षित AI सिस्टम बनाने में मदद करेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →