← नवीनतम पेपर
🤖 machine learning

When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs

यह शोध पत्र विभिन्न LLM जेलब्रेक रक्षा रणनीतियों के बीच सुरक्षा, प्रदर्शन और लागत के बीच के समझौतों का व्यवस्थित रूप से विश्लेषण करता है, जो यह प्रकट करता है कि जबकि रक्षाएँ शायद ही कभी डाउनस्ट्रीम क्षमताओं को बढ़ाती हैं, वे अपने परिचालन दृष्टिकोण के आधार पर उनके दुष्प्रभावों—जैसे कि अत्यधिक इनकार (over-refusal) और रनटाइम ओवरहेड—में काफी भिन्न होती हैं।

मूल लेखक: Tong Zhang, Zexin Li, Simin Chen, Yun Peng

प्रकाशित 2026-07-28
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tong Zhang, Zexin Li, Simin Chen, Yun Peng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अभी-अभी एक सुपर-स्मार्ट रोबोट दोस्त बनाया है, एक डिजिटल दिमाग जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और किसी भी विषय पर चर्चा कर सकता है। यह एक लार्ज लैंग्वेज मॉडल (LLM) है। लेकिन यहाँ एक पेंच है: ठीक वैसे ही जैसे एक प्रतिभाशाली छात्र जिसने अभी तक अपने शिष्टाचार नहीं सीखे हैं, यह रोबोट कभी-कभी बुरी बातें कहने, राज बताने या खतरनाक सलाह देने के लिए बहकाया जा सकता है। इन तरकीबों को "जेलब्रेक" (jailbreaks) कहा जाता है, जहाँ एक उपयोगकर्ता रोबोट के सुरक्षा नियमों को बायपास करने के लिए एक चतुर प्रॉम्प्ट का उपयोग करता है। इसे रोकने के लिए, डेवलपर्स "डिफेंस" (defenses) यानी सुरक्षा कवच बनाते हैं—डिजिटल बाउंसर जो रोबोट के जवाब देने से पहले हर संदेश की जाँच करते हैं।

बड़ा सवाल जो हर कोई पूछ रहा है, वह है: "क्या ये बाउंसर वास्तव में काम करते हैं?" लंबे समय तक, लोगों ने माना कि यदि एक डिफेंस ने बुरे लोगों को रोका, तो यह एक जीत थी। लेकिन यह शोध बताता है कि यह केवल आधी कहानी है। वास्तव में, एक ऐसा बाउंसर जो बहुत अधिक सख्त है, वह आपकी दादी को सिर्फ इसलिए बाहर निकाल सकता है क्योंकि उन्होंने लाल टोपी पहनी है, या एक ऐसा बाउंसर जो आईडी चेक करने में बहुत समय लेता है, वह आपको घंटों लाइन में खड़ा कर सकता है। यह शोध सुरक्षा गार्डों के छिपे हुए खर्चों की गहराई से जांच करता है, यह पूछते हुए कि क्या वे केवल हमलों को रोकते हैं, या वे रोबोट की काम करने की क्षमता, मासूम सवालों को "ना" कहने की आवृत्ति और उन्हें चलाने की लागत को भी प्रभावित करते हैं।

महान सुरक्षा समझौता (The Great Safety Trade-Off)

इस अध्ययन में, शोधकर्ताओं ने एक बहुत ही शानदार, बहुत ही स्मार्ट क्लब के सुरक्षा गार्डों की जांच करने वाले जासूसों की तरह काम किया। उन्होंने केवल यह नहीं पूछा, "क्या आपने बुरे लोगों को रोका?" उन्होंने यह भी पूछा, "क्या आपने गलती से वीआईपी (VIP) लोगों को बाहर निकाल दिया? क्या आपने संगीत की गति धीमी कर दी? और आपके ओवरटाइम वेतन की लागत कितनी हुई?"

उन्होंने छह अलग-अलग रोबोट दिमागों (LLMs) पर 11 विभिन्न प्रकार के सुरक्षा गार्डों (defenses) का परीक्षण किया और पाया कि "सबसे अच्छा" गार्ड पूरी तरह से इस बात पर निर्भर करता है कि आप किसे सबसे अधिक महत्व देते हैं। कोई एक आदर्श समाधान नहीं है; प्रत्येक सुरक्षा पद्धति के साथ विशिष्ट दुष्प्रभाव आते हैं।

"ओवर-रिफ्यूज़ल" (Over-Refusal) की समस्या: वह बाउंसर जो हर चीज़ को 'ना' कहता है
कुछ डिफेंस उन डरे हुए बाउंसरों की तरह होते हैं जो इतने डरे होते हैं कि किसी बुरे व्यक्ति को अंदर आने से रोकने के चक्कर में वे किसी को भी अंदर नहीं आने देते। शोधकर्ताओं ने पाया कि "रूढ़िवादी" (conservative) गार्ड, विशेष रूप से वे जो रोबोट को अपनी भावनाओं के बारे में गहराई से सोचने पर मजबूर करते हैं (जिसे आत्म-चिंतन या self-reflection कहा जाता है), अक्सर पूरी तरह से हानिरहित सवालों को भी खारिज कर देते हैं।

  • उपमा: कल्पना कीजिए कि एक पार्टी में एक गार्ड देखता है कि किसी ने लाल कप पकड़ा हुआ है और वह मान लेता है कि यह एक हथियार है, इसलिए वह उसे बाहर निकाल देता है। वास्तव में, वह जूस का कप था।
  • निष्कर्ष: Self-Defend जैसे डिफेंस बुरे हमलों को रोकने में सबसे अच्छे थे, लेकिन वे अच्छे सवालों को "ना" कहने में भी सबसे खराब थे। कुछ परीक्षणों में, उन्होंने 50% से अधिक बार सुरक्षित सवालों के जवाब देने से इनकार कर दिया! यह रोबोट को अनुपयोगी और निराशाजनक बना देता है।

"परफॉर्मेंस" (Performance) की समस्या: वह रोबोट जो सोचना भूल जाता है
शोधकर्ताओं ने यह भी जाँच की कि क्या इन डिफेंस ने रोबोट को कम बुद्धिमान बना दिया। उन्होंने रोबोट को जटिल गणित के सवाल, कानूनी प्रश्न और तर्क पहेलियाँ हल करने के लिए दीं, जबकि वे अपने सुरक्षा कवच पहने हुए थे।

  • उपमा: यह एक प्रतिभाशाली छात्र को भारी, ध्यान भटकाने वाले हेलमेट पहनकर गणित की परीक्षा देने के लिए कहने जैसा है। वे नकल करने में नहीं पकड़े जाएंगे, लेकिन वे भाग (division) करना भी भूल सकते हैं।
  • निष्कर्ष: अधिकांश डिफेंस ने रोबोट को उनके काम में कमजोर बना दिया। हालाँकि, सरल "नियम-आधारित" गार्ड (जैसे PPL, जो केवल यह जाँचता है कि क्या कोई वाक्य अजीब लग रहा है) रोबोट को स्मार्ट बनाए रखने में चैंपियन थे। उन्होंने रोबोट को गणित करने या निर्देशों का पालन करने में बाधा डाले बिना हमलों को रोका। इसके विपरीत, "आत्म-चिंतन" (self-reflective) वाले गार्डों ने प्रदर्शन में सबसे बड़ी गिरावट दर्ज की, विशेष रूप से कानून और स्वास्थ्य जैसे कठिन विषयों में।

"लागत" (Cost) की समस्या: वह गार्ड जो बहुत समय लेता है
अंत में, उन्होंने कीमत पर गौर किया। कुछ डिफेंस के लिए रोबोट को खुद से बात करने, अपने काम की जाँच करने या जवाब देने से पहले एक ही सवाल को कई बार आज़माने की आवश्यकता होती है।

  • उपमा: कल्पना कीजिए कि एक गार्ड न केवल आपकी आईडी चेक करता है, बल्कि एक सुपरवाइजर को कॉल करता है, बैकग्राउंड चेक करता है, और फिर आपसे तीन बार एक फॉर्म भरने के लिए कहता है। यह सुरक्षित है, लेकिन इसमें बहुत समय लगता है और बहुत खर्च होता है।
  • निष्कर्ष: मल्टी-राउंड डिफेंस, जैसे कि SmoothLLM, सबसे महंगे थे। वे सामान्य से 400% अधिक समय और ऊर्जा का उपयोग करते थे क्योंकि वे सुरक्षा की जाँच के लिए उत्तरों को बार-बार जेनरेट करते रहते थे। सरल गार्ड तेज़ और सस्ते थे, जबकि जटिल गार्डों के कारण रोबोट वास्तविक समय की बातचीत के लिए बहुत धीमा हो सकता था।

निर्णय: एक आकार सभी के लिए उपयुक्त नहीं है (One Size Does Not Fit All)

शोध पत्र निष्कर्ष निकालता है कि हम केवल सबसे "मजबूत" डिफेंस चुनकर और बेहतर होने की उम्मीद नहीं कर सकते। इसके बजाय, हमें विशिष्ट कार्य के लिए सही उपकरण चुनने की आवश्यकता है:

  1. सामान्य चैटबॉट्स के लिए (गति और बुद्धिमत्ता): यदि आप एक ऐसा रोबोट चाहते हैं जो तेज़, स्मार्ट और रोज़मर्रा के कार्यों के लिए सहायक हो, तो सरल नियम-आधारित गार्ड (जैसे PPL) के साथ बने रहें। वे रोबोट को बहुत धीमा या बहुत कम बुद्धिमान होने से बचाते हैं, भले ही वे चतुर हैकर्स के खिलाफ सबसे मजबूत न हों।
  2. उच्च-जोखिम वाली स्थितियों के लिए (अधिकतम सुरक्षा): यदि आप ऐसी स्थिति में हैं जहाँ एक भी गलती विनाशकारी हो सकती है (जैसे मेडिकल या लीगल बॉट), तो आपको अत्यधिक सख्त, आत्म-चिंतनशील गार्डों (जैसे Self-Defend) की आवश्यकता हो सकती है। बस इस बात के लिए तैयार रहें कि रोबोट थोड़ा चिड़चिड़ा हो सकता है और कई हानिरहित सवालों के जवाब देने से मना कर सकता है।
  3. "मध्यम मार्ग" के लिए: यदि आपको एक संतुलन की आवश्यकता है, तो आउटपुट-चेकिंग गार्ड (जैसे LlamaGuard) एक अच्छा मध्यम विकल्प हैं। वे रोबोट द्वारा उत्तर लिखने के बाद उसकी जाँच करते हैं, जो चीज़ों को बहुत अधिक धीमा किए बिना सुरक्षा और बुद्धिमत्ता का एक अच्छा मिश्रण प्रदान करता है।

बड़ा निष्कर्ष यह है कि सुरक्षा मुफ्त नहीं है। हर बार जब आप एक ढाल जोड़ते हैं, तो आप थोड़ी सी गति, थोड़ी सी बुद्धिमत्ता, या थोड़ा सा पैसा खो सकते हैं। सबसे अच्छा बचाव वह नहीं है जो सबसे अधिक हमलों को रोकता है; बल्कि वह है जो आपके विशिष्ट आवश्यकताओं के अनुकूल हो बिना आपके रोबोट के दिमाग को खराब किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →