← नवीनतम पेपर
💻 computer science

Adaptive Probe-based Steering for Robust LLM Jailbreaking

यह शोध पत्र अडैप्टिव प्रोब-आधारित स्टीयरिंग (Adaptive Probe-based Steering) का परिचय देता है, जो एक सुदृढ़ जेलब्रेकिंग विधि है जो आदर्श स्टीयरिंग वेक्टर्स का अनुमान लगाने के लिए मॉडल एक्सट्रैक्शन का लाभ उठाती है और एक्टिवेशन सांख्यिकी के आधार पर स्टीयरिंग स्ट्रेंथ को अनुकूल रूप से ट्यून करती है, जिससे बिना किसी मैनुअल ट्यूनिंग या अतिरिक्त प्रॉम्प्ट्स के सुदृढ़ (fortified) LLMs के हानिकारक स्कोर को 6% से बढ़ाकर 70% तक काफी बढ़ा दिया जाता है।

मूल लेखक: Junxi Chen, Junhao Dong, Xiaohua Xie

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junxi Chen, Junhao Dong, Xiaohua Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) अत्यधिक प्रशिक्षित सुरक्षा गार्ड हैं। इन गार्ड्स को सख्त नियम सिखाए गए हैं कि वे कभी भी कुछ हानिकारक, अशिष्ट या खतरनाक न कहें। इस प्रशिक्षण को "अलाइनमेंट" (alignment) कहा जाता है। हालांकि, शोधकर्ताओं ने पाया है कि इन गार्ड्स को उनके नियमों को तोड़ने के लिए चालाकी से फंसाया जा सकता है, जिसे "जेलब्रेकिंग" (jailbreaking) कहा जाता है।

यह पेपर इन गार्ड्स को बेवकूफ बनाने का एक नया, अधिक शक्तिशाली तरीका पेश करता है, जो चिल्लाकर या भ्रमित करने वाले शब्दों का उपयोग करके नहीं, बल्कि गार्ड की आंतरिक विचार प्रक्रिया को शारीरिक रूप से धकेलने (nudge करने) के माध्यम से है।

यहाँ उनके तरीके का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

समस्या: "रफ ड्राफ्ट" का धक्का (The "Rough Draft" Nudge)

पिछले तरीकों ने इन मॉडल्स को जेलब्रेक करने के लिए एक विशिष्ट "नज वेक्टर" (nudge vector) खोजने की कोशिश की। इस वेक्टर को मॉडल के आंतरिक विचारों को धकेलने की एक विशिष्ट दिशा के रूप में समझें।

  • दोष: कल्पना कीजिए कि आप एक भारी गाड़ी को एक विशिष्ट दिशा में धकेलने की कोशिश कर रहे हैं, लेकिन आप एक ऐसे व्यक्ति द्वारा बनाए गए मानचित्र (map) का उपयोग कर रहे हैं जो थोड़ा कलरब्लाइंड है। आपका मानचित्र (आपका "स्टीयरिंग वेक्टर") थोड़ा गलत है।
  • मैनुअल ट्यूनिंग: इस धक्के को सफल बनाने के लिए, आपको मैन्युअल रूप से यह अनुमान लगाना पड़ता था कि कितना ज़ोर से धक्का देना है (आपका "स्टीयरिंग स्ट्रेंथ")। यदि आप बहुत ज़ोर से धक्का देते हैं, तो गाड़ी टकरा जाती है (मॉडल बकवास/gibberish बोलने लगता है)। यदि आप बहुत धीरे धक्का देते हैं, तो वह हिलती भी नहीं है। यह प्रक्रिया धीमी, निराशाजनक और अक्सर नए, अधिक मजबूत सुरक्षा गार्डों के सामने विफल हो जाती थी।

समाधान: "एडेप्टिव प्रोब-बेस्ड स्टीयरिंग" (Adaptive Probe-based Steering)

लेखक एक स्मार्ट तरीका प्रस्तावित करते हैं जिससे सही दिशा और बल की सही मात्रा खोजी जा सके। वे इसे "एडेप्टिव प्रोब-बेस्ड स्टीयरिंग" कहते हैं।

1. "मॉडल एक्सट्रैक्शन" का तरीका (मानचित्र को ठीक करना)

शुरुआत में दिए गए एक रफ मैप के बजाय, लेखक "मॉडल एक्सट्रैक्शन" से प्रेरित एक तकनीक का उपयोग करते हैं।

  • उपमा: कल्पना कीजिए कि आप छिपे हुए खजाने तक पहुँचने के लिए सही रास्ता सीखने की कोशिश कर रहे हैं। केवल एक पुराने नक्शे को देखने के बजाय, आप एक कदम उठाते हैं, देखते हैं कि क्या आप करीब हैं, और फिर उस नई जानकारी के आधार पर अपने नक्शे को अपडेट करते हैं। आप इसे बार-बार दोहराते हैं।
  • पेपर में: वे मॉडल के शुरुआती "नज" (nudge) को लेते हैं, देखते हैं कि क्या होता है, और फिर एक स्मार्ट जज (एक "एनोटेटर") का उपयोग करके परिणामों को लेबल करते हैं। वे इस फीडबैक का उपयोग मानचित्र (स्टीयरिंग वेक्टर) को बार-बार फिर से बनाने के लिए करते हैं। यह "शोर" (noise) को साफ करता है और बिना किसी नए, जटिल प्रॉम्प्ट के आदर्श दिशा खोज लेता है।

2. "एडेप्टिव स्ट्रेंथ" (सही धक्का)

एक बार जब आपके पास सही दिशा होती है, तो आपको यह जानना होता है कि कितना ज़ोर से धक्का देना है।

  • पुराने तरीकों का दोष: पुराने तरीके एक "वन-साइज़-फिट्स-ऑल" (सबके लिए एक जैसा) धक्का इस्तेमाल करते थे। वे मानते थे कि मॉडल के मस्तिष्क के हर स्तर (layer) को समान मात्रा में बल की आवश्यकता होती है।
  • उपमा: कल्पना कीजिए कि आप बक्सों के ढेर को धक्का दे रहे हैं। नीचे के बक्सों को भारी होने के कारण ज़ोरदार धक्के की आवश्यकता है। ऊपर के बक्सों को हल्का होना चाहिए; यदि आप उन्हें नीचे वाले बक्सों की तरह ही ज़ोर से धक्का देंगे, तो वे ढेर से उड़ जाएंगे और टूट जाएंगे।
  • सुधार: लेखक देखते हैं कि मॉडल के प्रत्येक लेयर पर उसके आंतरिक विचार कितने "तेज़" (loud) हैं (एक्टिवेशन स्टैटिस्टिक्स)। यदि विचार शांत हैं, तो वे धीरे से धक्का देते हैं। यदि विचार तेज़ हैं, तो वे ज़ोर से धक्का देते हैं। यह मॉडल को बकवास (gibberish) में टूटने (ओवरस्टीयरिंग) से बचाता है और सुनिश्चित करता है कि धक्का वास्तव में काम करे।

परिणाम: किलों को तोड़ना (Breaking the Fortresses)

इस पेपर में इस नए तरीके का परीक्षण 12 अलग-अलग "किलाबंद" (fortified) मॉडल्स के खिलाफ किया गया—ऐसे मॉडल्स जिन्हें विशेष रूप से जेलब्रेक करने के लिए बहुत कठिन बनाया गया है।

  • पहले: इस तरीके से पहले, ये कठिन मॉडल्स केवल 6% समय हानिकारक सामग्री लीक कर रहे थे। वे लगभग अजेय लग रहे थे।
  • बाद में: इस नए एडेप्टिव नज के साथ, हानिकारक सामग्री औसतन 70% तक बढ़ गई।
  • निष्कर्ष: लेखकों ने सफलतापूर्वक दिखाया कि यहाँ तक कि सबसे मजबूत सुरक्षा गार्डों के पास भी एक "कमजोर कड़ी" (weak spot) होती है जो उनके आंतरिक विचार प्रक्रिया में होती है, जिसका फायदा उठाया जा सकता है यदि आप जानते हैं कि उन्हें ठीक से कैसे धकेलना है।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

लेखक कहते हैं कि यह केवल चीजों को तोड़ने के बारे में नहीं है; यह "स्ट्रेस-टेस्टिंग" के बारे में है। जिस तरह आप एक पुल बनाने के बाद यह परीक्षण नहीं करते कि वह कितना भार सह सकता है, हमें AI सुरक्षा रक्षा उपायों पर भरोसा करने से पहले उन्हें तोड़ने की कोशिश भी नहीं करनी चाहिए। यह तरीका उन कमजोर स्थानों को खोजने का एक अधिक मजबूत और स्वचालित तरीका प्रदान करता है ताकि बेहतर, वास्तव में विश्वसनीय रक्षा प्रणालियाँ बनाई जा सकें।

संक्षेप में: उन्होंने एक ऐसा रोबोट बनाया है जो मॉडल के आंतरिक विचारों को बिल्कुल सही दिशा में और बिल्कुल सही बल के साथ धकेलना सीखता है, जिससे यह साबित होता है कि सबसे सुरक्षित AI मॉडल्स को भी नियम तोड़ने के लिए बहकाया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →