← नवीनतम पेपर
🤖 AI

BarrierSteer: LLM Safety via Learning Barrier Steering

BarrierSteer एक नवीन, पैरामीटर-मुक्त इन्फरेंस-टाइम फ्रेमवर्क है जो सीखे गए नॉनलीनियर सेफ्टी कंस्ट्रेंट्स को लेटेंट स्पेस में कंट्रोल बैरियर फंक्शन्स के रूप में एम्बेड करके मॉडल की उपयोगिता को बनाए रखते हुए असुरक्षित प्रक्षेप पथों (trajectories) से दूर जाने के लिए लार्ज लैंग्वेज मॉडल की सुरक्षा को बढ़ाता है।

मूल लेखक: Thanh Q. Tran, Arun Verma, Kiwan Wong, Bryan Kian Hsiang Low, Daniela Rus, Wei Xiao

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thanh Q. Tran, Arun Verma, Kiwan Wong, Bryan Kian Hsiang Low, Daniela Rus, Wei Xiao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक बहुत ही प्रतिभाशाली, तेज़ बोलने वाले शेफ के रूप में करें जो आपकी हर मांग पर लगभग कुछ भी पका सकता है। हालाँकि, कभी-कभी एक चालाक ग्राहक (एक "एडवर्सरियल अटैक") शेफ को कुछ खतरनाक या हानिकारक बनाने के लिए धोखा दे सकता है, जैसे कि एक "ज़हरीला व्यंजन", भले ही शेफ को सुरक्षित रहने के लिए प्रशिक्षित किया गया हो।

यह पेपर एक नया सुरक्षा सिस्टम पेश करता है जिसे BarrierSteer कहा जाता है। यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. समस्या: शेफ के "छिपे हुए विचार"

जब शेफ खाना पकाता है, तो वे केवल अंतिम व्यंजन तुरंत नहीं निकालते। वे कई आंतरिक चरणों से गुजरते हैं (सामग्री के बारे में सोचना, मिश्रण बनाना, गर्म करना)। AI के संदर्भ में, इन्हें हिडन स्टेट्स (hidden states) या लेटेंट रिप्रेजेंटेशन (latent representations) कहा जाता है।

पिछले सुरक्षात्मक तरीकों ने तब कोशिश की जब शेफ़ ने व्यंजन परोस दिया था (अंतिम टेक्स्ट की जाँच करना) या शेफ को शुरू से फिर से प्रशिक्षित करने की कोशिश की (जो धीमा और महंगा है)। अन्य तरीकों ने शेफ को एक निश्चित दिशा में धकेलने की कोशिश की (जैसे "हमेशा अच्छा बनो" कहना), लेकिन वह बहुत ही साधारण तरीका है। यह बुरे व्यंजनों को तो रोक सकता है लेकिन अच्छे व्यंजनों को भी खराब कर सकता है, जिससे शेफ सुरक्षित रहने के चक्कर में हानिरहित अनुरोधों (जैसे केक की रेसिपी) को बनाने से मना कर सकता है।

2. समाधान: "अदृश्य सुरक्षा घेरा"

BarrierSteer एक स्मार्ट, अदृश्य घेरे की तरह काम करता है जो शेफ के दिमाग के अंदर मौजूद होता है जबकि वे खाना पका रहे होते हैं।

  • घेरे को सीखना: सबसे पहले, सिस्टम शेफ को हजारों उदाहरण पकाते हुए देखता है। यह पहचानना सीखता है कि एक खतरनाक विचार और एक सुरक्षित विचार का विशिष्ट "मानसिक आकार" क्या है। यह केवल बुरे शब्दों को नहीं देखता; यह खाना पकाने की प्रक्रिया के आंतरिक "वाइब" (vibe) को देखता है।
  • घेरा लचीला है: एक कठोर दीवार के विपरीत, यह घेरा नॉन-लीनियर बैरियर्स (non-linear barriers) से बना है। कल्पना करें कि यह एक लचीला जाल है जो जटिल आकारों में फिट होने के लिए खिंच और मुड़ सकता है। यह जानता है कि "खतरे का क्षेत्र" कहाँ है, भले ही खतरा हर बार अलग दिखे।

3. जादू: बिना शेफ को तोड़े "स्टीयरिंग" करना

यह सबसे महत्वपूर्ण हिस्सा है। जब शेफ खतरे के क्षेत्र (अदृश्य घेरे) की ओर बढ़ने लगता है, तो BarrierSteer शेफ को रोकता नहीं है या प्रक्रिया को फिर से शुरू नहीं करता है। इसके बजाय, यह एक छोटा, सटीक धक्का (nudge) लगाता है।

  • कंट्रोल थ्योरी की उपमा: यह पेपर इंजीनियरिंग की एक अवधारणा का उपयोग करता है जिसे कंट्रोल बैरियर फंक्शन्स (CBFs) कहा जाता है। एक सेल्फ-ड्राइविंग कार के बारे में सोचें जो खाई के करीब पहुँच रही है। कार केवल ब्रेक नहीं लगाती; यह गणना करती है कि बिना झटके खाए सड़क पर बने रहने के लिए कितना स्टीयरिंग घुमाना आवश्यक है।
  • परिणाम: BarrierSteer उस सटीक गणितीय "धक्के" की गणना करता है जिसकी आवश्यकता शेफ के विचार प्रक्रिया को वापस सुरक्षित पक्ष पर धकेलने के लिए होती है। यह प्रत्येक शब्द को उत्पन्न करते समय इसे तुरंत (मिलीसेकंड में) करता है।

4. यह प्रतिस्पर्धा में बेहतर क्यों है?

यह पेपर इसकी तुलना अन्य तरीकों से करता है:

  • पुराने तरीके (निश्चित दिशा): एक कार को केवल पहिया बाईं ओर मोड़कर चलाने की कोशिश करने जैसा। यह कभी-कभी काम करता है, लेकिन अक्सर आप सड़क के दाईं ओर टकरा जाते हैं।
  • प्रतिद्वंद्वी (SaP): एक समान तरीका जो हर शब्द के लिए एक धीमी, जटिल गणना चलाकर समस्या को ठीक करने की कोशिश करता है। यह कार चलाते समय अपने दिमाग में गणित का समीकरण हल करने जैसा है; यह बहुत धीमा है और कार को लैग (lag) करा देता है।
  • BarrierSteer: क्योंकि यह एक चतुर गणितीय शॉर्टकट (एक "क्लोज्ड-फॉर्म सॉल्यूशन") का उपयोग करता है, यह लगभग तुरंत धक्का (nudge) की गणना कर सकता है। यह अपने निकटतम प्रतिद्वंद्वी से 58 से 79 गुना तेज़ है।

5. परिणाम: सुरक्षित, तेज़ और उपयोगी

इस पेपर ने इसे चार अलग-अलग AI मॉडल्स और कई प्रकार के "चालाकी भरे" हमलों पर टेस्ट किया।

  • सुरक्षा: इसने मॉडल्स को हानिकारक सामग्री उत्पन्न करने से रोकने में सफलता प्राप्त की, जिससे हमलों की सफलता दर घटकर लगभग शून्य हो गई।
  • उपयोगिता (Utility): क्योंकि इसके धक्के (nudges) इतने सटीक हैं, मॉडल्स ने अपनी अच्छी चीजें करने की क्षमता नहीं खोई। वे पहले की तरह ही गणित के सवालों के जवाब देने और कहानियाँ लिखने में सक्षम थे।
  • कोई "ओवर-रिफ्यूज़ल" नहीं: कुछ सुरक्षा प्रणालियों के विपरीत जो केवल सुरक्षित रहने के लिए हर चीज़ को "ना" कहती हैं, BarrierSteer केवल बुरी चीजों को रोकता है, जिससे अच्छी चीजें गुजर सकें।

सारांश

BarrierSteer एक अत्यधिक कुशल को-पायलट की तरह है जो AI शेफ के बगल में बैठा है। यह स्टीयरिंग व्हील को छीन नहीं लेता है, और न ही यह शेफ पर चिल्लाता है। इसके बजाय, यह शेफ के विचारों को खतरे से दूर जाने के लिए धीरे से निर्देशित करता है, जैसे ही वे भटकने लगते हैं, यह सुनिश्चित करता है कि अंतिम व्यंजन खाने के लिए सुरक्षित हो, बिना खाना पकाने की प्रक्रिया को धीमा किए या स्वाद को खराब किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →