← नवीनतम पेपर
🤖 machine learning

ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

प्रोबगार्ड (ProbGuard) एक अभिनव, आर्किटेक्चर-अज्ञेय (architecture-agnostic) संभाव्य गार्डरेल है जो असुरक्षित जनरेशन को रोकने के लिए प्रारंभिक एलएलएम (LLM) आउटपुट वितरण और मोंटे-कार्लो सैंपलिंग का लाभ उठाकर सुरक्षा जोखिमों का अनुमान और अंशांकन करता है, जिससे मौजूदा नियतात्मक वर्गीकरण विधियों की तुलना में असुरक्षित जनरेशन को रोकने की अधिक सटीक प्रारंभिक क्षमता सक्षम होती है और जेलब्रेक सफलता दर में भारी कमी आती है।

मूल लेखक: Xinzhe Huang, Biwu Yao, Kedong Xiu, Mengnan Zhao, Di Wang, Puning Zhao, Tianhang Zheng

प्रकाशित 2026-08-12
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinzhe Huang, Biwu Yao, Kedong Xiu, Mengnan Zhao, Di Wang, Puning Zhao, Tianhang Zheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जादू का शो देख रहे हैं जहाँ जादूगर एक सुपर-स्मार्ट रोबोट है जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है, या एक दोस्त की तरह चैट भी कर सकता है। यह रोबोट एक लार्ज लैंग्वेज मॉडल (LLM) है। यह अविश्वसनीय रूप से प्रतिभाशाली है, लेकिन किसी भी शक्तिशाली उपकरण की तरह, इसका एक काला पक्ष भी है: कभी-कभी इसे कुछ खतरनाक, बुरा या अवैध बोलने के लिए बहकाया जा सकता है, जैसे कि बम कैसे बनाया जाए या किसी को कैसे चोट पहुँचाई जाए। यह उन सभी लोगों के लिए एक बड़ी चिंता है जो वास्तविक दुनिया में इन रोबों का उपयोग कर रहे हैं।

रोबोट को बुरे विचार उगलने से रोकने के लिए, हम आमतौर पर एक "गार्डरेल" (guardrail) लगाते हैं। गार्डरेल को एक क्लब के सख्त बाउंसर की तरह समझें। अतीत में, यह बाउंसर केवल उस पूरे वाक्य को देखता था जो रोबोट ने लिखा था। यदि वाक्य बुरा दिखता था, तो बाउंसर उसे बाहर निकाल देता था। लेकिन, एक समस्या थी: बाउंसर बहुत धीमा था। जब तक बाउंसर रोबोट का पूरा वाक्य खत्म होने का इंतज़ार करता, तब तक नुकसान पहले ही हो चुका होता। साथ ही, बाउंसर थोड़ा ब्लैक-एंड-व्हाइट (स्पष्ट और सीमित) था। वह यह नहीं समझ पाता था कि रोबोट आगे क्या कहने के बारे में अनिश्चित था। यह ऐसा था जैसे बाउंसर केवल अंतिम टिकट को चेक करता, जबकि रोबोट के हाथों की घबराहट भरी थरथराहट को अनदेखा कर देता जब वह अभी भी कुछ कहने का निर्णय ले रहा होता।

यहीं पर ProbGuard नामक एक नया विचार आता है। पुराने गार्डरेल के विपरीत, ProbGuard एक अत्यंत चौकस जासूस की तरह काम करता है जो रोबोट के सोचने की प्रक्रिया को तब देखता है जब वह अभी भी चल रही होती है। यह केवल उन शब्दों को नहीं देखता जो रोबोट ने पहले ही टाइप कर दिए हैं; यह देखता है कि अगला शब्द बोलने के बारे में रोबोट की "अंतरात्मा की आवाज़" या "अंतर्ज्ञान" (gut feeling) क्या कह रहा है। यह गणना करता है कि अगले कुछ सेकंड में रोबोट के पटरी से उतरने की कितनी संभावना है। यदि जासूस देखता है कि रोबोट के अगले कुछ सेकंड में कुछ खतरनाक कहने की 90% संभावना है, तो ProbGuard तुरंत आपातकालीन ब्रेक लगा देता है, जिससे रोबोट का वाक्य पूरा होने से पहले ही उसे रोक दिया जाता है। यह एक कार को लड़खड़ाते हुए देखने और दुर्घटना होने से पहले उसे रोकने जैसा है, न कि दुर्घटना होने के बाद पुलिस बुलाने जैसा।

पुराने गार्डरेल्स के साथ समस्या

यह शोध पत्र बताता है कि पुराना तरीका "शब्द पहचानो" (Guess the Word) के खेल जैसा है जहाँ आपको केवल अंतिम उत्तर ही दिखाई देता है। वर्तमान सुरक्षा प्रणालियों में से अधिकांश एक साधारण क्लासिफायर (classifier) की तरह काम करती हैं: वे एक पूरा वाक्य लेती हैं और कहती हैं, "सुरक्षित" या "असुरक्षित"।

लेखक तर्क देते हैं कि इसके दो बड़े दोष हैं:

  1. यह बहुत देर से होता है: जब तक वाक्य पूरा हो जाता है, तब तक खराब आउटपुट को रोकना बहुत देर हो चुकी होती है।
  2. यह "शायद" को अनदेखा करता है: सुरक्षा हमेशा हाँ या ना का सवाल नहीं होती, खासकर जब रोबोट अभी भी सोच रहा हो। एक रोबोट एक ऐसा वाक्य शुरू कर सकता है जो निर्दोष दिखता है लेकिन आसानी से एक खतरनाक वाक्य में बदल सकता है। पुराने सिस्टम रोबोट की आंतरिक "अनिश्चितता" को फेंक देते हैं और केवल अंतिम टेक्स्ट को देखते हैं। वे इस तथ्य को अनदेखा करते हैं कि रोबोट हिचकिचा रहा था या कई अलग-अलग रास्तों पर विचार कर रहा था, जिनमें से कुछ सुरक्षित और कुछ खतरनाक थे।

ProbGuard कैसे काम करता है: क्रिस्टल बॉल दृष्टिकोण

ProbGuard खेल को बदल देता है क्योंकि यह सुरक्षा को एक साधारण लेबल के बजाय एक संभाव्यता (probability) के रूप में मानता है। कल्पना कीजिए कि रोबोट एक चौराहे पर खड़ा है। पुराने गार्डरेल इंतज़ार करते हैं कि रोबोट एक रास्ता चुने और उस पर चले, फिर देखते हैं कि क्या वह रास्ता खाई की ओर जाता है। हालाँकि, ProbGuard उस नक्शे को देखता है जिसे रोबोट पकड़े हुए है जबकि वह वहीं खड़ा है।

यहाँ वह स्टेप-बाय-स्टेप जादू का तरीका है जिसे ProbGuard अपनाता है:

1. "क्या होगा अगर" सिमुलेशन (मोंटे कार्लो सैंपलिंग - Monte Carlo Sampling)
यह जानने के लिए कि रोबोट का वर्तमान विचार कितना खतरनाक है, ProbGuard एक सरल प्रश्न पूछता है: "यदि हम इस रोबोट को ठीक इसी क्षण से बोलना जारी रखने दें, तो इसके कुछ बुरा कहने की क्या संभावना है?"
चूंकि हम भविष्य की भविष्यवाणी पूरी तरह से नहीं कर सकते, इसलिए ProbGuard अपने दिमाग में इस परिदृश्य को हजारों बार चलाता है। यह सिमुलेट करता है कि रोबोट इस वाक्य को 16 अलग-अलग तरीकों से पूरा करेगा (जैसे कि संभावना देखने के लिए पासा 16 बार फेंकना)। यदि 16 में से 15 बार रोबोट कुछ सुरक्षित कहता है, लेकिन 1 बार वह कुछ खतरनाक कहता है, तो ProbGuard जानता है कि इसमें एक छोटा सा जोखिम है। यदि 16 में से 10 बार वह कुछ बुरा कहता है, तो जोखिम अधिक है। यह इसे एक सटीक "खतरे का स्कोर" (0 और 1 के बीच की संख्या) देता है, न कि केवल एक साधारण "सुरक्षित/असुरक्षित" लेबल।

2. अगले शब्द के "भूत" (Ghost) को पढ़ना
जब एक रोबोट टेक्स्ट जनरेट करता है, तो वह केवल एक शब्द नहीं चुनता; वह हर संभव अगले शब्द के लिए संभावना की गणना करता है। उदाहरण के लिए, यदि रोबोट कहने वाला है "आकाश...", तो वह सोच सकता है: "नीला" (30% संभावना), "हरा" (5% संभावना), "आग की लपटों में" (2% संभावना)।
पुराने सिस्टम आमतौर पर केवल "नीला" शब्द को देखते हैं क्योंकि इसकी संभावना सबसे अधिक है। हालाँकि, ProbGuard संभावनाओं की पूरी सूची को देखता है। वह देखता है कि "आग की लपटों में" की एक बहुत छोटी संभावना है, लेकिन यदि वह छोटी सी संभावना किसी आपदा की ओर ले जाती है, तो वह मायने रखती है। ProbGuard इस पूरी संभावना सूची को एक विशेष कोड ("प्रोबेबिलिटी-वेटेड रिप्रेजेंटेशन") में बदल देता है जिसे वह बिना रोबोट के गुप्त मस्तिष्क (हिडन स्टेट्स) में झाँके पढ़ सकता है। यह सुनिश्चित करता है कि ProbGuard किसी एक विशिष्ट ब्रांड के बजाय किसी भी प्रकार के रोबोट के साथ काम कर सके।

3. जल्दी रोकना (The Early Stop)
एक बार जब ProbGuard खतरे के स्कोर की गणना कर लेता है, तो यह तुरंत कार्य कर सकता है। शोध पत्र दिखाता है कि ProbGuard केवल पहले 10 शब्दों (या डिकोडिंग स्टेप्स) को देखकर यह तय कर सकता है कि क्या यह खतरनाक होने वाला है। यदि खतरे का स्कोर बहुत अधिक है, तो ProbGuard रोबोट को वहीं रोक देता है।

आंकड़े क्या कहते हैं

शोधकर्ताओं ने 13 अन्य सुरक्षा विधियों के विरुद्ध ProbGuard का परीक्षण किया, जिसमें Llama-Guard3 और ShieldGemma जैसे वर्तमान शीर्ष गार्ड शामिल हैं। उन्होंने यह देखने के लिए कि कौन सा तरीका परेशानी की भविष्यवाणी करने में सबसे अच्छा है, तीन अलग-अलग प्रकार के रोबोटों और तीन अलग-अलग खतरनाक प्रश्नों के सेट का उपयोग किया।

  • कैलिब्रेशन (Calibration): यह एक तकनीकी शब्द है जिसका अर्थ है "रोबोट अपने स्वयं के जोखिम के बारे में कितना ईमानदार है।" यदि ProbGuard कहता है कि खतरे की 90% संभावना है, तो क्या वास्तव में 90% बार ऐसा होता है? शोध में पाया गया कि ProbGuard अन्य सभी की तुलना में इस मामले में कहीं अधिक बेहतर था। इसने पिछले सबसे अच्छे तरीके की तुलना में अपने जोखिम अनुमानों में लगभग 79.6% की कमी की।
  • हमलों को रोकना (Stopping Attacks): टीम ने रोबोटों को धोखा देने के लिए छह अलग-अलग "जेलब्रेक" तकनीकों (सुरक्षा नियमों को अनदेखा करने के लिए विशेष ट्रिक्स) का उपयोग किया। ProbGuard अविश्वसनीय रूप से प्रभावी था। केवल पहले 10 शब्दों को देखकर, इसने हमलों को लगभग पूरी तरह से रोक दिया, जिससे इन ट्रिक्स की सफलता दर अधिकतम 1% तक सीमित हो गई। तुलना में, सबसे अच्छा पुराना गार्डरेल लगभग 2.4% हमलों को सफल होने देता था।
  • गति (Speed): ProbGuard तेज़ भी है। यह 1,000 सैंपल को लगभग 36.4 सेकंड में चेक कर सकता है, जो कुछ भारी-भरक सुरक्षा प्रणालियों की तुलना में लगभग 52.7% तेज़ है।

निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि ProbGuard एक बड़ी प्रगति है क्योंकि यह सुरक्षा को केवल "हाँ या ना" की चेकलिस्ट के रूप में नहीं देखता। इसके बजाय, यह सुरक्षा को एक तरल, बदलते हुए संभाव्यता के रूप में मानता है जिसे रोबोट के सोचते समय ही मापा और प्रबंधित किया जा सकता है।

रोबोट के अपने "अंतर्ज्ञान" (आउटपुट डिस्ट्रीब्यूशन) का उपयोग करके और कई संभावित भविष्यों का सिमुलेशन करके, ProbGuard खतरनाक विचारों को पूर्ण वाक्य बनने से पहले ही पकड़ सकता है। यह विभिन्न रोबोट मॉडलों के साथ काम करता है, उन्हें उनके गुप्त मस्तिष्क में झाँकने की आवश्यकता नहीं है, और यह सब उच्च सटीकता और गति के साथ करता है। लेखक सुझाव देते हैं कि यह दृष्टिकोण हमें सुरक्षित AI सिस्टम बनाने की अनुमति देता है जिन्हें गलती के पहले क्षणों में ही रोका जा सकता है, न कि पूरी आपदा होने का इंतज़ार करना पड़ता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →