← नवीनतम पेपर
⚡ electrical engineering

Certifiable Safe RLHF: Semantic Grounding and Fixed Penalty Constraint Optimization for Safer LLM Alignment

यह शोध पत्र सर्टिफिएबल सेफ-आरएलएचएफ (CS-RLHF) प्रस्तुत करता है, जो एक नवीन ढांचा है जो प्रमाणिक सुरक्षा गारंटी प्रदान करने और नाममात्र एवं प्रतिकूल जेलब्रेक प्रॉम्प्ट्स के विरुद्ध दक्षता में महत्वपूर्ण सुधार करने के लिए पारंपरिक द्वैत-चरित (dual-variable) बाधित अनुकूलन को एक अर्थपूर्ण लागत मॉडल और एक सुधारे हुए दंड फॉर्मूलेशन (rectified penalty formulation) से प्रतिस्थापित करता है।

मूल लेखक: Kartik Pandit, Sourav Ganguly, Arnesh Banerjee, Shaahin Angizi, Arnob Ghosh

प्रकाशित 2026-06-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kartik Pandit, Sourav Ganguly, Arnesh Banerjee, Shaahin Angizi, Arnob Ghosh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, रचनात्मक रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो कहानियाँ लिख सकता है, सवालों के जवाब दे सकता है और होमवर्क में मदद कर सकता है। आप चाहते हैं कि यह हेल्पफुल (बेहतरीन जवाब दे) हो लेकिन साथ ही सेफ (कभी भी बम बनाने या लोगों को ठगने के निर्देश न दे) भी हो।

यह पेपर इन रोबोट्स को प्रशिक्षित करने का एक नया तरीका पेश करता है जिसे CS-RLHF कहा जाता है। यह समझने के लिए कि यह क्यों खास है, आइए देखते हैं कि पुराना तरीका कैसे काम करता था और उसमें तीन बड़ी समस्याएँ क्यों थीं, और फिर यह नया तरीका उन्हें कैसे ठीक करता है।

पुराना तरीका: "टेस्ट ऑफ टेस्ट" और "द नेगोशिएटर"

पहले, शोधकर्ता सुरक्षा सिखाने के लिए दो मुख्य उपकरणों का उपयोग करते थे:

  1. "टेस्ट ऑफ टेस्ट" (ब्रैडली-टेरी मॉडल):
    कल्पना कीजिए कि आप एक रोबोट को सिखाना चाहते हैं कि "सुरक्षित" भोजन क्या है। इसके बजाय कि आप उसे कहें, "यह सेब सुरक्षित है, यह ज़हर असुरक्षित है," आप उसे दो सेब दिखाते हैं और पूछते हैं, "कौन सा कम सड़ा हुआ लग रहा है?"

    • समस्या: यदि आप रोबोट को दो बिल्कुल अच्छे सेब दिखाते हैं, लेकिन एक पर एक छोटा सा, हानिरहित भूरा धब्बा है, तो रोबोट यह तय कर सकता है कि धब्बे वाला सेब "असुरक्षित" है क्योंकि वह दूसरे एकदम सही सेब की तुलना में थोड़ा खराब है। वह सापेक्ष (relative) तुलनाओं से भ्रमित हो जाता है। वह सुरक्षित चीजों को केवल इसलिए खतरनाक मानने लगता है क्योंकि वे किसी दूसरी चीज़ की तुलना में पूरी तरह सुरक्षित नहीं हैं।
    • पेपर का समाधान: CS-RLHF इस "टेस्ट ऑफ टेस्ट" को रोकता है। इसके बजाय, यह एक मानव विशेषज्ञ को हर एक जवाब को देखने और उसे एक सरल हाँ/नहीं लेबल देने के लिए नियुक्त करता है: "सुरक्षित" या "असुरक्षित"। यह रोबोट को एक भ्रमित करने वाले "कौन सा बेहतर है?" के खेल के बजाय एक स्पष्ट नियम पुस्तिका के साथ सिखाने जैसा है।
  2. "द नेगोशिएटर" (लैग्रेंजियन डुअल वेरिएबल्स):
    प्रशिक्षण के दौरान रोबोट को सुरक्षित रखने के लिए, पुराने तरीके में एक "नेगोशिएटर" (समझौता करने वाला) का उपयोग किया जाता था। यह एक वेरिएबल है जो लगातार अपना मन बदलता रहता है, और मददगार होने और सुरक्षित रहने के बीच संतुलन बनाने की कोशिश करता है।

    • समस्या: नेगोशिएटर चंचल होता है। यह लंबे समय में औसतन सुरक्षा की गारंटी तो देता है, लेकिन यह केवल औसत में सुरक्षा सुनिश्चित करता है। यदि आप अभी रोबोट से कोई कठिन सवाल पूछते हैं, तो नेगोशिएटर कह सकता है, "अरे, यह शायद ठीक ही होगा," और एक खतरनाक जवाब को निकलने दे सकता है। यह एक ऐसे सुरक्षा गार्ड की तरह है जो हर घंटे आपका आईडी चेक करता है लेकिन अगर आप उस पल में मिलनसार दिखते हैं, तो आपको अंदर जाने देता है।
    • पेपर का समाधान: CS-RLHF नेगोशिएटर को हटा देता है और उसकी जगह एक स्ट्रिक्ट गेटकीपर (कठोर द्वारपाल) को नियुक्त करता है। यह गेटकीपर एक "फिक्स्ड पेनल्टी" (निश्चित दंड) का उपयोग करता है। यदि रोबोट सुरक्षा रेखा पार करने की कोशिश करता है, तो तुरंत एक भारी, अपरिवर्तनीय दंड लगाया जाता है। यहाँ कोई बातचीत नहीं होती। यदि आप असुरक्षित हैं, तो आपको तुरंत एक बड़ा "फ्रौन" (दंड) मिलता है। यह गारंटी देता है कि रोबोट सख्ती से सुरक्षित क्षेत्र के भीतर रहना सीखे।
  3. "कीवर्ड ट्रिगर" की समस्या:
    पुराना सुरक्षा तंत्र एक ऐसे सुरक्षा गार्ड की तरह था जो केवल विशिष्ट शब्दों को देखता था। यदि किसी कहानी में "लॉक पिकिंग" (ताला तोड़ना) का उल्लेख था (भले ही वह एक काल्पनिक पुस्तक के लिए हो), तो गार्ड चिल्ला उठता "खतरा!" और कहानी को रोक देता। लेकिन अगर कोई बुरा आदमी अपनी योजना को छिपाने के लिए फैंसी शब्दों का उपयोग करता, तो गार्ड उसे मिस कर देता।

    • पेपर का समाधान: नया सिस्टम (CS-RLHF) एक सिमेंटिक क्लासिफायर (अर्थ संबंधी वर्गीकरणकर्ता) का उपयोग करता है। केवल कीवर्ड्स को स्कैन करने के बजाय, यह इरादे को समझने के लिए पूरी कहानी को पढ़ता है। यह जानता है कि उपन्यास में किसी पात्र द्वारा कहानी के लिए ताला तोड़ने और वास्तव में किसी को घर में घुसने का तरीका सिखाने के बीच क्या अंतर है। यह केवल शब्दों को नहीं, बल्कि अर्थ को समझता है।

परिणाम: एक सुरक्षित, स्मार्ट रोबोट

लेखकों ने इस नए सिस्टम का पुराने सिस्टम और अन्य शीर्ष तरीकों के मुकाबले परीक्षण किया। यहाँ उन्हें क्या मिला:

  • समझने में बेहतर: नए सिस्टम ने उन सुरक्षित जवाबों को सही ढंग से पहचाना जिनमें "डरावने" शब्द (जैसे कंप्यूटर क्लास के संदर्भ में "हैकिंग") शामिल थे, लगभग 92% बार, जबकि पुराना सिस्टम अक्सर भ्रमित होकर उन्हें ब्लॉक कर देता था।
  • धोखा देना कठिन: जब लोगों ने रोबोट को "जेलब्रेक" करने (रोबोट को खतरनाक जवाब देने के लिए मजबूर करने के लिए चालाकी भरे प्रयोग करने) की कोशिश की, तो नया सिस्टम बहुत कठिन पाया गया। इसने पुराने सिस्टम की तुलना में हानिकारक अनुरोधों को 5 गुना अधिक प्रभावी ढंग से अस्वीकार कर दिया।
  • मानव प्राथमिकता: जब मनुषनों से पुराने रोबोट और नए रोबोट के जवाबों के बीच चुनने के लिए कहा गया, तो उन्होंने नए रोबोट को मददगार और सुरक्षित दोनों होने के लिए लगभग 60% बार पसंद किया।

सारांश उपमा (Analogy)

एक रोबोट को प्रशिक्षित करने को एक नए कर्मचारी को प्रशिक्षित करने की तरह समझें:

  • पुराना तरीका: आप कर्मचारी को दो रिपोर्ट दिखाते हैं और पूछते हैं, "इनमें से कौन सी थोड़ी खराब है?" (सापेक्ष रैंकिंग)। आप एक ऐसे मैनेजर के साथ भी होते हैं जो काम के दबाव के आधार पर लगातार नियम बदलता रहता है (लैग्रेंगियन नेगोशिएशन)। इससे एक ऐसा कर्मचारी पैदा होता है जो वास्तव में क्या गलत है इसे लेकर भ्रमित रहता है और कभी-कभी तब भी नियम तोड़ देता है जब मैनेजर नहीं देख रहा होता।
  • नया तरीका (CS-RLHF): आप कर्मचारी को "अच्छी" और "बुरी" रिपोर्ट के विशिष्ट उदाहरणों के साथ एक स्पष्ट हैंडबुक देते हैं (एब्सोल्यूट लेबलिंग)। आप भी एक सख्त अलार्म सिस्टम स्थापित करते हैं जो तुरंत सायरन बजाता है यदि वे कुछ भी गलत करने की कोशिश करते हैं, बिना किसी अपवाद के (फिक्स्ड पेनल्टी)। कर्मचारी जल्दी सीखता है, नियमों की भावना को समझता है, और शायद ही कभी गलतियाँ करता है।

पेपर का दावा है कि यह नया तरीका AI मॉडल्स को कम मददगार बनाए बिना उन्हें काफी सुरक्षित और विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →