← नवीनतम पेपर
💬 NLP

Configurable Reward Model for Balanced Safety Alignment

यह शोध पत्र कॉन्फ़िगरेबल सेफ्टी रिवॉर्ड मॉडल (CSRM) को प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो विषम और विकसित होती सुरक्षा आवश्यकताओं के अनुकूल होने में सक्षम रिवॉर्ड मॉडल बनाने के लिए कॉन्फ़िगरेशन-लक्षित डेटा ऑग्मेंटेशन का लाभ उठाता है, जिससे कॉन्फ़िगरेबल सेफ्टी बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है और संरेखित लार्ज लैंग्वेज मॉडल्स में हेल्पफुलनेस-सेफ्टी ट्रेडऑफ़ में महत्वपूर्ण सुधार होता है।

मूल लेखक: Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj, Manik Bhandari, Mayur Srungarapu, Anqi Liu, Benjamin Van Durme, Li Chen

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj, Manik Bhandari, Mayur Srungarapu, Anqi Liu, Benjamin Van Durme, Li Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करते हुए शोध पत्र "Configurable Reward Model for Balanced Safety Alignment" का स्पष्टीकरण दिया गया है।

बड़ी समस्या: एक आकार सबके लिए उपयुक्त नहीं होता (One Size Does Not Fit All)

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल या LLM) है। आप चाहते हैं कि यह रोबोट मददगार हो, लेकिन आप यह भी चाहते हैं कि यह सुरक्षित भी रहे।

समस्या यह है कि "सुरक्षा" (safety) का अर्थ इस बात पर निर्भर करता है कि आप कहाँ हैं और क्या कर रहे हैं:

  • एक रचनात्मक लेखन कक्षा में: एक विलेन द्वारा बैंक लूटने की कहानी रोमांचक और सुरक्षित हो सकती है।
  • एक बैंक में: वही कहानी सुरक्षा प्रोटोकॉल का उल्लंघन है।
  • एक अस्पताल में: मरीज के बारे में एक कहानी को सख्त गोपनीयता की आवश्यकता हो सकती है।

वर्तमान में, अधिकांश AI सुरक्षा प्रणालियाँ "जमी हुई मूर्तियों" की तरह हैं। एक बार बनने के बाद, वे बदल नहीं सकतीं। यदि किसी कंपनी को अपने सुरक्षा नियमों को अपडेट करने की आवश्यकता है (जैसे "पैसे के बारे में बात न करने" का नया नियम जोड़ना), तो इंजीनियरों को सब कुछ रोकना पड़ता है, नए मानव शिक्षकों को इकट्ठा करना पड़ता है, रोबोट को फिर से शुरू से प्रशिक्षित (retrain) करना पड़ता है और उम्मीद करनी पड़ती है कि वह नया नियम सीख जाए। यह प्रक्रिया धीमी, महंगी है और अक्सर इससे रोबोट किसी भी सवाल का जवाब देने से डरने लगता है (जिसे "ओवर-रिफ्यूज़ल" या अत्यधिक इनकार की समस्या कहा जाता है)।

समाधान: "कॉन्फ़िगरेबल सेफ्टी रिवॉर्ड मॉडल" (CSRM)

लेखक एक नई प्रणाली पेश करते हैं जिसे CSRM कहा जाता है। CSRM को एक मूर्ति के रूप में नहीं, बल्कि एक स्मार्ट, एडजस्टेबल थर्मोस्टेट के रूप में सोचें।

"सुरक्षा" के लिए एक निश्चित सेटिंग रखने के बजाय, CSRM आपको हर बातचीत के लिए एक विशिष्ट "सुरक्षा नियमावली" (जो साधारण अंग्रेजी में लिखी गई हो) प्लग इन करने की अनुमति देता है।

  • इनपुट (Input): आप रोबोट को बातचीत साथ ही नियमों का एक विशिष्ट सेट देते हैं (जैसे, "इस मूवी स्क्रिप्ट के लिए, हिंसा ठीक है, लेकिन घृणास्पद भाषण (hate speech) नहीं")।
  • आउटपुट (Output): CSRM केवल "हाँ/नहीं" नहीं कहता। यह एक स्कोर (जैसे 0 से 100 तक का ग्रेड) देता है जो रोबोट को बताता है कि उन विशिष्ट नियमों के आधार पर प्रतिक्रिया कितनी सुरक्षित या असुरक्षित है।

यह कैसे काम करता है: "शेफ की रसोई" की उपमा (The "Chef's Kitchen" Analogy)

यह समझने के लिए कि उन्होंने इस मॉडल को कैसे प्रशिक्षित किया, एक शेफ (AI) की कल्पना करें जिसे विभिन्न आहार संबंधी प्रतिबंधों (dietary restrictions) के लिए खाना बनाना सीखना है।

  1. पुराना तरीका (Static Training): आप शेफ को सिखाते हैं, "कभी भी सूअर का मांस (pork) न पकाएं।" शेफ इस नियम को हमेशा के लिए सीख लेता है। यदि आप बाद में "पोरक-मुक्त लेकिन मसालेदार" व्यंजन मांगते हैं, तो शेफ कुछ भी पकाने से मना कर सकता है क्योंकि वह भ्रमित है या गलती करने से डर रहा है।
  2. CSRM का तरीका (Configurable Training):
    • "मेन्यू" संवर्धन (The "Menu" Augmentation): शोधकर्ताओं ने एक विशेष प्रशिक्षण विधि बनाई। उन्होंने वास्तविक बातचीत ली और एक स्मार्ट AI से नए "मेन्यू नियम" बनाने को कहा।
      • परिदृश्य A: "एक नियम जोड़ें कि 'सूअर का मांस नहीं चाहिए'।" (शेफ सूअर के मांस से बचना सीखता है)।
      • परिदृश्य B: "नियम जोड़ें कि 'सूअर का मांस ठीक है, लेकिन शराब नहीं'।" (शेफ वाइन के बिना सूअर का मांस बनाना सीखता है)।
    • "गंभीरता" संवर्धन (The "Severity" Augmentation): उन्होंने शेफ को यह भी सिखाया कि एक छोटी गलती और एक बड़ी गलती के बीच क्या अंतर होता है।
      • परिदृश्य: "गलती से एक बार 'पोरक' कहना एक मामूली चूक है (कम दंड/penalty)।"
      • परिदृश्य: "एक सख्त शाकाहारी को पूरा सूअर परोस देना एक बड़ी आपदा है (उच्च दंड/penalty)।"
    • परिणाम: शेफ दिन का विशिष्ट मेन्यू पढ़ना और तुरंत उसके अनुसार ढलना सीख जाता है, बिना दोबारा कुलीनता विद्यालय (culinary school) जाए।

यह अन्य प्रणालियों से बेहतर क्यों है?

यह शोध पत्र CSRM की तुलना दो अन्य प्रकार की सुरक्षा प्रणालियों से करता है:

  1. "बाउंसर" (मानक क्लासिफायर - Standard Classifiers): ये दरवाजे पर खड़े होते हैं और बस "अंदर" या "बाहर" कहते हैं। ये तेज़ हैं, लेकिन वे एक "थोड़े जोखिम भरे" मजाक और एक "खतरनाक" धमकी के बीच अंतर नहीं कर सकते। वे बहुत रूखे (blunt) हैं।
  2. "न्यायाधीश" (रीज़निंग मॉडल - Reasoning Models): ये वकीलों की तरह हैं जो लंबे निबंध लिखते हैं कि कोई चीज़ बुरी क्यों है। वे सटीक हैं लेकिन बहुत धीमे हैं और AI को प्रशिक्षित करने के लिए कठिन हैं।

CSRM "स्कोरकीपर" (Scorekeeper) है: यह एक सटीक संख्या (रिवॉर्ड स्कोर) देता है जो AI को बताता है कि उसने वास्तव में कैसा प्रदर्शन किया। यह AI को कदम-दर-कदम अपना व्यवहार सुधारने की अनुमति देता है, बजाय इसके कि उसे केवल "गलत!" या "सही!" कहा जाए।

परिणाम: एक बेहतर संतुलन

शोधकर्ताओं ने विभिन्न सुरक्षा बेंचमार्क पर CSRM का परीक्षण किया और पाया:

  • यह तुरंत अनुकूलित होता है: यह बिना पुनरप्रशिक्षण (retraining) के उन नए सुरक्षा नियमों को संभाल सकता है जिन्हें इसने पहले कभी नहीं देखा।
  • यह "ओवर-रिफ्यूज़ल" को रोकता है: क्योंकि यह नियमों की बारीकियों (nuance) को समझता है, यह हर चीज़ को "ना" नहीं कहता। यह उस मध्य मार्ग को खोज लेता है जहाँ AI मददगार और सुरक्षित दोनों होता है।
  • यह एक "पारेटो फ्रंटियर" (Pareto Frontier) बनाता है: यह एक तकनीकी शब्द है जिसका अर्थ है कि यह सर्वोत्तम संभव संतुलन प्राप्त करता है। आप सुरक्षा खोए बिना अधिक उपयोगिता प्राप्त करते हैं, या उपयोगिता खोए बिना अधिक सुरक्षा प्राप्त करते हैं। यह संभावनाओं की सीमाओं को आगे बढ़ाता है।

सारांश

यह शोध पत्र एक नया उपकरण प्रस्तुत करता है जो AI सुरक्षा को लचीला (flexible) बनाता है। सुरक्षा नियमों को हार्ड-कोड करने के बजाय (जो दुनिया बदलने पर टूट जाते हैं), CSRM एक डायनेमिक ट्रांसलेटर की तरह कार्य करता है जो स्थिति के विशिष्ट सुरक्षा नियमों को पढ़ता है और AI को उन सीमाओं के भीतर पूर्ण रूप से व्यवहार करने के लिए निर्देशित करता है। यह AI को सुरक्षित, स्मार्ट और कम परेशान करने वाला बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →