Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs
यह शोध पत्र गार्जियन-एज़-एन-एडवाइजर (GaaA) को प्रस्तुत करता है, जो एक सॉफ्ट-गेटिंग फ्रेमवर्क है जो एक प्रशिक्षित सलाहकार का उपयोग करके जोखिम लेबल और स्पष्टीकरण को पुन: अनुमान (re-inference) के लिए इनपुट संदर्भ के रूप में प्रदान करके LLM सुरक्षा को बढ़ाता है और ओवर-रिफ्यूज़ल को कम करता है, जिसे नए GuardSet डेटासेट द्वारा समर्थित किया गया है और न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ उच्च सटीकता प्रदर्शित की गई है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, रचनात्मक और सहायक रोबोट सहायक (LLM) है जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और सवालों के जवाब दे सकता है। लेकिन, किसी भी शक्तिशाली उपकरण की तरह, यह कभी-कभी भ्रमित हो सकता है, झूठ बोल सकता है, या अगर कोई इसे चकमा दे दे तो अनजाने में कुछ खतरनाक कह सकता है।
चीजों को सुरक्षित रखने के लिए, कंपनियाँ आमतौर पर रोबोट के सामने एक सुरक्षा गार्ड रखती हैं।
पुराना तरीका: द "बाउंसर" (हार्ड गेटिंग)
पारंपरिक रूप से, यह सुरक्षा गार्ड एक विशिष्ट क्लब के सख्त बाउंसर की तरह काम करता है।
- यह कैसे काम करता है: यदि बाउंसर को कुछ भी संदिग्ध लगता है, तो वह तुरंत दरवाजा बंद कर देता है और कहता है, "प्रवेश निषेध! आप अंदर नहीं आ सकते।"
- समस्या: यह बहुत आक्रामक है। कभी-कभी एक उपयोगकर्ता ऐसा सवाल पूछता है जो वास्तव में सुरक्षित है लेकिन सुनने में थोड़ा अजीब लगता है (जैसे रोमांस उपन्यास के लिए "स्टीमी" ट्रेन दृश्यों के बारे में पूछना)। बाउंसर घबरा जाता है, दरवाजा बंद कर देता है, और उपयोगकर्ता को कुछ नहीं मिलता। इसे ओवर-रिफ्यूज़ल (अत्यधिक इनकार) कहा जाता है। यह रोबोट को रचनात्मक या जटिल कार्यों के लिए बेकार बना देता है।
- अंधा मोड़ (ब्लाइंड स्पॉट): बाउंसर केवल "बुरी" चीजों को देखता है। वे यह नहीं देखते कि क्या रोबोट ईमानदार है (उदाहरण के लिए, मौसम के बारे में जानने का नाटक करना जबकि उसे पता नहीं है) या क्या रोबोट टाइपो (वर्तनी की गलती) और स्लैंग (बोलचाल की भाषा) से भ्रमित हो रहा है।
नया तरीका: द "एडवाइजर" (गार्जियन-एज़-एन-एडवाइजर)
यह पेपर एक नई प्रणाली पेश करता है जिसे गार्जियन-एज़-एन-एडवाइजर (GaaA) कहा जाता है। एक बाउंसर की तरह जो दरवाजे पटक देता है, इसके बजाय एक बुद्धिमान कोच की कल्पना करें जो रोबोट के ठीक बगल में खड़ा है।
यहाँ यह नया सिस्टम कैसे काम करता है, एक सरल उपमा (analogy) का उपयोग करते हुए दिया गया है:
1. कोच का काम (द गार्जियन मॉडल)
जब कोई उपयोगकर्ता प्रश्न पूछता है, तो कोच (नया AI मॉडल) पहले उसे पढ़ता है।
- यदि प्रश्न खतरनाक है: कोच रोबोट को रोकता नहीं है। इसके बजाय, कोच रोबोट के कान में चेतावनी फुसफुसाता है: "हे, यह सवाल पेचीदा है। इसमें गोपनीयता के जोखिम शामिल हैं। सावधान रहें और वास्तविक नाम न दें।"
- यदि प्रश्न सुरक्षित लेकिन पेचीदा है: कोच कह सकता है: "यह एक सुरक्षित प्रश्न है, लेकिन इसमें बहुत सारी वर्तनी की गलतियाँ हैं। स्पेलिंग की गलतियों से भ्रमित न हों।" या "यह वास्तविक समय के डेटा के बारे में पूछ रहा है जो आपके पास नहीं है। ईमानदार रहें और कहें कि आप लाइव मौसम की जांच नहीं कर सकते।"
2. रोबोट की प्रतिक्रिया (द सॉफ्ट गेटिंग)
ब्लॉक होने के बजाय, रोबोट को उपयोगकर्ता के प्रश्न के साथ यह सलाह (advice) जुड़कर मिलती है।
- रोबोट उपयोगकर्ता के प्रश्न और कोच की सलाह दोनों को पढ़ता है।
- रोबोट फिर उत्तर देता है, लेकिन वह सावधानी से उत्तर देता है। वह कह सकता है, "मैं वास्तविक नाम नहीं दे सकता, लेकिन मैं एक काल्पनिक कहानी लिख सकता हूँ..."
- परिणाम: उपयोगकर्ता को एक सपाट "नहीं" के बजाय एक सहायक उत्तर मिलता है। रोबोट सुरक्षित रहता है, लेकिन वह अपनी उपयोगिता नहीं खोता है।
सफलता के लिए आवश्यक तत्व
इस कोच को वास्तव में अच्छा बनाने के लिए, शोधकर्ताओं ने दो विशेष चीजें बनाईं:
1. प्रशिक्षण नियमावली (GuardSet)
उन्होंने 208,000 उदाहरणों की एक विशाल लाइब्रेरी बनाई। यह केवल "बुरे" चीजों की सूची नहीं है। इसमें शामिल हैं:
- बुरी चीजें: घृणास्पद भाषण (hate speech), जेलब्रेक, गोपनीयता लीक।
- अच्छी चीजें जिन्हें सावधानी की आवश्यकता है: टाइपो (वर्तनी की गलती) वाले प्रश्न (Robustness) और वे प्रश्न जहाँ रोबोट अपनी सीमाओं के बारे में झूठ बोल सकता है (Honesty)।
- उपमा: यह एक कोच को प्रशिक्षित करने जैसा है कि न केवल लड़ाई को कैसे रोका जाए, बल्कि यह भी कि एक ऐसे खिलाड़ी को कैसे संभाला जाए जो भ्रमित है या जो ब्लफ (धोखा देने की कोशिश) करने की कोशिश कर रहा है।
2. प्रशिक्षण शिविर (GuardAdvisor)
उन्होंने अपने नए कोच मॉडल को दो चरणों वाली प्रक्रिया का उपयोग करके प्रशिक्षित किया:
- चरण 1 (SFT): उन्होंने मॉडल को हजारों "प्रश्न -> सलाह" के जोड़े दिखाए ताकि वह शैली सीख सके।
- चरण 2 (RL): उन्होंने एक खेल खेला जहाँ मॉडल ने सलाह देने की कोशिश की। यदि सलाह ईमानदार थी और खतरे के स्तर से मेल खाती थी, तो उसे एक पॉइंट मिला। यदि उसने झूठ बोला या गलत सलाह दी, तो उसका पॉइंट कट गया। इसने मॉडल को सुसंगत और विश्वसनीय बनना सिखाया।
यह क्यों मायने रखता है
- कम "नहीं, मैं मदद नहीं कर सकता": रोबोट सुरक्षित लेकिन जटिल प्रश्नों को देने से मना करना बंद कर देता है।
- अधिक ईमानदार: रोबोट स्वीकार करता है जब वह कुछ नहीं जानता या जब उससे कुछ ऐसा करने को कहा जाता है जो वह नहीं कर सकता।
- तेज़: कोच बहुत छोटा और तेज़ है। यह बातचीत में लगभग कोई देरी नहीं जोड़ता है (5% से कम अतिरिक्त समय)।
- सुरक्षित: यह रोबोट को बुरा काम करने से रोकता है, लेकिन यह उसे बंद करने के बजाय उसे मार्गदर्शन देकर करता है।
सारांश
पुराने सिस्टम को एक सुरक्षा गार्ड के रूप में सोचें जो आपको इमारत से बाहर निकाल देता है यदि आप संदिग्ध दिखते हैं।
नए सिस्टम (GaaA) को एक सुरक्षा गार्ड के रूप में सोचें जो आपको एक नक्शा थमाता है और कहता है, "आप अंदर जा सकते हैं, लेकिन बाईं ओर के फिसलन भरे फर्श से सावधान रहें और लाल बटन को न छुएं।"
परिणाम? आप इमारत के अंदर जाते हैं, आप सुरक्षित रहते हैं, और आप वास्तव में प्रदर्शनियों को देख पाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।