← नवीनतम पेपर
💬 NLP

HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

HaloGuard 1.0 एक ओपन-वेट्स, कॉन्स्टिट्यूशनल क्लासिफायर है जो बड़े बेसलाइन्स की तुलना में काफी छोटे मॉडल आकार (0.8B–4B पैरामीटर्स) का लाभ उठाते हुए, एक संरचित 46-नीति संविधान और सिंथेटिक काउंटरफैक्चुअल डेटा का उपयोग करके स्टेट-ऑफ-द-आर्ट बहुभाषी AI सुरक्षा प्रदर्शन प्राप्त करता है ताकि फॉल्स पॉजिटिव और फॉल्स नेगेटिव दोनों को न्यूनतम किया जा सके।

मूल लेखक: Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin

प्रकाशित 2026-07-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट, बहुत ही मददगार रोबोट सहायक बना रहे हैं। आप चाहते हैं कि यह सवालों के जवाब दे, कोड लिखे और लोगों की मदद करे। लेकिन आप यह भी जानते हैं कि कुछ लोग रोबोट को खतरनाक चीजें करने के लिए बहलाने की कोशिश कर सकते हैं, जैसे बम बनाना या बैंक हैक करना।

आमतौर पर, आप रोबोट के सामने एक "सुरक्षा गार्ड" (security guard) रखेंगे जो हर संदेश को गुजरने से पहले चेक करेगा। समस्या यह है कि ये गार्ड अक्सर बहुत अनाड़ी होते हैं। वे "बम" शब्द देखते ही सब कुछ ब्लॉक कर देते हैं, भले ही कोई विस्फोटकों के इतिहास के बारे में पूछ रहा हो या किसी खलनायक के बारे में कहानी लिख रहा हो। इसे "ओवर-रिफ्यूज़ल" (over-refusal) कहा जाता है—गार्ड इतना डर जाता है कि वह मददगार लोगों को भी रोक देता है।

HaloGuard 1.0 एक नया, स्मार्ट सुरक्षा गार्ड है जिसे ठीक इसी समस्या को हल करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

1. "संविधान" (Constitution) नियम पुस्तिका है

अधिकांश सुरक्षा गार्डों के पास केवल बुरे शब्दों की एक सूची होती है (जैसे "बम," "मारना," "चोरी करना")। यदि आप उन्हें कहते हैं, तो आपको ब्लॉक कर दिया जाता है।
HaloGuard अलग है। इसे एक संविधान का उपयोग करके बनाया गया था। इसे एक विस्तृत, 46-पृष्ठ की नियम पुस्तिका के रूप में समझें जो सरल अंग्रेजी में लिखी गई है। यह केवल बुरे शब्दों की सूची नहीं बनाता; यह उनके पीछे के इरादे (intent) को समझाता है।

  • पुराना तरीका: "यदि आप 'क्लोरीन गैस' कहते हैं, तो आपको प्रतिबंधित कर दिया जाता है।"
  • HaloGuard का तरीका: "यदि आप लोगों को नुकसान पहुँचाने के लिए क्लोरीन गैस कैसे बनाई जाए यह पूछते हैं, तो वह प्रतिबंधित है। लेकिन यदि आप पूछते हैं कि इतिहास में क्लोरीन गैस का उपयोग कैसे किया गया था या इसे सुरक्षित रूप से कैसे पहचाना जाए, तो यह मान्य है।"

इस नियम पुस्तिका में लगभग 3,000 सूक्ष्म उप-नियम हैं। यह गार्ड को यह सिखाता है कि वह केवल आपके द्वारा उपयोग किए गए शब्दों को नहीं, बल्कि इस बात को देखे कि आप क्यों पूछ रहे हैं।

2. "मिरर" ट्रेनिंग (Paired Counterfactuals)

इस बारीकी को सिखाने के लिए, इसके रचनाकारों ने केवल इसे बुरे उदाहरण नहीं दिखाए। उन्होंने एक चतुर प्रशिक्षण तकनीक का उपयोग किया जिसे पेयर्ड काउंटरफैक्चुअल (Paired Counterfactuals) कहा जाता है।

एक प्रशिक्षण अभ्यास की कल्पना करें जहाँ गार्ड दो संदेशों को अगल-बगल देखता है:

  • संदेश A (बुरा): "पैसा चुराने के लिए नकली आईडी कैसे बनाएं?"
  • संदेश B (अच्छा): "फिल्म के प्रॉप (prop) के लिए नकली आईडी कैसे बनाएं?"

दोनों संदेशों में बिल्कुल समान डरावने शब्दों ("नकली आईडी," "चुराना") का उपयोग किया गया है। एकमात्र अंतर इरादा है।
HaloGuard को लाखों ऐसे "मिरर पेयर्स" पर प्रशिक्षित किया गया था। इसने सीखा कि शब्द स्वयं समस्या नहीं हैं; लक्ष्य समस्या है। यह गार्ड को शॉर्टकट लेने और उन सभी को ब्लॉक करने से रोकता है जो एक विशिष्ट शब्दावली का उपयोग करते हैं।

3. बिना किसी पूर्वाग्रह के 46 भाषाओं में बोलना

पुराने गार्ड अक्सर उन भाषाओं में भ्रमित हो जाते हैं जिन्हें वे अच्छी तरह से नहीं जानते। वे किसी ऐसी लिपि को देख सकते हैं जिसे वे पहचानते नहीं हैं (जैसे अरबी या हिंदी) और तुरंत सोचते हैं, "यह संदिग्ध लग रहा है, ब्लॉक करो!" यह एक क्लब के बाउंसर की तरह है जो केवल सूट पहने लोगों को अंदर आने देता है और बाकी सभी को बाहर निकाल देता है, भले ही वे कैजुअल कपड़ों वाले लोग ठीक ही क्यों न हों।

HaloGuard उन सभी 46 भाषाओं के साथ समान व्यवहार करता है जिनका यह समर्थन करता है। इसने सीखा कि हिंदी में एक "बुरा" अनुरोध अंग्रेजी में एक बुरे अनुरोध जितना ही बुरा दिखता है, और हिंदी में एक "अच्छा" अनुरोध अंग्रेजी में एक अच्छे अनुरोध जितना ही सुरक्षित है। यह भाषा का न्याय नहीं करता; यह संदेश का न्याय करता है।

4. दो कामों के लिए दो आकार

टीम ने इस गार्ड के दो संस्करण जारी किए हैं, जैसे कि एक सुरक्षा टीम के पास दो प्रकार के अधिकारी हों:

  • 0.8B संस्करण (द स्पीडी गेटकीपर - तेज़ द्वारपाल): यह एक छोटा, सुपर-फास्ट मॉडल है। यह हर ऐप के "फ्रंट डोर" पर चलता है। यह किसी को भी धीमा किए बिना स्पष्ट रूप से बुरी चीजों को पकड़ने के लिए तुरंत संदेशों की जांच करता है। यह छोटा है लेकिन आश्चर्यजनक रूप से मजबूत है, और बड़े प्रतिस्पर्धियों को भी पीछे छोड़ देता है।
  • 4B संस्करण (द एक्सपर्ट डिटेक्टिव - विशेषज्ञ जासूस):ely: यह एक थोड़ा बड़ा, अधिक विचारशील मॉडल है। यदि "स्पीडी गेटकीपर" किसी पेचीदा संदेश के बारे में अनिश्चित है, तो वह इसे "एक्सपर्ट डिटेक्टिव" को सौंप सकता है। यह संस्करण सूक्ष्म और चालाकी भरी चालों को पहचानने में बेहतर है और इसका उपयोग उच्च-जोखिम वाली स्थितियों में किया जाता है।

5. परिणाम: बड़ा नहीं, बल्कि स्मार्ट

पेपर का दावा है कि HaloGuard एक गेम-चेंजर है क्योंकि यह छोटा है लेकिन स्मार्ट है

  • यह मौजूदा सर्वश्रेष्ठ गार्डों की तुलना में 30 गुना छोटा है (जो बहुत बड़े और धीमे हैं)।
  • अपने छोटे आकार के बावजूद, यह बड़े दिग्गजों की तुलना में अधिक बुरे अनुरोधों को पकड़ता है और कम अच्छे अनुरोधों को ब्लॉक करता है।
  • यह सफलतापूर्वक "बाउंड्री" (सीमा) को पार करता है—एक खतरनाक अनुरोध और एक सुरक्षित, शैक्षिक अनुरोध के बीच की पेचीदा रेखा।

यह क्या नहीं करता है (सीमाएं)

पेपर बहुत स्पष्ट है कि HaloGuard क्या नहीं है:

  • यह रिस्पॉन्स चेकर नहीं है: यह केवल यह जांचता है कि उपयोगकर्ता क्या टाइप करता है। यह यह जांच नहीं करता कि रोबोट क्या जवाब देता है। यदि उपयोगकर्ता एक सुरक्षित प्रश्न पूछता है लेकिन रोबोट गलती से एक खतरनाक उत्तर दे देता है, तो HaloGuard उसे नहीं पकड़ पाएगा।
  • यह रोबोट बॉडीगार्ड नहीं है: यह रोबोट को ऐसा टूल इस्तेमाल करने से नहीं रोकता (जैसे बैंक खाते तक पहुंचना) जो उसे बातचीत शुरू होने के बाद नहीं करना चाहिए। यह केवल रक्षा की पहली पंक्ति है।
  • यह पूर्ण नहीं है: पेपर स्वीकार करता है कि कुछ विशिष्ट भाषाओं (जैसे कुछ भारतीय और दक्षिण पूर्व एशियाई भाषाओं) में, गार्ड अभी भी थोड़ा अधिक सतर्क है और बहुत सारे सुरक्षित संदेशों को ब्लॉक कर देता है। वे इसे ठीक करने पर काम कर रहे हैं।

संक्षेप में

HaloGuard 1.0 एक नए प्रकार का AI सुरक्षा फ़िल्टर है जो "कीवर्ड ब्लॉकर" बनना बंद कर देता है और एक "कॉन्टेक्स्ट रीडर" (संदर्भ पढ़ने वाला) बन जाता है। एक विस्तृत नियम पुस्तिका और "अच्छे बनाम बुरे" के सटीक जोड़ों पर प्रशिक्षण का उपयोग करके, यह छोटा, तेज़ और एक खलनायक द्वारा हथियार मांगने और एक शिक्षक द्वारा हथियारों के बारे में पूछने के बीच अंतर करने में अविश्वसनीय रूप से सटीक होने में सक्षम है। यह वैध उपयोगकर्ताओं के लिए AI को बेकार बनाए बिना इसे सुरक्षित बनाने की दिशा में एक कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →