← नवीनतम पेपर
💬 NLP

YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models

YuFeng-XGuard एक खुला, तर्क-केंद्रित गार्डरेल मॉडल परिवार है जो संरचित स्पष्टीकरणों के साथ व्याख्यात्मक, बहुआयामी जोखिम मूल्यांकन और दक्षता एवं नीति अनुकूलन क्षमता के बीच संतुलन बनाने वाले एक लचीले, टियर्डेड इन्फरेंस प्रतिमान (tiered inference paradigm) के माध्यम से LLM सुरक्षा को बढ़ाता है।

मूल लेखक: Junyu Lin, Meizhen Liu, Xiufeng Huang, Jinfeng Li, Haiwen Hong, Xiaohan Yuan, Yuefeng Chen, Longtao Huang, Hui Xue, Ranjie Duan, Zhikai Chen, Yuchuan Fu, Defeng Li, Lingyao Gao, Yitong Yang

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junyu Lin, Meizhen Liu, Xiufeng Huang, Jinfeng Li, Haiwen Hong, Xiaohan Yuan, Yuefeng Chen, Longtao Huang, Hui Xue, Ranjie Duan, Zhikai Chen, Yuchuan Fu, Defeng Li, Lingyao Gao, Yitong Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, रचनात्मक सहायक (एक लार्ज लैंग्वेज मॉडल) है जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और किसी से भी चैट कर सकता है। लेकिन क्योंकि यह सहायक बहुत अधिक खुले विचारों वाला है, इसलिए यह कभी-कभी अनजाने में ऐसी बातें कह देता है जो अभद्र, खतरनाक या अवैध होती हैं। इसे सुरक्षित रखने के लिए, हम आमतौर पर संदेश बाहर जाने से पहले उसे जांचने के लिए दरवाजे पर एक "बाउंसर" रखते हैं।

आजकल के अधिकांश बाउंसर्स एक चेकलिस्ट के साथ सख्त सुरक्षा गार्ड की तरह काम करते हैं। वे एक संदेश को देखते हैं और अपने रटे हुए नियमों की एक निश्चित सूची के आधार पर जल्दी से "सुरक्षित!" या "असुरक्षित!" चिल्लाते हैं। यदि कोई संदेश उनकी सूची में पूरी तरह से फिट नहीं बैठता है, तो वे खतरे को मिस कर सकते हैं या किसी हानिरहित चीज़ को ब्लॉक कर सकते हैं। वे यह भी नहीं समझा सकते कि उन्होंने वह चुनाव क्यों किया; वे बस हाँ/ना में उत्तर देते हैं।

YuFeng-XGuard अलीबाबा द्वारा डिज़ाइन किया गया एक नया प्रकार का बाउंसर है। केवल "रुकिए" कहने के बजाय, यह एक विचारशील जासूस की तरह काम करता है जो एक रिपोर्ट लिखता है। यह कैसे काम करता है, यहाँ सरल रूप में दिया गया है:

1. केवल बाउंसर नहीं, बल्कि एक जासूस

एक साधारण "हाँ/नहीं" उत्तर देने के बजाय, YuFeng-XGuard एक संरचित रिपोर्ट (structured report) देता है।

  • फैसला (The Verdict): यह बताता है कि इसने किस प्रकार का जोखिम पाया (जैसे, "यह घृणास्पद भाषण है" या "यह एक खतरनाक हथियार का निर्देश है")।
  • आत्मविश्वास (The Confidence): यह आपको बताता है कि वह कितना आश्वस्त है (जैसे, "मुझे 95% यकीन है कि यह बुरा है")।
  • तर्क (The Reasoning): यह स्पष्ट अंग्रेजी (या सरल भाषा) में एक संक्षिप्त स्पष्टीकरण लिखता है, जैसे एक जासूस कहता है, "मैंने इसे इसलिए फ्लैग किया क्योंकि उपयोगकर्ता ने बम बनाने के बारे में पूछा, जो खतरनाक हथियारों के हमारे नियम से मेल खाता है।"

यह मनुष्यों के लिए यह समझना आसान बनाता है कि निर्णय क्यों लिया गया, न कि केवल एक ब्लैक बॉक्स देखना।

2. "फास्ट-ट्रैक" बनाम "डीप डाइव" (टियर्ड इन्फरेंस)

कल्पना कीजिए कि आप एक हवाई अड्डे पर हैं। कभी-कभी आपको गेट से गुजरने के लिए केवल अपने आईडी की एक त्वरित नज़र देखने की आवश्यकता होती है। अन्य समय में, यदि कुछ संदिग्ध दिखता है, तो आपको पूरे सामान की तलाशी लेने की आवश्यकता होती है।

YuFeng-XGuard दोनों करता है:

  • फास्ट-ट्रैक (The Fast-Track): यह उस पहले शब्द के आधार पर सुरक्षा निर्णय ले सकता है जिसे यह "सोचता" है। यह अविश्वसनीय रूप से तेज़ है, जो वास्तविक समय की चैट के लिए उपयुक्त है जहाँ आप प्रतीक्षा नहीं करना चाहते।
  • डीप डाइव (The Deep Dive): यदि आपको विवरण जानने की आवश्यकता है (जैसे ऑडिट या समीक्षा के लिए), तो यह बात करना जारी रखता है और पूरा स्पष्टीकरण लिखता है। आप "समय की लागत" तभी चुकाते हैं जब आप इसकी मांग करते हैं।

3. "गिरगिट" नीति (डायनेमिक पॉलिसी)

अधिकांश सुरक्षा गार्ड मूर्तियों की तरह होते हैं: एक बार जब वे बन जाते हैं, तो उनके नियम जम जाते हैं। यदि एक नए प्रकार का खतरा दिखाई देता है (जैसे कि एक नया प्रकार का स्कैम), तो आपको मूर्ति को तोड़ने, पिघलाने और फिर से बनाने के लिए उसे नष्ट करना पड़ता है ताकि उसे ठीक किया जा सके (मॉडल को फिर से प्रशिक्षित करना)।

YuFeng-XGuard एक गिरगिट की तरह है। यह बिना दोबारा बने अपने नियम तुरंत बदल सकता है।

  • यह कैसे काम करता है: आप इसे बता सकते हैं, "हे, आज हम एक विशिष्ट स्टोर में हैं, इसलिए हमें 'नकली घड़ियों' के बारे में किसी भी चीज़ को ब्लॉक करने की आवश्यकता है।"
  • परिणाम: यह तुरंत इस नए नियम को समझ जाता है और इसे लागू करता है, भले ही इसने अपने मूल प्रशिक्षण में "नकली घड़ियों" को कभी न देखा हो। इसका मतलब है कि कंपनियाँ इंजीनियरों द्वारा एआई को फिर से प्रशिक्षित करने की प्रतीक्षा किए बिना तुरंत अपने सुरक्षा नियमों को अपडेट कर सकती हैं।

4. हर काम के लिए दो आकार

टीम ने इस जासूस के दो संस्करण जारी किए हैं:

  • बड़ा जासूस (8B मॉडल): एक शक्तिशाली संस्करण जो जटिल मामलों को संभालता है और गहन तर्क (deep reasoning) कर सकता है।
  • पॉकेट जासूस (0.6B मॉडल): एक छोटा, सुपर-फास्ट संस्करण। यह इतना छोटा है कि यह कमजोर कंप्यूटरों पर भी चल सकता है, फिर भी यह आश्चर्यजनक रूप से स्मार्ट और सटीक है, जो अक्सर परीक्षणों में बहुत बड़े मॉडलों को भी पीछे छोड़ देता है।

यह कितना अच्छा है?

पेपर में इस नए गार्ड का परीक्षण कई अन्य सुरक्षा प्रणालियों के विरुद्ध विभिन्न प्रकार के "चालाकी भरे" परीक्षणों (विभिन्न भाषाओं में परीक्षण और एआई को धोखा देने के लिए डिज़ाइन किए गए परीक्षण सहित) का उपयोग करके किया गया।

  • परिणाम: YuFeng-XGuard अधिकांश श्रेणियों में शीर्ष पर रहा। यह खतरों को पहचानने में बेहतर था, विभिन्न भाषाओं को समझने में बेहतर था, और "ओवर-ब्लॉकिंग" (हानिरहित संदेशों को ब्लॉक करने) से बचने में बहुत बेहतर था।
  • दक्षता: इसने सटीक होने के साथ-साथ वास्तविक दुनिया के उपयोग के लिए पर्याप्त तेज़ होने का प्रबंधन किया।

सारांश में

YuFeng-XGuard सुरक्षा गार्ड के काम को एक मौन, कठोर द्वारपाल से बदलकर एक पारदर्शी, अनुकूलन योग्य और व्याख्या योग्य भागीदार में बदल देता है। यह केवल बुरी चीजों को रोकता नहीं है; यह आपको बताता है कि वास्तव में क्या हुआ, यह एक समस्या क्यों है, और दुनिया बदलने के साथ ही आपको तुरंत अपने नियम बदलने की अनुमति देता है—और वह भी पूरे सिस्टम को फिर से बनाए बिना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →