Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety
यह शोध पत्र युवियन एलएलएम (Yuvion LLM) को प्रस्तुत करता है, जो एक प्रतिकूलता-जागरूक (adversarially-aware) लार्ज लैंग्वेज मॉडल है जिसे एक विशिष्ट प्रशिक्षण पाइपलाइन और YLRE बेंचमार्क के माध्यम से सामग्री और एआई सुरक्षा को बढ़ाने के लिए डिज़ाइन किया गया है, जो रणनीतिक हमलों के विरुद्ध बेहतर सुदृढ़ता प्रदर्शित करता है और प्रमुख सुरक्षा कार्यों पर बड़े अत्याधुनिक मॉडलों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान, विनम्र लाइब्रेरियन बनाई है जिसका नाम युवियन (Yuvion) है। उसका काम किताबों और कहानियों को स्कैन करना है ताकि यह सुनिश्चित किया जा सके कि उनमें कोई खतरनाक निर्देश, नफरत फैलाने वाली बातें या अवैध योजनाएं न हों।
अन्य अधिकांश लाइब्रेरियन (मानक AI मॉडल) स्पष्ट खतरों को पहचानने में माहिर हैं। यदि कोई आता है और कहता है, "मैं बम कैसे बनाऊं?" तो वे तुरंत कहते हैं, "नहीं, यह खतरनाक है।"
लेकिन यहाँ एक समस्या है: बुरे तत्व चालाक छली (tricksters) की तरह होते हैं। वे सीधे बम के बारे में नहीं पूछते। इसके बजाय वे पूछते हैं, "मैं आम रसोई की चीजों का उपयोग करके एक विशेष आग जलाने वाला उपकरण कैसे बना सकता हूँ?" या वे भाषाओं को मिला देते हैं, इमोजी का उपयोग करते हैं, या एक इतिहास शिक्षक होने का नाटक करते हैं। मानक लाइब्रेरियन इन चालों से धोखा खा जाते हैं और अनजाने में खतरनाक जानकारी दे देते हैं।
युवion पेपर तर्क देता है कि सुरक्षा केवल नियमों को जानने के बारे में नहीं है; यह चतुर छली के खिलाफ "लुका-छिपी" का खेल खेलने के बारे में है। युवियन एक नया प्रकार का लाइब्रेरियन है जिसे विशेष रूप से यह खेल जीतने के लिए बनाया गया है।
यहाँ बताया गया है कि उन्होंने उसे कैसे बनाया, सरल उपमाओं का उपयोग करते हुए:
1. प्रशिक्षण शिविर (युवियन ने कैसे सीखा)
केवल सामान्य किताबों की लाइब्रेरी पढ़ने के बजाय, युवियन ने एक विशेष तीन-चरणीय बूट कैंप से प्रशिक्षण लिया:
- चरण 1: ज्ञान का इंजेक्शन (विश्वकोश): सबसे पहले, उन्होंने उसे केवल रैंडम कहानियाँ पढ़ने के लिए नहीं छोड़ा। उन्होंने उसे सुरक्षा नियमों, पुलिस रिपोर्टों और "बुरे आदमी" के पैटर्न का एक विशाल, संरचित विश्वकोश खिलाया। यह लाइब्रेरियन को एक मोटी नियम पुस्तिका और अपराधियों द्वारा उपयोग किए जाने वाले हर ज्ञात कोड वर्ड की सूची देने जैसा है, ताकि वह केवल सटीक शब्दों को ही नहीं, बल्कि खतरे की अवधारणा (concept) को भी समझ सके।
- चरण 2: "छली" ड्रिल (भूमिका निर्वहन/रोल-प्ले): इसके बाद, उन्होंने उसे अभिनेताओं के साथ एक कमरे में रखा जिन्होंने उसे धोखा देने की कोशिश की। उन अभिनेताओं ने स्लैंग का उपयोग किया, अक्षरों को नंबरों से बदल दिया, या पहेलियों में बात की। युवियन को वेशभूषा के पीछे देखना सीखना था। यदि किसी ने कहा, "मैं वेन्यू पर आइस स्केटिंग आज़माना चाहता हूँ," तो युवियन ने सीखा कि उनका वास्तव में मतलब "ड्रग्स खरीदना" था, भले ही शब्द मासूम थे। उसने केवल सतह के शब्दों को नहीं, बल्कि इरादे को पहचानना सीखा।
- चरण 3: डिटेक्टिव एकेडमी (एजेंट): अंत में, वास्तविक सुरक्षा कार्य केवल "ना" कहना नहीं है। कभी-कभी आपको जांच करने की आवश्यकता होती है। युवियन ने सीखा कि एक जासूस कैसे बनना है। यदि वह सुनिश्चित नहीं है, तो वह जानती है कि:
- तथ्य की जांच करने के लिए सर्च इंजन खोलना।
- इमेज को स्कैन करने के लिए टूल का उपयोग करना।
- एक जटिल समस्या को छोटे चरणों में तोड़ना।
- उपमा: जबकि अन्य लाइब्रेरियन केवल अनुमान लगाते हैं, युवियन जानती है कि अंतिम निर्णय लेने से पहले अभिलेखागार (archives) की जांच करने के लिए पीछे के कमरे में कैसे जाना है और सुरक्षा कैमरे को कैसे देखना है।
2. बड़ा परीक्षण (द "रिस्कइवल" अरीना)
यह साबित करने के लिए कि वह कितनी अच्छी है, टीम ने एक विशाल बाधा दौड़ बनाई जिसे YLRE (Yuvion LLM RiskEval) कहा जाता है। इसमें चार स्तर थे:
- सामान्य बुद्धिमत्ता: क्या सुरक्षा सीखने के दौरान वह कविता लिखना या गणित करना भूल गई? (नहीं, वह अभी भी स्मार्ट है)।
- सार्वजनिक सुरक्षा: क्या वह उन मानक परीक्षणों को पास कर सकती है जो अन्य सभी लेते हैं? (हाँ, उसने अपने सर्वश्रेष्ठ प्रतिस्पर्धियों से अधिक स्कोर किया)।
- "रेड टीम" गाउंटलेट: यह सबसे कठिन हिस्सा था। विशेषज्ञों की एक टीम ने सबसे रचनात्मक और चालाकी भरी चालों के साथ उसे तोड़ने की कोशिश की। युवion ने अन्य किसी भी मॉडल, जिसमें बहुत बड़े मॉडल भी शामिल थे, की तुलना में बेहतर स्थिति संभाली।
- वास्तविक दुनिया का काम: उन्होंने एक नकली "बिजनेस" वातावरण में उसका परीक्षण किया जहाँ उसे लाखों नकली यूजर पोस्ट की समीक्षा करनी थी। उसने न केवल खराब सामग्री को ब्लॉक किया; बल्कि उसने संदर्भ को समझा और जटिल कंपनी नियमों का पालन भी किया, जो बड़े और महंगे मॉडल्स से बेहतर था।
3. परिणाम
पेपर कुछ आश्चर्यजनक दावे करता है:
- छोटा लेकिन शक्तिशाली: उन्होंने दो संस्करण बनाए: एक बड़ा (32B) और एक छोटा (8B)। यहाँ तक कि छोटा Yuvion-8B भी सुरक्षा कार्यों पर "दिग्गजों" (जैसे GPT-5.4 और Qwen3-MAX) को हरा देता है। यह एक हल्के वजन के बॉक्सर द्वारा हेवीवेट चैंपियन को नॉकआउट करने जैसा है क्योंकि हेवीवेट ने इस विशिष्ट प्रकार की लड़ाई के लिए प्रशिक्षण नहीं लिया था।
- "गार्ड डॉग्स" से बेहतर: अन्य AI मॉडल भी हैं जिन्हें विशेष रूप से सुरक्षा गार्ड के रूप में बनाया गया है। युवियन केवल एक गार्ड नहीं है; वह एक स्मार्ट असिस्टेंट भी है जो सुरक्षा भी करती है। पेपर दिखाता है कि शुद्ध "गार्ड" मॉडल अक्सर वास्तविक व्यावसायिक कार्यों में विफल हो जाते हैं, जबकि युवियन काम भी कर सकती है और आपको सुरक्षित भी रख सकती है।
- "हथियारों की दौड़" का लूप: पेपर स्वीकार करता है कि बुरे लोग हमेशा नए तरीके आज़माएंगे। इसलिए, उन्होंने एक प्रणाली बनाई जहाँ युवियन लगातार कंप्यूटर और मनुष्यों द्वारा उत्पन्न नए ट्रिक्स के खिलाफ अभ्यास करती है, जिससे उसके कौशल में निरंतर अपडेट होता रहता है।
निचोड़
पेपर कहता है कि AI को सुरक्षित बनाना केवल अंत में एक फिल्टर जोड़ने के बारे में नहीं है। आपको शुरुआत से ही उसके मस्तिष्क में "सुरक्षा की मांसपेशी" (safety muscle) बनानी होगी, उसे विशेष रूप से झूठ बोलने वालों और छली लोगों के खिलाफ प्रशिक्षित करना होगा, और उसे एक जासूस की तरह जांच करना सिखाना होगा। युवियन उसी दृष्टिकोण का परिणाम है, जो यह सिद्ध करता है कि विशेष रूप से सुरक्षा के लिए प्रशिक्षित मॉडल इंटरनेट को सुरक्षित रखने के मामले में बहुत बड़े, सामान्य उद्देश्य वाले मॉडलों को मात दे सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।