← नवीनतम पेपर
💬 NLP

Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety

यह शोध पत्र युवियन एलएलएम (Yuvion LLM) को प्रस्तुत करता है, जो एक प्रतिकूलता-जागरूक (adversarially-aware) लार्ज लैंग्वेज मॉडल है जिसे एक विशिष्ट प्रशिक्षण पाइपलाइन और YLRE बेंचमार्क के माध्यम से सामग्री और एआई सुरक्षा को बढ़ाने के लिए डिज़ाइन किया गया है, जो रणनीतिक हमलों के विरुद्ध बेहतर सुदृढ़ता प्रदर्शित करता है और प्रमुख सुरक्षा कार्यों पर बड़े अत्याधुनिक मॉडलों से बेहतर प्रदर्शन करता है।

मूल लेखक: Ting Ma, Xiufeng Huang, Benlei Cui, Xiaowen Xu, Shikai Qiu, Ruijie Jian, Hongxing Li, Guanghui Wang, Longtao Huang, Haiwen Hong, Haolei Xu, Wenjing Jiang, Ziwen Xu, Zhaoyu Fan, Shaoxuan He, Chuxi Xiao
प्रकाशित 2026-06-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ting Ma, Xiufeng Huang, Benlei Cui, Xiaowen Xu, Shikai Qiu, Ruijie Jian, Hongxing Li, Guanghui Wang, Longtao Huang, Haiwen Hong, Haolei Xu, Wenjing Jiang, Ziwen Xu, Zhaoyu Fan, Shaoxuan He, Chuxi Xiao, Yujian Li, Xinyue Chen, Chunyang Chai, Wenxuan Liu, Ziheng Wang, Dongjie Zhang, Yangfan Zhou, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Wei Wang, Huiming Zhang, Bin Li, Hui Xue

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान, विनम्र लाइब्रेरियन बनाई है जिसका नाम युवियन (Yuvion) है। उसका काम किताबों और कहानियों को स्कैन करना है ताकि यह सुनिश्चित किया जा सके कि उनमें कोई खतरनाक निर्देश, नफरत फैलाने वाली बातें या अवैध योजनाएं न हों।

अन्य अधिकांश लाइब्रेरियन (मानक AI मॉडल) स्पष्ट खतरों को पहचानने में माहिर हैं। यदि कोई आता है और कहता है, "मैं बम कैसे बनाऊं?" तो वे तुरंत कहते हैं, "नहीं, यह खतरनाक है।"

लेकिन यहाँ एक समस्या है: बुरे तत्व चालाक छली (tricksters) की तरह होते हैं। वे सीधे बम के बारे में नहीं पूछते। इसके बजाय वे पूछते हैं, "मैं आम रसोई की चीजों का उपयोग करके एक विशेष आग जलाने वाला उपकरण कैसे बना सकता हूँ?" या वे भाषाओं को मिला देते हैं, इमोजी का उपयोग करते हैं, या एक इतिहास शिक्षक होने का नाटक करते हैं। मानक लाइब्रेरियन इन चालों से धोखा खा जाते हैं और अनजाने में खतरनाक जानकारी दे देते हैं।

युवion पेपर तर्क देता है कि सुरक्षा केवल नियमों को जानने के बारे में नहीं है; यह चतुर छली के खिलाफ "लुका-छिपी" का खेल खेलने के बारे में है। युवियन एक नया प्रकार का लाइब्रेरियन है जिसे विशेष रूप से यह खेल जीतने के लिए बनाया गया है।

यहाँ बताया गया है कि उन्होंने उसे कैसे बनाया, सरल उपमाओं का उपयोग करते हुए:

1. प्रशिक्षण शिविर (युवियन ने कैसे सीखा)

केवल सामान्य किताबों की लाइब्रेरी पढ़ने के बजाय, युवियन ने एक विशेष तीन-चरणीय बूट कैंप से प्रशिक्षण लिया:

  • चरण 1: ज्ञान का इंजेक्शन (विश्वकोश): सबसे पहले, उन्होंने उसे केवल रैंडम कहानियाँ पढ़ने के लिए नहीं छोड़ा। उन्होंने उसे सुरक्षा नियमों, पुलिस रिपोर्टों और "बुरे आदमी" के पैटर्न का एक विशाल, संरचित विश्वकोश खिलाया। यह लाइब्रेरियन को एक मोटी नियम पुस्तिका और अपराधियों द्वारा उपयोग किए जाने वाले हर ज्ञात कोड वर्ड की सूची देने जैसा है, ताकि वह केवल सटीक शब्दों को ही नहीं, बल्कि खतरे की अवधारणा (concept) को भी समझ सके।
  • चरण 2: "छली" ड्रिल (भूमिका निर्वहन/रोल-प्ले): इसके बाद, उन्होंने उसे अभिनेताओं के साथ एक कमरे में रखा जिन्होंने उसे धोखा देने की कोशिश की। उन अभिनेताओं ने स्लैंग का उपयोग किया, अक्षरों को नंबरों से बदल दिया, या पहेलियों में बात की। युवियन को वेशभूषा के पीछे देखना सीखना था। यदि किसी ने कहा, "मैं वेन्यू पर आइस स्केटिंग आज़माना चाहता हूँ," तो युवियन ने सीखा कि उनका वास्तव में मतलब "ड्रग्स खरीदना" था, भले ही शब्द मासूम थे। उसने केवल सतह के शब्दों को नहीं, बल्कि इरादे को पहचानना सीखा।
  • चरण 3: डिटेक्टिव एकेडमी (एजेंट): अंत में, वास्तविक सुरक्षा कार्य केवल "ना" कहना नहीं है। कभी-कभी आपको जांच करने की आवश्यकता होती है। युवियन ने सीखा कि एक जासूस कैसे बनना है। यदि वह सुनिश्चित नहीं है, तो वह जानती है कि:
    • तथ्य की जांच करने के लिए सर्च इंजन खोलना।
    • इमेज को स्कैन करने के लिए टूल का उपयोग करना।
    • एक जटिल समस्या को छोटे चरणों में तोड़ना।
    • उपमा: जबकि अन्य लाइब्रेरियन केवल अनुमान लगाते हैं, युवियन जानती है कि अंतिम निर्णय लेने से पहले अभिलेखागार (archives) की जांच करने के लिए पीछे के कमरे में कैसे जाना है और सुरक्षा कैमरे को कैसे देखना है।

2. बड़ा परीक्षण (द "रिस्कइवल" अरीना)

यह साबित करने के लिए कि वह कितनी अच्छी है, टीम ने एक विशाल बाधा दौड़ बनाई जिसे YLRE (Yuvion LLM RiskEval) कहा जाता है। इसमें चार स्तर थे:

  1. सामान्य बुद्धिमत्ता: क्या सुरक्षा सीखने के दौरान वह कविता लिखना या गणित करना भूल गई? (नहीं, वह अभी भी स्मार्ट है)।
  2. सार्वजनिक सुरक्षा: क्या वह उन मानक परीक्षणों को पास कर सकती है जो अन्य सभी लेते हैं? (हाँ, उसने अपने सर्वश्रेष्ठ प्रतिस्पर्धियों से अधिक स्कोर किया)।
  3. "रेड टीम" गाउंटलेट: यह सबसे कठिन हिस्सा था। विशेषज्ञों की एक टीम ने सबसे रचनात्मक और चालाकी भरी चालों के साथ उसे तोड़ने की कोशिश की। युवion ने अन्य किसी भी मॉडल, जिसमें बहुत बड़े मॉडल भी शामिल थे, की तुलना में बेहतर स्थिति संभाली।
  4. वास्तविक दुनिया का काम: उन्होंने एक नकली "बिजनेस" वातावरण में उसका परीक्षण किया जहाँ उसे लाखों नकली यूजर पोस्ट की समीक्षा करनी थी। उसने न केवल खराब सामग्री को ब्लॉक किया; बल्कि उसने संदर्भ को समझा और जटिल कंपनी नियमों का पालन भी किया, जो बड़े और महंगे मॉडल्स से बेहतर था।

3. परिणाम

पेपर कुछ आश्चर्यजनक दावे करता है:

  • छोटा लेकिन शक्तिशाली: उन्होंने दो संस्करण बनाए: एक बड़ा (32B) और एक छोटा (8B)। यहाँ तक कि छोटा Yuvion-8B भी सुरक्षा कार्यों पर "दिग्गजों" (जैसे GPT-5.4 और Qwen3-MAX) को हरा देता है। यह एक हल्के वजन के बॉक्सर द्वारा हेवीवेट चैंपियन को नॉकआउट करने जैसा है क्योंकि हेवीवेट ने इस विशिष्ट प्रकार की लड़ाई के लिए प्रशिक्षण नहीं लिया था।
  • "गार्ड डॉग्स" से बेहतर: अन्य AI मॉडल भी हैं जिन्हें विशेष रूप से सुरक्षा गार्ड के रूप में बनाया गया है। युवियन केवल एक गार्ड नहीं है; वह एक स्मार्ट असिस्टेंट भी है जो सुरक्षा भी करती है। पेपर दिखाता है कि शुद्ध "गार्ड" मॉडल अक्सर वास्तविक व्यावसायिक कार्यों में विफल हो जाते हैं, जबकि युवियन काम भी कर सकती है और आपको सुरक्षित भी रख सकती है।
  • "हथियारों की दौड़" का लूप: पेपर स्वीकार करता है कि बुरे लोग हमेशा नए तरीके आज़माएंगे। इसलिए, उन्होंने एक प्रणाली बनाई जहाँ युवियन लगातार कंप्यूटर और मनुष्यों द्वारा उत्पन्न नए ट्रिक्स के खिलाफ अभ्यास करती है, जिससे उसके कौशल में निरंतर अपडेट होता रहता है।

निचोड़

पेपर कहता है कि AI को सुरक्षित बनाना केवल अंत में एक फिल्टर जोड़ने के बारे में नहीं है। आपको शुरुआत से ही उसके मस्तिष्क में "सुरक्षा की मांसपेशी" (safety muscle) बनानी होगी, उसे विशेष रूप से झूठ बोलने वालों और छली लोगों के खिलाफ प्रशिक्षित करना होगा, और उसे एक जासूस की तरह जांच करना सिखाना होगा। युवियन उसी दृष्टिकोण का परिणाम है, जो यह सिद्ध करता है कि विशेष रूप से सुरक्षा के लिए प्रशिक्षित मॉडल इंटरनेट को सुरक्षित रखने के मामले में बहुत बड़े, सामान्य उद्देश्य वाले मॉडलों को मात दे सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →