← नवीनतम पेपर
🤖 AI

Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems

यह शोध पत्र Xuanwu VL-2B को प्रस्तुत करता है, जो एक 2B-पैरामीटर वाला औद्योगिक-ग्रेड मल्टीमॉडल फाउंडेशन मॉडल है, जो सूक्ष्म दृश्य धारणा (fine-grained visual perception), सामान्य क्षमता प्रतिधारण (general capability retention) और परिनियोजन लागत (deployment costs) के बीच संतुलन बनाते हुए कंटेंट मॉडरेशन और एडवर्सरियल परिदृश्यों में उत्कृष्ट प्रदर्शन प्राप्त करने के लिए एक कॉम्पैक्ट InternViT-300M और Qwen3 1.7B आर्किटेक्चर के साथ एक तीन-चरणीय प्रशिक्षण पाइपलाइन का लाभ उठाता है।

मूल लेखक: Zhiqian Zhang, Xu Zhao, Xiaoqing Xu, Guangdong Liang, Weijia Wang, Xiaolei Lv, Bo Li, Jun Gao

प्रकाशित 2026-04-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiqian Zhang, Xu Zhao, Xiaoqing Xu, Guangdong Liang, Weijia Wang, Xiaolei Lv, Bo Li, Jun Gao

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान और विद्वान लाइब्रेरियन है जिसका नाम Xuanwu है।

आर्टिफिशियल इंटेलिजेंस की दुनिया में, अधिकांश "सामान्य" लाइब्रेरियन एक विशाल, सार्वजनिक पुस्तकालय के लाइब्रेरियन की तरह होते हैं। वे इतिहास, विज्ञान और साहित्य के बारे में सब कुछ जानते हैं। वे आपके किसी भी प्रश्न का उत्तर दे सकते हैं। हालाँकि, यदि आप उनसे एक जटिल पेंटिंग के भीतर छिपे एक विशिष्ट, छोटे, हस्तलिखित नोट को पहचानने के लिए कहें, या पानी के दाग के रूप में छिपे एक गुप्त कोड को खोजने के लिए कहें, तो वे अक्सर चूक जाते हैं। वे बहुत अधिक बड़े चित्र (big picture) को देखने में व्यस्त रहते हैं।

इसके अलावा, यदि आप इस लाइब्रेरियन को पुस्तकालय की एक छोटी, विशिष्ट शाखा में "वर्जित पुस्तकों" के बारे में एक नया, बहुत विशिष्ट नियम सिखाने की कोशिश करते हैं, तो वे अनजाने में शेक्सपियर को पढ़ना या गणित करना भूल सकते हैं। इसे "कैटैस्ट्रोफिक फॉरगेटिंग" (विनाशकारी विस्मृति) कहा जाता है।

समस्या:
सोशल मीडिया प्लेटफॉर्म एक विशाल, अराजक शहर के चौराहों की तरह हैं। बुरे तत्व (स्पैमर, स्कैमर और नियम तोड़ने वाले) लगातार हानिकारक सामग्री को अंदर घुसने की कोशिश कर रहे हैं। वे केवल "मैं ड्रग्स बेच रहा हूँ" नहीं लिखते; वे इसे छिपाते हैं। वे इनका उपयोग करते हैं:

  • बहुत छोटे फोंट जो धूल की तरह दिखते हैं।
  • विकृत टेक्स्ट जो एक पिघली हुई मोमबत्ती जैसा दिखता है।
  • AI-जनित चित्र जहाँ टेक्स्ट बादलों की बनावट में मिल जाता है।
  • गुप्त कोड जो माजों (Mahjong) की टाइल्स या वॉटरमार्क के अंदर छिपे होते हैं।

मानक AI मॉडल (सामान्य लाइब्रेरियन) इतने चालाक ट्रिक्स को पकड़ने के लिए बहुत धीमे और बहुत "नासमझ" हैं।

समाधान: Xuanwu VL-2B
Hello Group की टीम ने Xuanwu नामक एक नए प्रकार का लाइब्रेरियन बनाया है। दुनिया का सबसे बड़ा, सबसे महंगा पुस्तकालय बनाने के बजाय, उन्होंने एक अत्यंत कुशल, विशिष्ट जासूस बनाया है जो एक छोटे से बैकपैक (केवल 2 बिलियन पैरामीटर्स, जो एक AI के लिए छोटा है) में समा सकता है।

यहाँ बताया गया है कि उन्होंने Xuanwu को कैसे बनाया, सरल उपमाओं का उपयोग करके:

1. आर्किटेक्चर: "स्विस आर्मी नाइफ" बनाम "टैंक"

अधिकांश AI मॉडल विशाल टैंकों की तरह होते हैं: भारी, शक्तिशाली, लेकिन चलाने में धीमे और महंगे।
Xuanwu एक स्विस आर्मी नाइफ की तरह है।

  • आंखें (दृष्टि): उन्होंने Xuanwu को उच्च शक्ति वाले, ज़ूम-इन करने वाले चश्मे (InternViT) दिए हैं जो एक कोने में टेक्स्ट के एक एकल पिक्सेल जैसे सूक्ष्म विवरण देख सकते हैं।
  • दिमाग (भाषा): उन्होंने इन चश्मों को एक बहुत ही स्मार्ट, कॉम्पैक्ट दिमाग (Qwen3) से जोड़ा है जो संदर्भ और नियमों को समझता है।
  • कनेक्टर: उन्होंने आंखों को दिमाग से जोड़ने के लिए एक सरल, तेज़ पुल (MLP) का उपयोग किया।
  • परिणाम: यह फोन या सर्वर पर तेज़ी से चलाने के लिए पर्याप्त छोटा है, लेकिन एक ढेर में सुई खोजने के लिए पर्याप्त तेज़ है।

2. प्रशिक्षण: "तीन-चरणीय स्कूल"

आप केवल एक जासूस को केस फाइल थमाकर उससे मामला सुलझाने की उम्मीद नहीं कर सकते। Xuanwu ने एक सख्त तीन-चरणीय प्रशिक्षण कार्यक्रम पूरा किया:

  • चरण 1: प्री-ट्रेनिंग (विश्वविद्यालय की डिग्री)
    Xuanwu ने लाखों किताबें पढ़ीं और लाखों चित्रों को देखा। इसने सीखा कि एक बिल्ली कैसी दिखती है, मेनू कैसे पढ़ा जाता है, और गणित की समस्याओं को कैसे हल किया जाता है। इसने इसे सामान्य ज्ञान की एक ठोस नींव दी।
  • चरण 2: मिड-ट्रेनिंग (विशेषज्ञ प्रशिक्षण शिविर/बूट कैंप)
    यहीं पर जादू हुआ। प्रशिक्षकों ने Xuanwu को सामान्य किताबें दिखाना बंद कर दिया और उसे वास्तविक दुनिया के अपराध स्थलों को दिखाना शुरू किया। उन्होंने उसे स्पैम, घोटाले और छिपे हुए कोड के हजारों उदाहरण दिखाए।
    • महत्वपूर्ण ट्रिक: यह सुनिश्चित करने के लिए कि स्पैम पहचानना सीखते समय Xuanwu शेक्सपियर को पढ़ना न भूल जाए, उन्होंने हर दिन पुराने "विश्वविद्यालय" की कुछ किताबें भी शामिल कीं। इसने इसकी सामान्य बुद्धिमत्ता को जीवित रखते हुए इसके जासूसी कौशल को तेज रखा।
  • चरण 3: पोस्ट-ट्रेनिंग (फील्ड इंटर्नशिप)
    Xuanwu को एक सिम्युलेटेड वातावरण में रखा गया जहाँ उसे बुरे लोगों को पकड़ने का अभ्यास करना था।
    • "CoT" (चेन ऑफ थॉट): केवल "हाँ" या "नहीं" का अनुमान लगाने के बजाय, Xuanwu को ज़ोर से सोचने के लिए सिखाया गया। यह कहना सीखता है: "मैं एक बिल्ली की तस्वीर देख रहा हूँ। रुको, कोने में छोटा सा टेक्स्ट है जो कहता है 'मुझे WeChat पर जोड़ें।' यह एक नियम का उल्लंघन है। इसलिए, मैं इसे फ्लैग करूँगा।" यह AI को व्याख्यात्मक और विश्वसनीय बनाता है।
    • "रिवॉर्ड सिस्टम" (RL): जब Xuanwu ने एक कठिन, विकृत कोड को पकड़ा, तो उसे एक डिजिटल "हाई फाइव" मिला। जब उसने एक भी मिस किया, तो उसे एक कोमल सुधार मिला। इसने कठिन ट्रिक्स को पहचानने की उसकी क्षमता को मजबूत किया।

3. सुपरपावर: डायनेमिक विज़न

कल्पना कीजिए कि आप 100 फीट दूर लगे एक साइन बोर्ड को पढ़ने की कोशिश कर रहे हैं, लेकिन साथ ही सामने रखे एक बोतल पर लगे छोटे लेबल को भी पढ़ने की कोशिश कर रहे हैं। यदि आप साइन बोर्ड पर ध्यान केंद्रित करते हैं, तो बोतल धुंधली हो जाती है। यदि आप बोतल पर ध्यान केंद्रित करते हैं, तो साइन बोर्ड गायब हो जाता है।
Xuanwu एक "डायनेमिक टाइलिंग" ट्रिक का उपयोग करता है। यह केवल पूरी छवि को एक साथ नहीं देखता है। यह छवि को पहेली के टुकड़ों (टाइल्स) में तोड़ देता है। यह दृश्य को समझने के लिए पूरे चित्र को देखता है, फिर छोटे, विकृत टेक्स्ट को पढ़ने के लिए विशिष्ट टाइल्स पर ज़ूम करता है। यह बिना भ्रमित हुए या मेमोरी खत्म किए बिना यह करता है।

परिणाम: यह क्यों मायने रखता है

पेपर दिखाता है कि Xuanwu "कंटेंट मॉडरेशन ओलंपिक्स" में एक चैंपियन है:

  • गति और लागत: क्योंकि यह छोटा है, इसे चलाना सस्ता है। एक प्लेटफॉर्म बिना बजट बिगाड़े प्रति सेकंड लाखों पोस्ट की जांच कर सकता है।
  • सटीकता: इसने परीक्षणों में 94% खराब सामग्री को पकड़ा, जो बहुत बड़े मॉडलों को भी पीछे छोड़ देता है।
  • "एडवर्सरियल" जीत: उन परीक्षणों में जहाँ बुरे तत्वों ने अजीब विकृतियों और छिपे हुए टेक्स्ट के साथ AI को धोखा देने की कोशिश की, Xuanwu ने उनमें से 82.8% को पकड़ा। यह उन सबसे महंगे, व्यावसायिक "सुपर-मॉडल्स" (जैसे Gemini) से भी बेहतर है जो विशेष रूप से इस काम के लिए प्रशिक्षित नहीं थे।

निष्कर्ष

Xuanwu यह सिद्ध करता है कि जटिल समस्याओं को हल करने के लिए आपको एक विशाल, महंगे AI की आवश्यकता नहीं है। एक कॉम्पैक्ट, विशिष्ट जासूस बनाकर जिसे वास्तविक दुनिया के ट्रिक्स पर प्रशिक्षित किया गया है और जिसे "चरण-दर-चरण सोचने" के लिए सिखाया गया है, आप एक ऐसा सिस्टम बना सकते हैं जो तेज़, सस्ता और इंटरनेट को छिपे हुए खतरों से सुरक्षित रखने में अविश्वसनीय रूप से कुशल है।

यह जंगल में खोई हुई अंगूठी को खोजने के लिए एक विशाल, धीमी गति वाले हाथी को काम पर रखने बनाम एक छोटे, अत्यधिक चौकस गिलहरी को काम पर रखने के बीच का अंतर है जो जानता है कि ठीक कहाँ देखना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →