Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems
تقدم الورقة البحثية نموذج Xuanwu VL-2B، وهو نموذج تأسيسي متعدد الوسائط من الدرجة الصناعية بـ 2 مليار معلمة، يستفيد من بنية مدمجة تتكون من InternViT-300M وQwen3 1.7B إلى جانب مسار تدريب ثلاثي المراحل لتحقيق أداء فائق في مراقبة المحتوى والسيناريوهات العدائية مع تحقيق التوازن بين الإدراك البصري دقيق التفاصيل، والحفاظ على القدرات العامة، وتكاليف النشر.
البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك أمين مكتبة عبقرياً ومطلعاً يدعى شوان وو (Xuanwu).
في عالم الذكاء الاصطناعي، معظم أمناء المكتبات "العامّين" يشبهون أولئك الموجودين في مكتبة عامة ضخمة؛ فهم يعرفون كل شيء عن التاريخ والعلوم والأدب. يمكنهم الإجابة على أي سؤال تطرحه، ولكن إذا طلبت منهم رصد ملاحظة صغيرة مكتوبة بخط اليد ومخبأة داخل لوحة معقدة، أو العثور على رمز سري متنكر في شكل بقعة ماء، فغالباً ما يفشلون في ذلك. إنهم مشغولون جداً بالنظر إلى الصورة الكبيرة.
علاوة على ذلك، إذا حاولت تعليم هذا الأمين قاعدة جديدة ومحددة جداً حول "الكتب المحظورة" في فرع صغير ومتخصص من المكتبة، فقد ينسى بالخطأ كيفية قراءة شكسبير أو حل المسائل الرياضية. وهذا ما يسمى بـ "النسيان الكارثي".
المشكلة:
منصات التواصل الاجتماعي تشبه ساحات المدن العملاقة والفوضوية. يسعى الأشرار (المحتالون، والمخادعون، ومخالفو القواعد) باستمرار للتسلل وتقديم محتوى غير قانوني أو ضار. هم لا يكتفون بكتابة "أنا أبيع المخدرات" فحسب، بل يخفونها باستخدام:
- خطوط صغيرة جداً تبدو وكأنها غبار.
- نصوص مشوهة تبدو كأنها شمعة ذائبة.
- صور مولدة بالذكاء الاصطناعي حيث يندمج النص في نسيج السحابة.
- رموز سرية مخبأة داخل قطع "الماجونغ" (Mahjong) أو العلامات المائية.
نماذج الذكاء الاصطناعي القياسية (أمين المكتبة العام) بطيئة جداً في فحص كل منشور في الوقت الفعلي، كما أنها "غبية" جداً لرصد هذه الحيل الذكية.
الحل: Xuanwu VL-2B
قام الفريق في "Hello Group" ببناء نوع جديد من أمناء المكتبات يسمى Xuanwu. بدلاً من محاولة بناء أكبر وأغلى مكتبة في العالم، قاموا ببناء محقق متخصص وعالي الكفاءة يمكنه أن يتسع في حقيبة ظهر صغيرة (بـ 2 مليار بارامتر فقط، وهو حجم صغير بالنسبة للذكاء الاصطناعي).
إليك كيف بنوا Xuanwu، باستخدام تشبيهات بسيطة:
1. البنية: "السكين السويسري" مقابل "الدبابة"
معظم نماذج الذكاء الاصطناعي تشبه الدبابات الضخمة: ثقيلة، قوية، ولكنها بطيئة ومكلفة في التشغيل.
أما Xuanwu فهو مثل السكين السويسري.
- الأعين (الرؤية): منحوا Xuanwu نظارات ذات قوة تكبير عالية (InternViT) يمكنها رؤية التفاصيل الدقيقة، مثل بكسل واحد من نص في زاوية ما.
- العقل (اللغة): ربطوا هذه النظارات بعقل مدمج وذكي جداً (Qwen3) يفهم السياق والقواعد.
- الرابط: استخدموا جسراً بسيطاً وسريعاً (MLP) لربط العين بالعقل.
- النتيجة: إنه صغير بما يكفي ليعمل بسرعة على هاتف أو خادم، ولكنه حاد بما يكفي لرصد إبرة في كومة قش.
2. التدريب: "مدرسة المراحل الثلاث"
لا يمكنك مجرد تسليم ملف قضية لمحقق وتتوقع منه حلها. لقد مر Xuanwu ببرنامج تدريبي صارم مكون من ثلاث مراحل:
- المرحلة 1: ما قبل التدريب (الدرجة الجامعية)
قرأ Xuanwu ملايين الكتب ونظر إلى ملايين الصور. تعلم كيف يبدو شكل القط، وكيف يقرأ قائمة طعام، وكيف يحل مسائل رياضية. منح هذاه أساساً متيناً من المعرفة العامة. - المرحلة 2: التدريب المتوسط (المعسكر التدريبي المتخصص)
هنا حدث السحر. توقف المدربون عن عرض الكتب العامة على Xuanwu وبدأوا في إظهار مسرح جريمة حقيقي له. عرضوا عليه آلاف الأمثلة على الرسائل المزعجة (Spam)، وعمليات الاحتيال، والرموز المخفية.- الحيلة الحاسمة: لضمان عدم نسيان Xuanwu لكيفية قراءة شكسبير أثناء تعلمه رصد الرسائل المزعجة، قاموا بخلط القليل من كتب "الجامعة" القديمة كل يوم. حافظ هذا على ذكائه العام حياً بينما صقل مهاراته كـ "محقق".
- المرحلة 3: ما بعد التدريب (التربص الميداني)
وُضع Xuanwu في بيئة محاكية حيث كان عليه ممارسة اصطياد الأشرار.- سلسلة الأفكار (CoT): بدلاً من مجرد التخمين بـ "نعم" أو "لا"، تم تعليم Xuanwu التفكير بصوت عالٍ. يتعلم أن يقول: "أرى صورة قطة. انتظر، هناك نص صغير في الزاوية يقول 'أضفني على WeChat'. هذا انتهاك للقواعد. لذلك، سأقوم بالإبلاغ عنه". هذا يجعل الذكاء الاصطناعي قابلاً للتفسير وجديراً بالثقة.
- نظام المكافأة (RL): عندما يضبط Xuanwu كوداً مشوهاً وصعباً، يحصل على "ضربة عالية خمسة" (High Five) رقمية. وعندما يخطئ في رصد أحدها، يتلقى تصحيحاً لطيفاً. هذا عزز قدرته على رصد أصعب الحيل.
3. القوة الخارقة: الرؤية الديناميكية
تخيل أنك تحاول قراءة لافتة تبعد 100 قدم، وفي نفس الوقت تحاول قراءة ملصق صغير على زجاجة في المقدمة. إذا ركزت بصرك على اللافتة، ستصبح الزجاجة ضبابية. وإذا ركزت على الزجاجة، ستختفي اللافتة.
يستخدم Xuanwu حيلة "التبليط الديناميكي" (Dynamic Tiling). هو لا ينظر إلى الصورة بأكملها دفعة واحدة فحسب، بل يقسم الصورة إلى قطع أحجية (بلاطات). ينظر إلى الصورة الكبيرة لفهم المشهد، ثم يركز (Zoom in) على بلاطات محددة لقراءة النص الصغير والمشوه. يفعل ذلك دون أن يصاب بالارتباك أو ينفد منه الذاكرة.
النتائج: لماذا يهم هذا؟
تظهر الورقة البحثية أن Xuanwu هو بطل في "أولمبياد مراقبة المحتوى":
- السرعة والتكلفة: لأنه صغير، فإن تشغيله رخيص. يمكن للمنصة فحص ملايين المنشورات في الثانية دون استنزاف الميزانية.
- الدقة: لقد رصد 94% من المحتوى السيئ في الاختبارات، متفوقاً على نماذج أكبر بكثير.
- الفوز في المواجهة (Adversarial): في الاختبارات التي حاول فيها الأشرار خداع الذكاء الاصطناعي بتشويهات غريبة ونصوص مخفية، نجح Xuanwu في رصد 82.8% منها. وهذا أفضل حتى من أكثر النماذج التجارية "الخارقة" (مثل Gemini) التي لم تُدرب خصيصاً لهذه المهمة.
الخلاصة
يثبت Xuanwu أنك لست بحاجة إلى ذكاء اصطناعي ضخم ومكلف لحل المشكلات المعقدة. من خلال بناء محقق مدمج ومتخصص تم تدريبه على حيل العالم الحقيقي وتعليمه "التفكير خطوة بخطوة"، يمكنك إنشاء نظام سريع، رخيص، وجيد للغاية في الحفاظ على سلامة الإنترنت من الأخطار الخفية.
إنه الفرق بين توظيف فيل ضخم وبطيء الحركة للعثور على خاتم مفقود في غابة، مقابل توظيف سنجاب صغير شديد الملاحظة يعرف بالضبط أين يبحث.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.