← أحدث الأبحاث
💻 computer science

Qwen-Image-VAE-2.0 Technical Report

تُعد Qwen-Image-VAE-2.0 مجموعة مشفرات تلقائية تباينية عالية الضغط تحقق دقة إعادة بناء رائدة وقدرة فائقة على الانتشار من خلال ابتكارات معمارية مثل الوصلات التخطّية العالمية، والتدريب واسع النطاق باستخدام التصيير الاصطناعي، وتعزيز المحاذاة الدلالية، وتتفوق بشكل خاص في السيناريوهات الغنية بالنصوص.

المؤلفون الأصليون: Zekai Zhang, Deqing Li, Kuan Cao, Yujia Wu, Chenfei Wu, Yu Wu, Liang Peng, Hao Meng, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue
نُشر 2026-05-14
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zekai Zhang, Deqing Li, Kuan Cao, Yujia Wu, Chenfei Wu, Yu Wu, Liang Peng, Hao Meng, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yilei Chen, Yixian Xu, Yuxiang Chen, Zhendong Wang, Zihao Liu, Zikai Zhou, Yiliang Gu, Yi Wang, Xiaoxiao Xu, Lin Qu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول إرسال صورة عالية الدقة لشارع مزدحم بالمدينة إلى صديق لك، لكن اتصال الإنترنت لديك بطيء جداً. لديك خياران:

  1. الطريقة القديمة: تصغير الصورة قليلاً (مثل البطاقة البريدية العادية). تبدو جيدة نوعاً ما، ولكن إذا حاول صديقك قراءة لافتات الشوارع الصغيرة أو لوحات أرقام السيارات، ستتحول الحروف إلى بقع ضبابية.

  2. الطريقة الجديدة (Qwen-Image-VAE-2.0): تصغير الصورة لتصبح بحجم طابع بريدي (نسبة "ضغط عالٍ"). عادةً، سيجعل هذا الصورة فوضوية، لكن هذه التكنولوجيا الجديدة تنجح في تصغيرها إلى هذا الحجم الصغير مع الحفاظ على وضوح لافتات الشوارع وتفاصيلها بدقة.

إليك تفصيل بسيط لكيفية تحقيق فريق Qwen-Image-VAE-2.0 لهذا الأمر، باستخدام الأفكار من تقريرهم:

1. المشكلة: مقايضة "الضغط"

في عالم توليد الصور بالذكاء الاصطناعي، هناك قاعدة عامة: إذا ضغطت الصورة كثيراً لتوفير المساحة (الضغط)، فستفقد عادةً التفاصيل الدقيقة (إعادة البناء). وإذا حاولت الحفاظ على التفاصيل بجعل البيانات "المضغوطة" أكبر، فإن الذكاء الاصطناعي الذي يولد صوراً جديدة لاحقاً سيصاب بالارتباك ويستغر وقتًا طويلاً للتعلم (قابلية الانتشار). الأمر يشبه محاولة وضع مكتبة كاملة في صندوق أحذية؛ إما أن تتمزق الكتب، أو يصبح الصندوق ثقيلاً جداً بحيث لا يستطيع أحد حمله.

2. الحل: "حقيبة" أكثر ذكاءً

بنى فريق Qwen نوعاً جديداً من الحقائب الرقمية (VAE) يحل هذه المشكلة عبر القيام بثلاثة أشياء ذكية:

  • "الاتصال المباشر العالمي" (الخط المباشر):
    تخيل أنك تحزم حقيبة سفر. عادةً، تقوم بطي كل شيء بعناية، مما قد يؤدي إلى سحق الأشياء الرقيقة مثل مزهرية هشة (التفاصيل النصية الدقيقة). أضاف فريق Qwen "خطاً مباشراً" من الصورة الأصلية إلى الحقيبة المحزومة. إنهم يأخذون أهم التفاصيل عالية التردد (مثل الحواف الحادة للحروف) ويضعونها مباشرة داخل الحقيبة دون طيها أولاً. هذا يضمن أنه حتى عندما تكون الصورة صغيرة جداً، تظل الحواف الحادة للنصوص سليمة.

  • "الحقيبة الأعرض" (القنوات الموسعة):
    عادةً، عندما تصغر حجم صورة، تجعل الحقيبة أضيق. ولكن إذا كان لديك الكثير من المعلومات لتعبئتها، فإن الحقيبة الضيقة ستسحق الأشياء. جعل فريق Qwen الحقيبة أعرض (زيادة أبعاد القنوات). هذا يمنحهم مساحة أكبر لتعبئة تفاصيل الصورة المصغرة دون فقدان أي شيء. وقد أثبتوا أنه على الرغم من أن الحقيبة أصبحت أعرض، إلا أن الذكاء الاصطناعي الذي يحملها لاحقاً لا يصبح أبطأ أو أثقل.

  • "عجلات التدريب" (المحاذاة الدلالية):
    مشكلة شائعة في الحقائب الواسعة هي أن الذكاء الاصطناعي الذي يحملها يصاب بالارتباك بشأن محتواها. لإصلاح ذلك، علم الفريق الحقيبة كيف تنظم محتوياتها من خلال مطابقتها مع "خريطة ذكية" (باستخدام أداة تسمى DINOv2). هذه الخريطة تعرف ماهية الأشياء من الناحية المفاهيمية. ومن خلال محاذاة محتويات الحقيبة مع هذه الخريطة، يتعلم الذكاء الاصطناعي بشكل أسرع وينتج صوراً أفضل. لقد فعلوا ذلك على مراحل: أولاً، فرضوا محاذاة صارمة لتعليم الأساسيات، ثم خففوا القواعد للسماح للذكاء الاصطناعي بالتركيز على جعل الصورة تبدو جميلة.

3. تحدي "الغنى النصي"

معظم اختبارات الذكاء الاصطناعي تستخدم صوراً للقطط أو المناظر الطبيعية. لكن فريق Qwen كان يعلم أن النص هو أصعب شيء يمكن ضغطه. فالقطة الضبابية لا تزال تبدو كقطة، لكن حرف "A" الضبابي يبدو كبقعة.

لإصلاح ذلك، لم يستخدموا مجرد صور عشوائية، بل:

  • جمعوا مليارات الصور.
  • جمعوا خصيصاً ملايين الوثائق مثل الكتب المدرسية والملصقات والصحف.
  • أنشأوا خط إنتاج اصطناعي (مصنع آلي) يقوم بطباعة النصوص على خلفيات عشوائية (مثل وضع لافتة على جدار من الطوب أو شجرة) لتعليم الذكاء الاصطناعي كيفية التعامل مع النصوص في مواقف العالم الحقيقي الفوضوية.

4. الاختبار الجديد: "OmniDoc-TokenBench"

أدرك الفريق أن الاختبارات القياسية (التي تقيس فقط سطوع البكسل) ليست جيدة في التحقق مما إذا كان النص قابلاً للقراءة. لذا، قاموا ببناء اختبار جديد يسمى OmniDoc-TokenBench.

  • كيف يعمل: يأخذون وثيقة، ويصغرونها باستخدام الذكاء الاصطناعي، ثم يطلبون من "روبوت القراءة" (OCR) قراءة النص من كل من النسخة الأصلية والمصغرة.
  • النتيجة: يقارنون بين ما قرأه الروبوت. إذا قرأ الروبوت "Hello" من الأصل و "Helo" من النسخة المصغرة، تنخفض الدرجة. هذا يقيس ما إذا كان النص قابلاً للقراءة فعلياً، وليس فقط ما إذا كانت الألوان تبدو صحيحة.

5. النتائج

  • إعادة البناء: عندما اختبروا نموذجهم، استطاع تصغير الصور بمقدار 16 ضعفاً أو حتى 32 ضعفاً (مما يجعلها 1/16 أو 1/32 من الحجم الأصلي) ومع ذلك حافظ على وضوح النص تماماً. بينما حولت النماذج الأخرى النص إلى كلمات غير مفهومة عند هذا الحجم.
  • السرعة: لأنهم جعلوا "المُشفّر" (الجزء الذي يحزم الحقيبة) خفيفاً جداً وأزالوا آليات "الانتباه" الثقيلة، فإنهم يحزمون الصور بسرعة كبيرة.
  • التوليد: عندما استخدموا هذه الحقيبة المحزومة لتدريب مولد صور جديد (DiT)، تعلم المولد بشكل أسرع بكثير مقارنة بنماذج الضغط العالي الأخرى.

ملخص

إن Qwen-Image-VAE-2.0 يشبه خدمة تعبئة فائقة الكفاءة. يمكنه تصغير مستند ضخم مليء بالنصوص إلى حجم صغير جداً دون سحق الحروف، كما أنه ينظم المحتويات بشكل جيد بحيث يمكن للشخص التالي (مولد الصور) تفريغها وإنشاء صور جديدة عالية الجودة بسرعة كبيرة. إنه يحل المشكلة القديمة حيث كان عليك الاختيار بين "حجم ملف صغير"، و"نص واضح"، و"توليد سريع" — هذا النموذج يمنحك الثلاثة معاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →