← أحدث الأبحاث
🤖 machine learning

BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation

يُعد BARD إطار عمل مبتكر يحول نماذج الرؤية واللغة ذات التنبؤ الذاتي مسبقة التدريب بكفاءة إلى نماذج انتشار ذات كتل كبيرة بسرعة فك تشفير تزيد بمقدار 3 أضعاف عبر توظيف دمج الكتل التدريجي وتقطير الانتشار الداخلي المرحلي، محققاً بذلك أداءً رائدًا مع تجنب تدهور الجودة المرتبط عادةً بالتحويل المباشر من النماذج ذات التنبؤ الذاتي إلى نماذج الانتشار.

المؤلفون الأصليون: Baoyou Chen, Hanchen Xia, Peng Tu, Haojun Shi, Shan Mu, Weihao Yuan, Siyu Zhu

نُشر 2026-04-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Baoyou Chen, Hanchen Xia, Peng Tu, Haojun Shi, Shan Mu, Weihao Yuan, Siyu Zhu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك أمين مكتبة عبقريًا ومجتهدًا (النموذج التوليدي الذاتي - Autoregressive Model) يجيد القراءة والإجابة عن الأسئلة حول الكتب بشكل مذهل. ومع ذلك، يعاني هذا الأمين من عيب رئيسي واحد: لا يمكنه إلا كتابة كلمة واحدة في كل مرة، ويجب عليه الانتظار حتى تنتهي الكلمة السابقة قبل البدء في الكلمة التالية. إذا طلبت منه كتابة مقال طويل، فسيستغرق الأمر وقتًا طويلاً للغاية لأنه يعمل في خط مستقيم صارم.

الآن، تخيل نوعًا جديدًا من الكتاب (نموذج الانتشار - Diffusion Model) يعمل بطريقة مختلفة. بدلًا من الكتابة كلمة بكلمة، يبدأ هذا الكاتب بصفحة بيضاء مليئة بالخربشات و"الضجيج". إنه ينظر إلى الصفحة بأكملة في وقت واحد ويقوم بتعديل العديد من الكلمات في آن واحد، مما يؤدي إلى تحسين النص في كتل كبيرة. هذا أسرع بكثير، ولكن هناك مشكلة: إذا حاولت تحويل أمين المكتبة العبقري هذا إلى هذا النوع الجديد من الكتاب بين عشية وضحاها، فسيصاب بالارتباك؛ سيفقد قدرته على التفكير المنطقي، وستصبح إجاباته بلا معنى، وسينسى كيفية قراءة الصور في الكتب.

BARD هو الحل لهذه المشكلة. إنه "جسر" ذكي يساعد أمين المكتبة البطيء الذي يكتب كلمة بكلمة على التحول إلى الكاتب السريع الذي يكتب بنظام الكتل دون أن يفقد ذكاءه.

إليك كيف يقوم BARD بذلك، باستخدام ثلاث استعارات بسيطة:

١. "السلم" بدلاً من "المنحدر" (الدمج التدريجي للكتل - Progressive Block Merging)

إذا حاولت القفز من كتابة كلمة واحدة في كل مرة إلى كتابة ٣٢ كلمة في وقت واحد، فمن المرجح أن تسقط. هذا ما يحدث عندما تحاول تحويل هذه النماذج مباشرة؛ فالقفزة تكون كبيرة جدًا، مما يؤدي إلى انهيارها.

يقوم BARD ببناء سلم.

  • الخطوة ١: يعلّم أمين المكتبة الكتابة في مجموعات صغيرة من ٤ كلمات في كل مرة. هكذا يتعودون على هذا الإيقاع الجديد.
  • الخطوة ٢: بمجرد أن يصبحوا معتادين على ذلك، يطلب منهم الكتابة في مجموعات من ٨ كلمات.
  • الخطوة ٣: ثم ١٦، وأخيرًا ٣٢.

من خلال زيادة حجم "الكتل" التي يكتبونها ببطء، يتكيف النموذج بسلاسة. لا يضطر أبدًا للقيام بقفزة عملاقة مخيفة، بل يتخذ خطوة صغيرة واحدة للأعلى في كل مرة.

٢. "المدرب الخبير" مقابل "المعلم المرتبك" (التقطير المرحلي - Stage-Wise Distillation)

عادةً، عندما تقوم بتدريب طالب جديد (نموذج الكتل الكبير)، قد تحاول تعليمه باستخدام أمين المكتبة الأصلي (نموذج الكلمة الواحدة) كمعلم. لكن هذا لا يعمل جيدًا لأن لغتيهما مختلفة! فأمين المكتبة يتحدث عن "ما سيأتي بعد ذلك"، بينما يتحدث الطالب الجديد عن "إصلاح ما هو موجود بالفعل". الأمر يشبه محاولة تعليم سباح باستخدام كتاب عن كيفية الجري؛ فالنصيحة لا تتناسب مع الفعل.

يحل BARD هذه المشكلة عبر إنشاء "مدرب خبير" خاص.

  • أولاً، يقوم بتدريب نسخة صغيرة ومستقرة من الكاتب الجديد ("المرتكز" - Anchor) الذي يجيد بالفعل أسلوب الكتابة بالكتل.
  • بعد ذلك، وبينما يكبر الطالب (يكتب ١٦ أو ٣٢ كلمة في آن واحد)، يظل هذا المدرب الخبير نفسه واقفًا على الهامش لتوجيهه.
  • ولأن المدرب يتحدث نفس "لغة الكتل" التي يتحدث بها الطالب، فإن توجيهاته تكون مثالية. وهذا يضمن أنه كلما أصبح الطالب أسرع، فإنه لن يفقد ذكاءه.

٣. ممارسة "القلم الأحمر" (مجدول الضجيج المختلط - Mixed Noise Scheduler)

التدريب القياسي لهؤلاء الكتاب السريعين يطلب منهم فقط إصلاح الكلمات المخفية تمامًا (المحجوبة). الأمر يشبه معلمًا يغطي كلمة بصندوق أسود ويسأل: "ماذا يوجد هنا؟".

يضيف BARD لمسة مميزة: فهو يطلب من النموذج أيضًا إصلاح الكلمات التي هي مرئية ولكنها خاطئة.

  • تخيل جملة حيث كلمة "قطة" مكتوبة بوضوح، ولكن كان يجب أن تكون "كلب".
  • يدرب BARD النموذج على رصد هذا الخطأ وتصحيحه، رغم أن الكلمة موجودة بالفعل.
  • هذا يعلم النموذج أن يكون محررًا أفضل؛ فهو لا يتعلم فقط ملء الفراغات، بل يتعلم أيضاً المراجعة والتحسين لعمله الخاص، مما يجعل الإجابة النهائية أكثر دقة بكثير.

النتيجة: السرعة دون تضحية

النتيجة هي أن إطار عمل BARD ينتج نموذجًا أسرع بـ ٣ مرات من أمين المكتبة الأصلي لأنه يكتب في كتل كبيرة، ولكنه بنفس الذكاء (أو حتى أذكى) لأنه تم تدريبه بعناية باستخدام السلم والمدرب الخبير.

في اختبارات الورقة البحثية، تفوقت هذه النماذج الجديدة (BARD-VL) على جميع النماذج "السريعة" الأخرى، بل وتفوقت حتى على النماذج "البطيئة" الأصلية في مهام مثل قراءة الرسوم البيانية، وفهم المستندات، وحل الألغاز البصرية.

باخت reflex: BARD هو برنامج التدريب الذي يعلم المفكر البطيء والحذر كيف يصبح مفكرًا سريعًا ومتوازيًا دون أن يجعله ينسى كيف يفكر على الإطلاق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →