CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language Models
تقدم هذه الورقة البحثية CAPA، وهو إطار عمل فعال للنماذج اللغوية البصرية الكبيرة يعمل على تحسين سرعة الاستنتاج من خلال تقليم الرموز البصرية ذات المساهمة المنخفضة التي يتم تحديدها عبر مقاييس مساهمة الانتباه، وتقريب حسابات الشبكة العصبية للتغذية الأمامية الفائضة في الطبقات المتوسطة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل نموذج رؤية ولغة ضخم (LVLM) كأنه ناقد فني ذكي للغاية، ولكنه مشغول للغاية. عندما تعرض عليه صورة وتسأله سؤالاً، فهو لا "ينظر" إلى الصورة فحسب؛ بل يفككها إلى آلاف القطع الصغيرة من الأحجية (تسمى الرموز البصرية - visual tokens). ثم يقرأ هذه القطع جنباً إلى جنب مع نصك، محاولاً معرفه ما هو مهم.
المشكلة هي أن هذا الناقد مثقل بالأعباء. فهو يحاول معالجة كل قطعة من الأحجية بنفس التركيز الشديد، حتى الأجزاء المملة والفارغة من الخلفية. وهذا يجعل العملية بطيئة ومكلفة، مثل محاولة قراءة موسوعة كاملة فقط للعثور على حقيقة واحدة محددة.
يقدم البحث طريقة جديدة تسمى CAPA (التقليم القائم على المساهمة وتقريب الشبكة العصبية الأمامية - Contribution-Aware Pruning and FFN Approximation) لمساعدة هذا الناقد على العمل بشكل أسرع دون أن يصاب بالارتباك. فكر في CAPA كأنه مساعد ذكي يعلم الناقد خدعتين جديدتين:
الخدعة 1: فلتر "الأثر الحقيقي" (التقليم القائم على المساهمة)
الطريقة القديمة (الحدس المعيب):
في السابق، كان الناقد يقرر أي قطع الأحجية يتجاهلها بناءً على مقدار "الانتباه" الذي تحصل عليه. إذا حصلت قطعة من الصورة (مثل بقعة من السماء الزرقاء) على الكثير من الانتباه من النص، كان الناقد يحتفظ بها. وإذا حصلت على انتباه قليل، كان يرميها.
- المشكلة: هذا يشبه الحكم على مشهد سينمائي فقط من خلال مدى صراخ الجمهور. أحياناً، قد تحصل شخصية ما على الكثير من الضجيج (الانتباه) لكنها في الواقع لا تقول شيئاً مهماً. في مصطلحات البحث، تُسمى هذه "مصبات الاحتمالية" (Probability Dumps). إنها صاخبة ولكنها عديمة الفائدة. وعلى العكس من ذلك، قد تكون بعض القطع الهادئة هي التي تقوم بكل العمل الشاق ولكن يتم تجاهلها لأنها لم تكن "صاخبة" بما يكفي.
طريقة CAPA (الفلتر الذكي):
تغير CAPA القاعدة. فبدلاً من مجرد الاستماع إلى "الضجيج" (درجة الانتباه)، فإنها تتحقق من "الأثر الحقيقي" (مساهمة الانتباه).
- التشبيه: تخيل موقع بناء. "الضويج" هو عدد الأشخاص الذين يصرخون على طوبة معينة. أما "الأثر" فهو مقدار الوزن الذي تحمله تلك الطوبة فعلياً.
- النوع (أ) (مصبات الاحتمالية): طوبة يصرخ الجميع عليها، لكنها مصنوعة من الفلين (Styrofoam). إنها لا تحمل أي وزن. تقول CAPA: "ارموها؛ إنها مجرد ضجيج".
- النوع (ب) (المرتكزات الهيكلية): طوبة لا يصرخ أحد عليها، لكنها تسند السقف بأكمله. تقول CAPA: "احتفظوا بها! إنها تقوم بالعمل الحقيقي".
- النتيجة: تحتفظ CAPA بالطوب الذي يقوم بالعمل الشاق وترمي طوب الفلين، مما يضمن عدم فقدان الناقد للتفاصيل المهمة أثناء تجاهل المساحات الفارغة.
الخدعة 2: "الاختصار" للمهام المملة (تقريب الشبكة العصبية الأمامية - FFN Approximation)
الطريقة القديمة (العمل الشاق):
بعد النظر في قطع الأحجية، يتعين على النموذج معالجتها من خلال دائرة دماغية معقدة تسمى الشبكة الأمامية (FFN). فكر في هذا كآلة حاسبة عالية الطاقة ومعقدة للغاية تقوم بعمليات حسابية معقدة على كل قطعة من البيانات.
- المشمة: وجد البحث أن هذه الحاسبة المعقدة غالباً ما تكون مبالغاً فيها بالنسبة لقطع الصور (الرموز البصرية). في الطبقات الوسطى من النموذج، تكون الرياضيات التي تقوم بها الحاسبة شبه خطية. إنه مثل استخدام سوبر كمبيوتر لضرب 2 في 2. إنه هدر للطاقة.
طريقة CAPA (الاختصار):
تحدد CAPA هذه الطبقات "المملة" حيث لا تكون الرياضيات المعقدة ضرورية حقاً.
- التشبيه: تخيل أن لديك طباخاً يستخدم خلاطاً صناعياً بقيمة 10,000 دولار لتقطيع ورقة خس واحدة. إنه يعمل، لكنه غير فعال. تقول CAPA: "في هذه الخطوة المحددة، استخدم مجرد سكين بسيط".
- التنفيذ: بدلاً من تشغيل الرياضيات المعقدة والمكلفة، تستبدلها CAPA بـ "حاصل ضرب هادامارد" (Hadamard product) بسيط وخفيف الوزن (وهو مصطلح تقني لعملية ضرب بسيطة عنصراً بعنصر). الأمر يشبه استبدال الخلاط الصناعي بتقطيع يدوي سريع.
- النتيجة: توفر CAPA كمية هائلة من الطاقة (الحوسبة) لأنها تتوقف عن استخدام الآلات الثقيلة عندما تفي أداة بسيطة بالغرض تماماً.
الختام الكبير: كيف تفوز CAPA؟
من خلال الجمع بين هاتين الخدعتين، تنشئ CAPA نظاماً فائق الكفاءة:
- تقلم الحشو: تزيل "طوب الفلين" (الرموز البصرية عديمة الفائدة) التي كانت تضيع الوقت.
- تبسط الرياضيات: تستبدل "الخلاط الصناعي" (الحسابات المكلفة) بـ "سكين بسيط" (رياضيات خفيفة الوزن) حيثما كان ذلك آمناً.
النتيجة:
اختبر البحث هذه الطريقة على عدة نماذج شهيرة (مثل LLaVA و Qwen). وأظهرت النتائج أن CAPA تشبه عداء الماراثون الذي يتخلص من الأوزان غير الضرورية ويغير خطوته إلى خطوة أكثر كفاءة.
- إنها أسرع بكثير (أقل بنسبة تصل إلى 78% في العمل الحسابي).
- لا تتعثر عند خط النهاية (تحافظ على دقة عالية).
- تتعامل مع المهام المعقدة (مثل قراءة النصوص في صورة أو حل الألغاز) بشكل أفضل من الطرق الأخرى التي تعتمد فقط على التخمين بشأن القطع التي يجب رميها.
باختصار، تعلم CAPा الذكاء الاصطناعي التوقف عن الصراخ في الفراغ والتوقف عن استخدام مطرقة ثقيلة لكسر حبة جوز، مما يجعله أسرع وأذكى دون أن يفقد ميزته.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.