Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
تقترح هذه الورقة البحثية VDrop، وهي طريقة لإسقاط الرموز الديناميكية القائمة على التباين، تعمل على تسريع استدلال نماذج الرؤية واللغة الكبيرة بشكل كبير من خلال الإزالة التدريجية للرموز البصرية ذات التباين الضئيل، مما يحقق تقليلاً جوهرياً في زمن الاستجابة مع الحفاظ على أداء قريب من الأداء الأصلي في مهام فهم الصور والفيديو.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول شرح مشهد سينمائي معقد لصديق لك. لديك نص يتكون من 100 صفحة، لكن صديقك لا يملك سوى 5 دقائق للاستماع. إذا قرأت كل كلمة، فسينفد منك الوقت. وإذا حذفت كلمات عشوائية، فقد تفوتك الحبكة الدرامية.
نماذج الرؤية واللغة الضخمة (LVLMs) هي مثل مساعدين أذكياء للغاية يعملون بالذكاء الاصطناعي، يمكنهم "مشاهدة" الفيديوهات و"قراءة" الصور عالية الدقة. ولكن هنا تكمن المشكلة: لكي يفهم هذا الذكاء الاصطناعي صورة عالية الجودة أو فيديو طويل، فإنه يقوم بتفكيك البيانات المرئية إلى آلاف القطع الصغيرة التي تسمى "الرموز" (Tokens). الأمر يشبه تحويل فيلم بدقة 4K إلى نص مكون من 10,000 صفحة. وهذا يجعل الذكاء الاصطناعي بطيئًا للغاية ويستهلك قدرة حوسبة هائلة.
ولحل هذه المشكلة، حاول الباحثون ضغط النص — عبر التخلص من الأجزاء "المملة" لكي يتمكن الذكاء الاصطناعي من القراءة بشكل أسرع. ومع ذلك، كان للطرق القديمة عيبان كبيران:
- تحيز "الصفحة الأخيرة": كانت تميل إلى الاحتفاظ بالصفحات القليلة الأخيرة من النص والتخلص من البداية، حتى لو كانت البداية تحتوي على أهم الأدلة.
- "حقيبة الظهر الثقيلة": لكي تقرر ما يجب الاحتفاظ به، كان عليها القيام بالكثير من العمليات الحسابية الثقيلة (حساب "درجات الانتباه")، مما جعل الحقيبة أثقل، وهو ما ينافي الغرض من محاولة جعلها أخف وزنًا.
إليكم V2Drop: كاشف "الرموز الكسولة"
يقدم البحث طريقة جديدة تسمى V2Drop (إسقاط رموز الرؤية المعتمد على التباين). بدلاً من السؤال: "إلى أي مدى ينظر الذكاء الاصطناعي إلى هذا الجزء؟" (وهو ما يسبب التحيز)، يسأل V2Drop: "إلى أي مدى يتغير هذا الجزء أثناء مروره عبر عقل الذكاء الاصطناعي؟"
إليك التشبيه البسيط:
التشبيه: خط تجميع المصنع
تخيل أن الذكاء الاصطناعي هو خط تجميع في مصنع يتكون من 20 محطة (طبقات). يدخل رمز بصري (قطعة من الصورة) عند المحطة 1 وينتقل إلى المحطة 20.
- الرموز "المهمة": تشبه قطعة خام من المعدن يتم طرقها، وطلاؤها، ولحامها، وتلميعها في كل محطة من المحطات. وبحلول وصولها إلى النهاية، تكون قد تغيرت جذريًا. لقد تم "العمل عليها" لأنها تحتوي على معلومات حيوية (مثل الرقم الموجود على قميص لاعب أو النص الموجود على لافتة).
- الرموز "الكسولة": تشبه قطعة من المناظر الخلفية (مثل بقعة من السماء الزرقاء أو جدار فارغ). تدخل المحطة 1، وبحلول وصولها إلى المحطة 20، تبدو كما هي تمامًا دون تغيير. لم تتغير لأن الذكاء الاصطناعي لم يجد شيئًا مثيرًا للاهتمام للقيام به معها.
استراتيجية V2Drop:
بدلاً من التخمين حول ماهية الرموز المهمة، يقوم V2Drop ببساطة بقياس مقدار التغيير الذي طرأ على الرمز بين المحطات.
- إذا تغير الرمز كثيرًا؟ احتفظ به! إنه يقوم بالعمل الشاق.
- إذا ظل الرمز كما هو (أي أنه "كسول")؟ احذفه! فهو مجرد وزن زائد لا فائدة منه.
لماذا يعد هذا تغييراً جذرياً؟
لا مزيد من "تحيز الصفحة الأخيرة":
الطرق القديمة كانت مثل معلم لا يصحح إلا الصفحة الأخيرة من الاختبار لأنه متعب. أما V2Drop فينظر إلى محتوى الإجابة، وليس مكان وجودها في الجملة. يمكنه حذف رمز من الزاوية العلوية اليسرى للصورة إذا كان مملاً، والاحتفاظ برمز من الزاوية السفلية اليمنى إذا كان مهمًا. إنه يعامل الصورة بأكملها بإنصاف.حقيبة ظهر أخف (الكفاءة):
بما أن V2Drop يقيس فقط "التغيير" (عملية حسابية بسيطة تسمى L2 Norm)، فإنه لا يحتاج إلى إجراء حسابات "الانتباه" الثقيلة التي تتطلبها الطرق الأخرى. وهذا يعني أنه يعمل بشكل مثالي مع أسرع شرائح الكمبيوتر الحديثة (مثل FlashAttention) دون إبطائها.النتيجة:
يظهر البحث أنه باستخدام كاشف "الرموز الكسولة" هذا، يمكن للذكاء الاصطناعي:
- فهم الصور أسرع بمقدار 1.3 مرة.
- فهم الفيديوهات أسرع بمقدار 1.8 مرة.
- الحفاظ على 94% إلى 98% من ذكائه الأصلي.
الخلاصة
فكر في V2Drop كأنه محرر ذكي لا يكتفي بقص نهاية القصة لتوفير الوقت فحسب. بدلاً من ذلك، يقوم بمسح القصة بحثًا عن الجمل التي ليست سوى "حشو" (تكرار نفس الفكرة دون إضافة قيمة) ويقوم بحذف تلك الجمل. تصبح القصة أقصر وأسرع في القراءة، لكن حبكتها تظل سليمة تمامًا.
هذا يسمح للذكاء الاصطناعي بمشاهدة الأفلام الطويلة وتحليل الصور عالية الدقة في الوقت الفعلي دون الحاجة إلى كمبيوتر خارق بحجم منزل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.