CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models
تقدم الورقة البحثية LiteLVLM، وهي طريقة لتقليم الرموز (token pruning) تعتمد على التوجيه النصي ولا تتطلب تدريباً، تقوم بعكس ترتيب تشابه الصور والنصوص الخاص بـ CLIP للاحتفاظ بكفاءة بالمناطق المرجعية لعملية التوطين البكسلي (pixel grounding) في النماذج اللغوية البصرية الكبيرة، محققةً بذلك تسريعاً كبيراً وتقليلاً في استهلاك الذاكرة مع التفوق على الأساليب الحالية.
تخيل أن لديك مساعداً آلياً ذكياً جداً (نموذج لغوي بصري ضخم - Large Vision-Language Model) يمكنه النظر إلى صورة والإجابة على أسئلة حولها. لكن هناك مشكلة: لكي "يرى" الصورة، يقوم الروبوت بتفكيك الصورة إلى آلاف قطع الأحجية الصغيرة التي تسمى "الرموز" (tokens).
عندما تسأل الروبوت سؤالاً بسيطاً مثل، "أين الكرة؟"، فإنه لا يزال مضطراً لمعالجة كل تلك الآلاف من القطع، حتى تلك التي تظهر السماء، أو العشب، أو الخلفية. الأمر يشبه أن تطلب من أمين مكتبة قراءة كل كتاب في المكتبة فقط للعثور على جملة واحدة محددة عن قطة. هذا يجعل العملية بطيئة، ومكلفة، ويهدر الكثير من الطاقة.
يقدم البحث حيلة جديدة تسمى LiteLVLM لحل هذه المشكلة. وإليك كيف تعمل، مشروحة ببساعة:
المشكلة: الروبوت "الذكي" يتعرض للخداع
حاولت الطرق السابقة تسريع العملية عن طريق التخلص من قطع الأحجية "المملة". ظنوا قائين: "لنحتفظ بالقطع التي تشبه الكلمات التي كتبتها تماماً".
الطريقة القديمة: إذا سألت "ابحث عن الكرة"، فإن الروبوت يبحث عن قطع الصورة التي تطابق كلمة "كرة" بشكل مثالي ويحتفظ بها.
المفاجأة: وجد المؤلفون أنه بالنسبة للمهام التي تحتاج فيها إلى الإشارة إلى مكان شيء ما بدقة (تحديد البكسل - pixel grounding)، فإن هذا المنطق معكوس!
التشبيه: تخيل أنك تبحث عن شخص معين في غرفة مزدحمة يرتدي قبعة حمراء. الروبوت "الذكي" (بناءً على نظام يسمى CLIP) يركز في الواقع انتباهه على الحشد والخلفية عندما يسمع "قبعة حمراء"، لأن هذه هي الأشياء الأكثر شيوعاً في الغرفة. الشخص الفعلي الذي يرتدي القبعة الحمراء فريد جداً لدرجة أن نظام الروبوت الداخلي يعتقد: "هذا لا يبدو مثل الفكرة العامة لـ 'القبعة الحمراء' التي أعرفها"، ويحاول تجاهله.
النتيجة: الطرق القديمة كانت تتخلص من القطع التي تحتاجها بالفعل (الشخص الذي يرتدي القبعة) وتحتفظ بضجيج الخلفية.
الحل: "LiteLVLM" (حيلة علم النفس العكسي)
أدرك المؤلفون أنه لكي يجدوا الشيء المحدد، يجب عليهم في الواقع الاحتفاظ بالقطع التي تشبه وصف النص أقل درجة والتخلص من القط celles التي تشبهه تماماً.
"فلتر العكس": بدلاً من الاحتفاظ بالقطع التي تطابق كلمة "كرة"، يحتفظ LiteLVLM بالقطع التي لا تطابق كلمة "كرة" جيداً.
لماذا؟ لأن التفاصيل المحددة والفريدة للكرة (شكلها الدقيق، ملمسها، وموقعها) غالباً ما تكون محددة جداً لدرجة أنها لا تبدو مثل "الفكرة النصية" العامة للكرة. من خلال الاحتفاظ بهذه القطع "غير المتطابقة"، يحتفظ الروبوت في الواقع بأهم تفاصيل الشيء.
"شبكة أمان السياق": إذا احتفظت فقط بالقطع "غير المتطابقة"، فقد تفقد الخلفية (مثل العشب الذي تجلس عليه الكرة). لذا، يقوم LiteLVLM أيضاً بجلب بعض القطع الإضافية التي تساعد الروبوت على فهم المشهد بأكمله، للتأكد من أنه لن يرتبك.
لا يتطلب تدريباً: الجزء الأفضل؟ هذه حيلة "لا تتطلب تدريباً" (training-free). أنت لا تحتاج لتعليم الروبوت أي شيء جديد. أنت فقط تغير القاعدة الخاصة بالقطع التي سيحتفظ بها قبل أن يبدأ الروبوت في التفكير. إنه يشبه تغيير التعليمات على حزام ناقل دون إعادة بناء المصنع.
النتائج: أسرع، أخف، وأذكى
باستاستخدام نهج "علم النفس العكسي" هذا، يحقق LiteLVLM نتائج مذهلة:
السرعة: يعمل أسرع بنسبة 22%.
الذاكرة: يستخدم ذاكرة أقل بمقدار 2.3 مرة.
الدقة: على الرغم من أنه يتخلص من حوالي ثلثي قطع الصورة، إلا أنه لا يزال يحصل على 90% من الإجابات بشكل صحيح.
باخت-اختصار
فكر في الطرق القديمة كحارس أمن يوقف كل من يرتدي قميصاً أحمر لأنه يعتقد أن "القميص الأحمر" هو الكلمة المفتاحية المشبوهة. لكن اللص الفعلي يرتدي قميصاً أزرق! وهكذا يفوت الحارس اللص.
LiteLVLM هو حارس الأمن الجديد الذي يقول: "في الواقع، دعونا نوقف الجميع باستثناء الأشخاص الذين يرتدون قمصاناً حمراء، لأن اللص من المرجح أن يكون مختبئاً في وضح النهار بين القمصان الحمراء". من خلال قلب المنطق، يجد الروبوت بالضبط ما طلبته، بسرعة أكبر وجهد أقل.
ملخص تقني: خدعة CLIP تخدعك: تقليم الرموز (Token Pruning) الخالي من التدريب لكفاءة تحديد المواقع البكسلية في النماذج البصرية-اللغوية الكبيرة
بيان المشكلة تواجه النماذج البصرية-اللغوية الكبيرة (LVLMs) عبئًا حوسبيًا كبيرًا بسبب الحجم الهائل للرموز البصرية (visual tokens) التي تعالجها، والتي غالبًا ما تفوق عدد الرموز النصية بفارق كبير (على سبيل المثال، 576 رمزًا بصريًا مقابل أقل من 100 رمز نصي في نموذج LLaVA). وبينما نجحت طرق تقليم الرموز الحديثة في تقليل هذا العبء لمهام فهم الصور العامة، إلا أنها تعاني في مهام "تحديد المواقع البكسلية" (pixel grounding)، مثل تقسيم المراجع التعبيري (referring expression segmentation). وتلاحظ المؤلفة أن الأساليب الحالية تعتمد إما على أهمية بصرية غير مرتبطة بالنص (مثل التشابه مع رمز [CLS] العالمي) أو تفترض أن التشابه البصري-النصي العالي يشير إلى الصلة بالموضوع؛ ومع ذلك، يلاحظ المؤلفون أن هذه الأساليب تفشل في الحفاظ على الرموز داخل المناطق المرجعية المحددة بواسطة النص المدخل، مما يؤدي إلى تدهور أداء التقسيم (segmentation).
المنهجية: LiteLVLM يقدم البحث LiteLVLM، وهو استراتيجية لتقليم الرموز تعتمد على التوجيه النصي وخالية من التدريب، مصممة خصيصًا لكفاءة تحديد المواقع البكسلية. تعتمد الطريقة على تحليل معمق لنموذج CLIP، والذي كشف عن ظاهرتين حرجتين:
انعكاس التشابه البصري-النصي: على عكس الحدس، فإن الرموز البصرية الموجودة داخل المناطق المرجعية (الأشياء الموصوفة في النص) تظهر تشابهًا منخفضًا مع التمثيل النصي (تحديدًا رمز [EOS]) في نموذج CLIP. وعلى العكس من ذلك، فإن الرمções ذات التشابه العالي غالبًا ما تتوافق مع الخلفية أو السياق العالمي. ويُعزى ذلك إلى التدريب المقارن (contrastive pretraining) لـ CLIP، الذي يوفق بين التضمينات العالمية (global embeddings) ولكنه يترك التفاصيل المحلية للأشياء أقل توافقًا مع المتجه النصي العالمي.
بالوعة انتباه النص (Text Attention Sink): يكشف التحليل أن رمز [EOS] في CLIP يظهر انحيازًا قويًا لـ "بالوعة الانتباه"، حيث يوجه معظم انتباهه نحو رمز [SOS] (بداية الجملة) بدلاً من المحتوى الدلالي للتعبير المرجعي. هذا الافتقار إلى التركيز الدلالي الغني في رمز [EOS] يفاقم من مشكلة انعكاس التشابه.
بناءً على هذه الرؤى، يستخدم LiteLVLM عملية اختيار من مرحلتين:
الاختيار الواعي بالتشابه: بدلًا من الاحتفاظ بالرموز ذات التشابه العالي، يختار LiteLVLM الرموز البصرية ذات التشابه الأدنى مع رمز [EOS]. وقد وُجد تجريبيًا أن هذه الرموز تتوافق مكانيًا مع المناطق المرجعية، مما يحافظ على الإشارات المحلية الحاسمة لتحديد المواقع.
استعادة السياق: لمنع فقدان السياق العالمي ومعلومات الخلفية الضرورية للفصل الواضح بين المقدمة والخلفية، تقوم الطريقة باستعادة رموز إضافية بناءً على مساهمتها في رمز [CLS] (يتم قياس ذلك عبر ناقلات القيم المرجحة بالانتباه).
الاختيار التكيفي: توازن استراتيجية تكيفية ديناميكيًا بين الميزانية المخصصة للرموز الواعية بالتشابه (منخفضة التشابه) والرموز الواعية بالسياق بناءً على النص المدخل، مما يضمن الأداء الأمثل عبر مختلف التعبيرات المرجعية.
المساهمات الرئيسية
تحديد خلل حرج: يوضح المؤلفون أن طرق تقليم الرموز الحالية غير المرتبطة بالنص، وتلك التي تعتمد على التشابه البصري-النصي العالي، تؤدي أداءً ضعيفًا في تحديد المواقع البكسلية لأنها تستبعد الرموز اللازمة لتحديد المرجع نفسه.
تحليل CLIP: يقدم البحث تحليلًا جديدًا لـ CLIP، كاشفًا عن انعكاس التشابه البصري-النصي وانحياز بالوعة الانتباه لرمز [EOS]، مما يفسر سبب فشل قواعد التقليم القياسية في مهام تحديد المواقع.
LiteLVLM: اقتراح أول طريقة لتقليم الرموز خالية من التدريب ومصممة خصيصًا لتحديد المواقع البكسلية. وهي تستفيد من ترتيبات التشابه المعكوسة للاحتفاظ بالرموز الخاصة بالمرجع مع استعادة السياق، دون الحاجة إلى أي ضبط دقيق (fine-tuning).
النتائج التجريبية أُجريت تجارب واسعة النطاق على معايض الصور والفيديو، بما في ذلك RefCOCO، وRefCOCO+، وRefCOCOg، وRef-DAVVIS-17، وRefer-YouTube-VOS.
الحفاظ على الأداء: يتفوق LiteLVLM بشكل كبير على الأساليب الرائدة (مثل TRIM وLLaVA-PruMerge وVisPruner). في مجموعة اختبار RefCOCO+، يحتفظ بنسبة 90.3% من الأداء الأصلي مع تقليم 66.7% من الرموز البصرية (تقليل العدد من 576 إلى 192 رمزًا). وحتى مع تقليص بنسبة 88.9% (64 رمزًا)، فإنه يحافظ على درجة أداء نسبية قدرها 79.2%، متفوقًا على المنافسين بأكثر من 10%.
تحديد المواقع في الفيديو: في مهمة تقسيم الأشياء في الفيديو، يحافظ LiteLVLM على 99.5% من الأداء الأصلي مع تقليل الرموز بنسبة 65.9%، مما يثبت متانته تجاه التكرار الزمني.
الكفاءة: تحقق الطريقة تسريعًا في الاستدلال بنسبة 22% وتقليلًا في عبء الذاكرة بمقدار 2.3 ضعف (تخزين التنشيط) مقارنة بالنموذج الأصلي. كما أنها تقلل العمليات الحسابية (FLOPs) بأكثر من ضعفين.
التعميم: تتوسع الطريقة بفعالية لتشمل بنيات مختلفة من النماذج البصرية-اللغوية (مثل Qwen2.5-VL) والمشفرات البصرية (مثل SigLIP-2)، مما يؤكد أنها ليست مرتبطة ارتباطًا وثيقًا بتطبيق CLIP المحدد المستخدم في التحليل الأولي.
الأهمية والادعاءات يزعم البحث أن LiteLVLM يقدم حلاً عمليًا ومنخفض التكلفة لنشر النماذج البصرية-اللغوية على الأجهزة ذات الموارد المحدودة (أجهزة الحافة، الخوادم المحدودة) دون المساس بدقة تحديد المواقع على مستوى البكسل. ومن خلال عكس الحدس القياسي لأهمية الرموز في CLIP، تمكن الطريقة من تحقيق استدلال فعال مع الحفاظ على دقة عالية في مهام التقسيم. ويؤكد المؤلفون أن هذا هو أول عمل يوسع تقليم الرموز ليشمل تحديد المواقع البكسلية عبر وسائط الصور والفيديو، محققًا نتائج رائدة دون أي تدريب أو ضبط دقيق.