ملخص تقني: VisCo – توظيف النماذج اللغوية الكبيرة كأجهزة تشفير جوهرية للضغط الرمزي البصري
1. بيان المشكلة
تعالج نماذج الرؤية واللغة (VLMs) عادةً الصور عالية الدقة عن طريق تشفيرها إلى عدد كبير من الرموز البصرية (Visual Tokens). يؤدي هذا إلى زمن انتقال استدلالي (Inference Latency) كبير وحمل مفرط على الذاكرة بسبب التعقيد التربيعي لآليات الانتباه الذاتي (Self-attention) ومتطلبات تخزين ذاكرة المفتاح والقيمة (KV cache). تعيق هذه العقبة نشر نماذج الرؤية واللغة في السيناريوهات محدودة الموارد وفي الوقت الفعلي.
تنقسم الحلول الحالية لضغط الرموز البصرية إلى فئتين، كلتاهما تعاني من قيود كبيرة:
- الطرق الخالية من التدريب (Training-free): تعتمد على مقاييس استدلالية (مثل درجات الانتباه أو تشابه الميزات) للتقليم أو الدمج. ورغم كفاءتها، إلا أنها تعاني من تدهور كبير في الأداء تحت نسب الضغط العالية. كما أنها عرضة لـ "انزياح الانتباه" (Attention shift)، مما يؤدي إلى الهلوسة، وغالباً ما تفشل في الحفاظ على الدلالات العالمية الموجهة نصياً أو التفاصيل الدقيقة.
- الطرق القائمة على التدريب (Training-based): تُدخل وحدات ضغط خارجية أو تتطلب إعادة تدريب واسعة النطاق (بما في ذلك إعادة المحاذاة والضبط التعليمي). ورغم كونها أكثر قوة، إلا أنها تكبد تكاليف إعادة تدريب باهظة، وتؤثر على المعارف المسبقة لنموذج الرؤية واللغة، وغالباً ما تفتقر إلى مرونة "التوصيل والتشغيل" (Plug-and-play).
يتمثل التحدي الجوهري في تحقيق ضغط فعال للرموز البصرية يحافظ على الدقة الدلالية تحت الضغط الشديد (مثل تقليل الرموز إلى وحدة واحدة فقط) دون الحاجة إلى إعادة تدريب هائلة أو وحدات خارجية.
2. المنهجية: إطار عمل VisCo
يقترح المؤلفون VisCo، وهو إطار عمل ذاتي الضغط يتسم بكفاءة التدريب، حيث يعيد استخدام نموذج الرؤية واللغة المدرب مسبقاً نفسه كضاغط جوهري. تم تصميم VisCo كـ مشفر تلقائي غير متماثل (Asymmetric VLM Autoencoder) ببارامترات مشتركة، يعمل عبر مرحلتين:
أ. البنية غير المتماثلة (Asymmetric Architecture)
- مرحلة الترميز (Encoding Stage): يعزز الإطار هيكل نموذج الرؤية واللغة المدرب مسبقاً بوحدة خفيفة الوزن قابلة للتدريب. وتحديداً، يقدم مجموعة صغيرة من رموز الذاكرة (Xm) القابلة للتعلم ويستخدم محولات LoRA على إسقاطات Q/V. يقوم المرمز بمعالجة التسلسل المشترك للرموز البصرية (Xv) ورموز الذاكرة (Xm).
- مرحلة فك الترميز (Decoding Stage): يتم إزالة محولات LoRA، ويُعاد استخدام هيكل نموذج الرؤية واللغة الأصلي والمجمد مباشرة كفك للترميز. يضمن هذا التصميم أن VisCo يتطلب فقط تكييفاً خفيف الوزن للقدرات الموجودة بدلاً من إعادة تعلم عملية التوليد متعدد الوسائط من الصفر.
ب. بناء التسلسل والقناع السببي (Causal Masking)
يلتزم VisCo بصرامة بآلية القناع السببي القياسية لنماذج فك الترميز (Decoder-only VLMs). يتم إلحاق رموز الذاكرة بعد الرموز البصرية في التسلسل المدخل. يسمح هذا لرموز الذاكرة بالانتباه بشكل طبيعي إلى جميع الرموز البصرية السابقة باستخدام أولوية الانتباه الجوهرية للنموذج، مما يجمع معلومات بصرية غنية دون تقديم قواعد تفاعل مخصصة.
ج. تجميع المعلومات الهرمي وتمريرها
إدراكاً منه أن طبقات الـ Transformer تُظهر تخصصاً وظيفياً (الطبقات الدنيا تشفر الأنماط المحلية، والطبقات العليا تشفر الدلالات المجردة)، يستخدم VisCo آلية تمرير معلومات هرمية:
- بناء بنك الذاكرة: أثناء الترميز، وبدلاً من تمرير الحالات المخفية النهائية إلى فك الترميز، يحتفظ النظام بمصفوفات المفتاح (K) والقيمة (V) المقابلة فقط لرموز الذاكرة عند كل طبقة l. يتم تخزين هذه المصفوفات في بنك ذاكرة طبقي (Kmem,Vmem).
- فك الترميز الهرمي: أثناء فك الترميز، يتم ملء ذاكرة الـ KV لكل طبقة مباشرة في ذاكرة الـ KV الخاصة بفك الترميز. يتيح ذلك لفك الترميز الوصول إلى معلومات دلالية متعددة المستويات (من الأنسجة منخفضة المستوى إلى الخطاب عالي المستوى) دون الحاجة إلى طبقات إسقاط، مستفيداً من مشاركة البارامترات بين المرمز وفك الترمين.
د. هدف التدريب
يتم ضبط VisCo نهائياً (Fine-tuning) باستخدام "فرض المعلم" (Teacher Forcing) لتعظيم الاحتمالية الشرطية للإجابة الصحيحة بناءً على الذاكرة المضغوطة والمدخلات النصية. لا يتم إدخال أي أهداف تدريب مسبقة إضافية.
3. المساهمات الرئيسية
- إطار عمل ضغط ذاتي جوهري غير متماثل: يستخدم VisCo نموذج الرؤية واللغة نفسه كضاغط، مما يحافظ على الهيكل الأساسي ويتطلب فقط تدريباً خفيف الوزن (LoRA + رموز ذاكرة قابلة للتعلم).
- آلية تمرير المعلومات الهرمية: يقدم المنهج آلية لنقل الدلالات متعددة المستويات من طبقات المرمز إلى فك الترميز عبر ذاكرة الـ KV الطبقية، مما يحافظ على الهيكل الهرمي للمعلومات البصرية تحت الضغط.
- تقييم شامل: أظهرت التجارب المكثفة عبر 3 هياكل لـ VLMs (وهي LLaVA-1.5-7B، وQwen2-VL-2B، وQwen2-VL-7B) و6 معايير قياسية تفوقاً مستمراً على الطرق الموجودة، لا سيما تحت الضغط الشديد.
4. النتائج التجريبية
يقيم البحث VisCo على معايير تشمل GQA، وMMB، وMMB-CN، وMME، وPOPE، وMMVet.
الأداء تحت الضغط الشديد:
- في نموذج LLaVA-1.5-7B (من 576 رمزاً ← 32 رمزاً)، يحتفظ VisCo بـ 91.8% من الأداء الأصلي، متفوقاً على أفضل نموذج مرجعي (VisPruner) بمقدار 4.0 نقطة في متوسط الدرجات.
- في إعداد الرمز الواحد المتطرف (1 رمز)، يحتفظ VisCo بـ 85.3% من الأداء الأصلي، متفوقاً بشكل ملحوظ على الطرق الخالية من التدريب (مثل SparseVLM التي حققت ~72.6%)، بل ويتجاوز حتى المراجع القوية القائمة على التدريب مثل MatryoshkaQuery وVoCl-LLaMA في مقاييس محددة.
- في نموذج Qwen2-VL-2B (الذي يحتوي بالفعل على ضغط مدمج)، يحتفظ VisCo بـ 95.2% من الأداء عند الاحتفاظ بـ 25% من الرموز، و91.4% عند الاحتفاظ بـ 12.5%، متفوقاً على النماذج المرجعية مثل VisionZip.
التحليل النوعي:
- ينجح VisCo في التقاط سياق المشهد العام والمناطق الرئيسية حتى مع وجود عدد قليل جداً من الرموز، بينما تفقد طرق التقليم القائمة على الانتباه السياق العالمي والتفاصيل.
- في إعداد الرمز الواحد، يمكن لـ VisCo توليد أوصاف تفصيلية تحتوي على وصف لمستوى الأشياء ودلالات عالمية متماسكة.
الكفاءة:
- يقلل VisCo بشكل كبير من تخزين ذاكرة الـ KV.
- رغم أن خطوة الترميز الأولية تسبب عبئاً إضافياً، إلا أن VisCo يحقق سرعات فك ترميز أسرع. في سيناريوهات الحوار متعدد الأدوار، يسمح إعادة استخدام التمثيلات المخزنة لـ VisCo بتجاوز زمن انتقال الطرق الخالية من التدريب (مثل FastV) بعد ثلاث جولات حوار فقط.
التمثيلات المتكاملة:
- أظهرت دراسة الاستبعاد (Ablation study) لـ (+VisCo) أن الجمع بين رموز الذاكرة المتعلمة والرموز البصرية الأصلية يمكن أن يحسن فعلياً أداء النموذج الأساسي في عدة معايير. يشير هذا إلى أن رموز الذاكرة تلتقط معلومات مكملة بدلاً من كونها مجرد مجموعة فرعية مضغوطة.
5. الأهمية والادعاءات
يزعم البحث أن الاستفادة من الأولويات الجوهرية لنماذج الرؤية واللغة المدربة مسبقاً تتيح ضغطاً قوياً للرموز البصرية مع تدريب خفيف الوزن فقط.
- تجاوز المقايضات: يتجنب VisCo التدهور الحاد في الأداء الذي تعاني منه الطرق الخالية من التدريب تحت الضغط العالي، وتكاليف إعادة التدريب الثقيلة التي تفرضها الأساليب القائمة على الوحدات الخارجية.
- نمط المعالجة الأصلي: من خلال اتباع نمط المعالجة الأصلي لنموذج الرؤية واللغة (باستخدام القناع السببي ومشاركة البارامترات) بدلاً من إعادة كتابته، يحقق VisCo أداءً منافساً للطرق ثقيلة الوزن مع الحفاظ على مرونة التكيف الخفيف.
- ما وراء الضغط: يشير المؤلفون إلى أن رموز الذاكرة المتعلمة تعمل كتمثيلات مكملة تثري الميزات البصرية، مما قد يحسن النموذج بما يتجا_ مجرد كفاءة الضغط.
يخلص العمل إلى أن الضغط الفعال للرموز البصرية يعتمد على قدرات ترميز قوية موجودة بالفعل في نماذج الرؤية واللغة المدربة مسبقاً، والتي يمكن فتح آفاقها من خلال أطر الضغط الذاتي الفعالة مثل VisCo. ويقترح العمل مستقبلاً استكشاف التخصيص التكيفي للرموز والتوسع في ضغط الفيديو.