Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models
تقدم الورقة البحثية Sali-Cache، وهو إطار عمل استباقي للتحسين ثنائي الإشارة يجمع بين التدفق البصري وكشف البروز لضغط ذاكرة التخزين المؤقت لـ KV بكفاءة من أجل فهم الفيديو طويل التنسيق في النماذج اللغوية البصرية، محققاً وفراً كبيراً في الذاكرة دون المساس بالدقة.
تخيل أنك تحاول مشاهدة فيلم مدته ساعتان على جهاز كمبيوتر محمول، لكن "الذاكرة قصيرة المدى" (RAM) لجهازك صغيرة جدًا بحيث لا يمكنها استيعاب سوى آخر 5 دقائق من الفيلم. وبمجرد أن يتجاوز الفيلم حاجز الـ 5 دقائق، يتعطل الجهاز لأنه يحاول تذكر الكثير من المعلومات في وقت واحد.
هذه هي بالضبط المشكلة التي تواجهها نماذج الرؤية واللغة (الذكاء الاصطناعي الذي يرى ويتحدث) عند محاولة فهم مقاطع الفيديو الطويلة. فهي تشعر بالارتباك بسبب الكم الهائل من البيانات المرئية.
تقدم الورقة البحثية حلاً ذكيًا يسمى Sali-Cache. فكر فيه كأنه أمين مكتبة ذكي واستباقي لذاكرة الذكاء الاصطناعي، وليس مجرد أمين مكتبة يستجيب للأحداث بعد وقوعها.
إليك كيف يعمل، مقسمًا عبر تشبيهات من الحياة اليومية:
المشكلة: الذكاء الاصطناعي "المُكنّز"
تعمل نماذج الذكاء الاصطناعي الحالية مثل طالب يحاول حفظ كل كلمة في الكتاب المدرسي قبل الإجابة على سؤال ما.
المشكلة: إذا كان الكتاب عبارة عن فيديو مدته ساعتان، سيحاول الطالب كتابة كل إطار (Frame) بدقة. دفتر ملاحظاته (ذاكرة الكمبيوتر) سيمتلئ فورًا، وسيتعطل النظام.
الحل القديم (الاستجابي): حاولت بعض الطرق السابقة المساعدة من خلال السماح للطالب بكتابة كل شيء أولاً، ثم النظر في الملاحظات وحذف الأجزاء المملة. هذا أمر هدِر لأن الطالب بذل طاقة في كتابة أشياء كان سيحذفها على أي حال.
الحل: Sali-Cache (أمين المكتبة الذكي)
يغير Sali-Cache قواعد اللعبة. فبدلاً من كتابة كل شيء ثم الحذف، هو يقرر ما يجب الاحتفاظ به قبل حتى أن يبدأ في كتابته. إنه يستخدم "مستشعرين" لتصفية الفيديو في الوقت الفعلي.
التشبيه: تخيل مشاهدة فيديو لشخص يجلس ساكنًا في غرفة يتحدث. بين الإطار الأول والإطار الثاني، لا يتغير شيء حقًا. الخلفية هي نفسها، والشخص في نفس المكان.
كيف يعمل Sali-Cache: يستخدم أداة تسمى "تدفق بصري" (Optical Flow) (مثل مستشعر الحركة) ليرى ما إذا كان الإطار الحالي هو مجرد نسخة مكررة من الإطار السابق.
النتيجة: إذا لم يتغير المشهد، يقول أمين المكتبة: "لا داعي لكتابة هذا! لدي بالفعل الملاحظات من الثانية الماضية". إنه ببساطة يشير إلى الملاحظات القديمة. هذا يوفر مساحة هائلة وطاقة كبيرة لأن الذكاء الاصطناعي لا يضطر لإعادة حساب الشيء نفسه مرتين.
التشبيه: الآن تخيل أن الفيديو يعرض شارعًا مزدحمًا. هناك أشخاص، سيارات، وسماء زرقاء زاهية. لا يحتاج الذكاء الاصطناعي لتذكر تفاصيل ملمس كل طوبة في الجدار أو لون السماء بدقة عالية. هو يحتاج فقط لتذكر الأشخاص والسيارات بوضوح.
كيف يعمل Sali-Cache: يعمل مثل بقعة الضوء (Spotlight). يقوم بمسح الصورة للعثور على الأجزاء "المثيرة للاهتمام" (الوجوه، النصوص، الأجسام المتحركة) والأجزاء "المملة" (السماء، الجدران، العشب).
الأجزاء المهمة: يحتفظ بها بـ دقة عالية (مثل صورة واضحة تمامًا).
الأجزاء المملة: يقلص حجمها إلى دقة منخفضة أو يحذفها تمامًا. الأمر يشبه التقاط صورة لزحام، مع جعل الخلفية ضبابية (Blur) لكي تتمكن من استيعاب عدد أكبر من الأشخاص في الإطار.
النتيجة السحرية
من خلال استخدام هذين المرشحين قبل أن يبدأ الذكاء الاصطناعي في إجراء حساباته الثقيلة، يحقق Sali-Cache أمرين مذهلين:
يضاعف سعة الذاكرة: توضح الورقة البحثية أنه يمكنه ضغط استخدام الذاكرة بمقدار 2.2 مرة. وهذا يعني أن الذكاء الاصطناعي الذي كان بإمكانه سابقًا مشاهدة فيديو مدته 3 دقائق فقط، يمكنه الآن مشاهدة فيديو مدته 6 دقائق على نفس الكمبيوتر دون أن يتعطل.
لا يفقد ذكاءه: على الرغم من أنه حذف "البيانات المملة"، إلا أن الذكاء الاصطنافي لا يزال يجيب على الأسئلة بنسبة 100% صحيحة. الأمر يشبه قراءة كتاب قام المؤلف فيه بحذف جميع الأوصاف المملة للطقس، لكن القصة والحبكة تظل مثالية.
لماذا يهم هذا؟
للناس العاديين: هذا يعني أنه يمكننا تشغيل مساعدي فيديو يعملون بالذكاء الاصطناعي القوي على أجهزة الكمبيوتر المحمولة أو الهواتف الخاصة بنا، وليس فقط على أجهزة الكمبيوتر العملاقة المكلفة والضخمة.
للمستقبل: يسمح للذكاء الاصطناعي بفهم القصص الطويلة والمعقدة (مثل الأفلام الكاملة أو لقطات كاميرات المراقبة) دون الحاجة إلى ترقية الأجهزة باستمرار.
باخت de مختصر: Sali-Cache هو مثل المحرر الذكي الذي يقص الأجزاء المملة من الفيلم قبل أن تبدأ أنت في مشاهدته، حتى تتمكن من الاستمتاع بالقصة كاملة دون أن ينفجر عقلك (أو حاسوبك).
إليك ملخص تقني مفصل لورقة البحث بعنوان "تحسين ذاكرة التخزين المؤقت (KV-Cache) التكيفي ثنائي الإشارة لفهم الفيديو طويل المدى في النماذج البصرية اللغوية" (Sali-Cache).
١. بيان المشكلة
تواجه النماذج البصرية اللغوية (VLMs) عنق زجاجة في الذاكرة عند معالجة محتوى الفيديو طويل المدى.
عنق الزجاجة: تنمو ذاكرة التخزين المؤقت للمفاتيح والقيم (KV cache) في بنيات المحولات (Transformer) خطياً مع طول التسلسل. في معالجة الفيديو، يولد الإطار الواحد مئات الرموز البصرية (على سبيل المثال، ٥٧٦ رمزاً لكل إطار في LLaVA 1.6). عند معدلات الإطارات القياسية، يتسبب هذا في استنفاد ذاكرة وحدة معالجة الرسومات (VRAM) بسرعة (على سبيل المثال، تفشل وحدة معالجة رسومات بسعة ٢٤ جيجابايت في أقل من ٤ دقائق لفيديو بمعدل ٣٠ إطاراً في الثانية).
محدودية الحلول الحالية: تستخدم الطرق الحالية مثل Heavy-Hitter Oracle (H2O) استراتيجيات طرد تفاعلية (reactive). فهي تحسب مصفوفات الانتباه الكاملة لجميع الرموز قبل اتخاذ قرار بشأن الرموز التي سيتم التخلص منها. يؤدي هذا إلى نموذج "الحوسبة ثم التخلص"، مما يهدر موارد حوسبية كبيرة على رموز سيتم استبعادها فوراً. أما الطرق الأخرى (النوافذ المنزلقة، التكميم الموحد) فإما أنها تفقد السياق طويل المدى أو تفشل في الاستفادة من التكرار الدلالي المتأصل في بيانات الفيديو.
٢. المنهجية: Sali-Cache
يقترح المؤلفون Sali-Cache، وهو إطار عمل تحسين استباقي (a priori) يدير الذاكرة قبل الدخول في حسابات الانتباه المكلفة. وهو يستخدم خط أنابيب تصفية ثنائي المستويات يعتمد على إشارتين متكاملتين:
أ. التصفية الزمنية (التدفق البصري - Optical Flow)
الهدف: اكتشاف التكرار بين الإطارات.
الآلية: يستخدم تحليل التدفق البصري لحساب الإزاحة على مستوى البكسل بين الإطارات المتتالية (FN و FN−1).
المنطق: إذا تجاوزت درجة التكرار (Rframe) حداً معيناً، يُصنف الإطار على أنه مكرر زمنياً.
الإجراء: بدلاً من حساب أزواج KV جديدة، يقوم النظام بإعادة استخدام مدخلات التخزين المؤقت من الإطار السابق عبر مؤشر (pointer). هذا يتخطى كل من الحوسبة وتخصيص الذاكرة للمشاهد الثابتة أو بطيئة الحركة.
الهدف: تحسين تخصيص الذاكرة بناءً على الأهمية البصرية داخل الإطار.
الآلية: توليد خريطة بروز باستخدام تقنيات الرؤية الحاسوبية الكلاسيكية (كشف حواف Canny وتباین مساحة ألوان LAB) لتحديد المناطق الهامة (الوجوه، النصوص، الأشياء) مقابل الخلفية.
الإجراء: يتم تعيين الرقع (patches) إلى واحد من أربعة مستويات تكميم بناءً على درجة بروزها (si):
FP16: بروز عالٍ (يُحفظ للتفاصيل الحرجة).
INT8: بروز متوسط إلى عالٍ.
INT4: بروز منخفض إلى متوسط.
المستبعد (Pruned): بروز منخفض (يتم التخلص من عناصر الخلفية تماماً).
إزالة الكمية في الوقت المناسب (JIT Dequantization): يتم إلغاء تكميم المدخلات فقط أثناء خطوة حساب الانتباه للحفاظ على الدقة حيثما لزم الأمر مع تقليل التخزين.
٣. المساهمات الرئيسية
إطار عمل استباقي: ينقل إدارة ذاكرة التخزين المؤقت (KV-cache) من النهج التفاعلي (ما بعد الحوسبة) إلى النهج الاستباقي (ما قبل الحوسبة)، مما يلغي الحسابات الضائعة على الرموز المعد للتخلص منها.
التكيف ثنائي الإشارة: يدمج اكتشاف التكرار الزمني (التدفق البصري) والبروز المكاني (Saliency) لضغط البيانات بذكاء.
غير مرتبط ببنية محددة (Architecture Agnostic): مصمم للعمل مع النماذج البصرية اللغوية الحالية (تم إثبات ذلك على LLaVA 1.6) دون الحاجة لإعادة تدريب النموذج.
تحليل شامل للمقايضات: يوفر تفصيلاً دقيقاً للمقايضة بين زمن الاستجابة (latency) وتوفير الذاكرة.
٤. النتائج التجريبية
أُجريت التجارب على نموذج LLaVA 1.6 (ببنية Mistral 7B) باستخدام NVIDIA RTX 3090 (سعة ٢٤ جيجابايت VRAM).
كفاءة الذاكرة:
حقق نسبة ضغط بلغت ٢.٢٠ ضعفاً في استخدام الذاكرة الفعلي مقارنة بالنموذج الأساسي.
قلل ذروة استخدام VRAM من ١٧.١٩ جيجابايت (الأساسي) إلى ١٦.٧٠ جيجابايت، مما مكن من معالجة فيديوهات أطول بمرتين من المعتاد ضمن نفس ميزانية الذاكرة.
توزيع الرقع (Patch Distribution): تم تخطي ٢٦.٧٪ من الرقع (إعادة استخدام التخزين المؤقت)، وتم استبعاد ١٣.١٪، وتكميم ٢١.٤٪ إلى INT4، و٧.١٪ إلى INT8.
الدقة:
حافظ على دقة ١٠٠٪ عبر مقاييس BLEU وROUGE-L وExact Match مقارنة بالنموذج الأساسي. وهذا يثبت أن الضغط الشديد لا يضعف الفهم الدلالي.
زمن الاستجابة (Latency):
أضاف عبئاً حوسبياً بنسبة ٢٣.٦٪ لكل إطار مقارنة بالنموذج الأساسي.
التبرير: يرى المؤلفون أن هذا العبء مقبول لأنه يتيح معالجة فيديوهات طويلة المدى قد تؤدي لولا ذلك إلى أخطاء نفاذ الذاكرة (OOM)، وهي مقايضة مواتية للتحليل غير المتزامن والمعالجة بالدفعة (batch processing).
٥. الأهمية
تمكين فهم الفيديو طويل المدى: يحل Sali-Cache مشكلة "جدار نفاذ الذاكرة" (OOM wall) للأجهزة الاستهلاكية، مما يسمح للنماذج البصرية اللغوية بمعالجة تسلسلات فيديو ممتدة (مثل أكثر من ٥ دقائق) كانت غير ممكنة سابقاً.
تحول في نموذج الكفاءة: يتحدى النهج القياسي للإقصاء التفاعلي من خلال إثبات أن التصفية ما قبل الحوسبة أكثر كفاءة من الحوسبة ثم التخلص.
النشر العملي: من خلال الاستفادة من طرق الرؤية الحاسوبية الكلاسيكية (التدفق البصري، Canny) بدلاً من الشبكات العصبية الثقيلة لخطوة التصفية، يحافظ الأسلوب على انخفاض العبء الحوسبي مع تقديم توفير هائل في الذاكرة.
القابلية للتوسع: إطار العمل قابل للتعميم على نماذج بصرية لغوية أخرى ويقدم مساراً لأنظمة ذكاء اصطنا_متعددة الوسائط قابلة للتوسع على الأجهزة ذات الموارد المحدودة.
في الختام، يمثل Sali-Cache تقدماً كبيراً في كفاءة النماذج البصرية اللغوية، حيث يثبت أن الإدارة الذكية للذاكرة القائمة على الإشارات يمكن أن توسع بشكل كبير قدرات النماذج البصرية اللغوية دون التضحية بالدقة.