DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
يُعد DeltaKV إطار عمل لضغط ذاكرة التخزين المؤقت (KV cache) القائم على المتبقيات، والذي يستفيد من تشابه الرموز بعيد المدى لتقليل استخدام الذاكرة إلى 29% من الأصل، مقترناً بمحرك Sparse-vLLM عالي الأداء لتحقيق تحسن في الإنتاجية يصل إلى ضعفين في سيناريوهات السياق الطويل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول كتابة رواية ملحمية ضخمة مكونة من ألف صفحة. لكي تحافظ على اتساق قصتك، تحتاج إلى تذكر كل ما كتبته حتى الآن — لون عيون كل شخصية، كل تحول في الحبكة، وكل مكان.
في عالم الذكاء الاصطناعي (نماذج اللغات الكبيرة - LLMs)، تُسمى هذه "الذاكرة" بـ KV Cache. المشكلة هي أنه كلما طالت القصة، أصبحت الذاكرة المطلوبة ضخمة للغاية لدرجة أنها ستؤدي في النهاية إلى تعطل "دماغ" الكمبيوتر (وحدة معالجة الرسومات - GPU).
حالياً، يحاول باحثو الذكاء الاصطناعي حل هذه المشكلة بطريقتين:
- طريقة الممحاة (الإقصاء - Eviction): يقومون ببساطة برمي الصفحات القديمة لتوفير المساحة. لكن إذا رميت الصفحة التي قدمت فيها الشرير، فستتوقف القصة عن كونها منطقية.
- طريقة قلم التحديد (التناثر - Sparsity): يحتفظون بكل شيء ولكنهم "ينظرون" فقط إلى أجزاء محددة. هذا يوفر الوقت، ولكنه لا يوفر مساحة فعلية كبيرة في المكتبة.
DeltaKV هي طريقة ثالثة، أكثر ذكاءً بكثير. وإليك كيف تعمل باستخدام ثلاث تشبيهات بسيطة:
1. استراتيجية "الصورة المرجعية" (التشابه بعيد المدى)
تخيل أنك محقق ينظر إلى آلاف صور مسرح الجريمة. بدلاً من حفظ كل بكسل في كل صورة، تدرك أن العديد من الصور تبدو متطابقة تقريباً.
بدلاً من تخزين 1,000 صورة كاملة، تختار 10 "صور مرجعية رئيسية". وبالنسبة لكل صورة أخرى، لا تحفظ الصورة بأكملها؛ بل تكتب فقط ملاحظة صغيرة: "هذه الصورة تشبه تماماً الصورة المرجعية رقم 3، لكن المشتبه به يرتدي قبعة حمراء بدلاً من الزرقاء".
تقوم DeltaKV بهذا بالضبط. فهي تدرك أن العديد من أجزاء ذاكرة الذكاء الاصطناعي متكررة. فهي تحفظ بعض "الرموز المرجعية" (Reference Tokens)، وبالنسبة لكل شيء آخر، تقوم فقط بتخزين "الفرق" (Delta). وهذا هو السبب في قدرتها على تقليص استخدام الذاكرة إلى 29% فقط من حجمها الأصلي دون أن تفقد مسار القصة.
2. مفهوم "الرسم التخطيطي مقابل اللوحة الزيتية" (المكونات المشتركة العالية)
فكر في لوحة طبيعية. معظم اللوحة مليء بالأشياء "المشتركة": زرقة السماء، خضرة العشب، وملمس السحب. لست بحاجة لوصف السماء الزرقاء في كل مرة تذكر فيها شجرة.
لاحظت DeltaKV أن مخازن KV تحتوي على "مكونات كامنة عالية المعيار" (High-Norm Latent Components) — أي وجود الكثير من "السماء الزرقاء" المشتركة عبر جميع الرموز (tokens). تقوم DeltaKV بتجريد كل هذا "الضجيج الخلفي" المشترك وتخزين "التفاصيل" الفريدة فقط (مثل الشجرة المحددة أو الطائر المحدد). ولأن "التفاصيل" أصغر وأبسط بكثير من "اللوحة الكاملة"، فإن ضغطها يكون سهلاً للغاية.
3. "المسار السريع" (Sparse-vLLM)
حتى لو كان لديك دفتر ملاحظات صغير ومضغوط، فلا تزال بحاجة إلى طريقة سريعة لقراءته. إذا كنت ستقضي عشر دقائق في فك تشفير كل ملاحظة صغيرة، فستكون بطيئاً جداً لدرجة تمنعك من أن تكون مفيداً.
لقد بنى الباحثون محركاً متخصصاً يسمى Sparse-vLLM. فكر في هذا المحرك كأنه ماسح ضوئي عالي السرعة مصمم خصيصاً لقراءة "الملاحظات المختصرة". ولأنه يعرف تماماً كيف تم هيكلة ملاحظات DeltaKV، يمكنه تجاوز "الكتب الكاملة" والقفز مباشرة إلى "الاختصارات"، مما يسمح للذكاء الاصطناعي بالعمل بسرعة أكبر بمقدار ضعفين (2x) من ذي قبل.
الخلا الخلاصة
تحول DeltaKV مكتبة ضخمة وثقيلة من الكتب الكاملة إلى مجلد رشيق وفعال من "المراجع الرئيسية" و"الملاحظات المختصرة السريعة".
النتيجة: يمكنك إعطاء الذكاء الاصطناعي "قصصاً" (سياقات) أطول بكثير للقراءة والكتابة، وهو يستخدم أجهزة أقل تكلفة، ويفعل كل ذلك دون أن ينسى من هو الشرير.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.