← أحدث الأبحاث
💬 NLP

KVzap: Fast, Adaptive, and Faithful KV Cache Pruning

تُعد KVzap طريقة سريعة وتكيفية مع المدخلات لتقليم ذاكرة التخزين المؤقت لـ KV، حيث تحقق ضغطاً فائقاً مع فقدان ضئيل جداً في الدقة عبر مختلف النماذج اللغوية الكبيرة والمهام، مما يعالج عقبة الاستدلال الحرجة الناتجة عن تزايد أطوال السياق.

المؤلفون الأصليون: Simon Jegou, Maximilian Jeblick

نُشر 2026-02-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Simon Jegou, Maximilian Jeblick

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقرأ كتاباً طويلاً جداً، وفي كل مرة تقلب فيها صفحة، يتعين عليك الاحتفاظ بملاحظة ذهنية لكل كلمة قرأتها حتى الآن لتفهم القصة. ومع ازدياد طول الكتاب، يصبح عقلك (أو في هذه الحالة ذاكرة الكمبيوتر) مثقلاً بمحاولة التمسك بكل كلمة قرأتها. هذا هو المشكلة التي تواجهها نماذج الذكاء الاصطناعي الحديثة: فكلما قرأت نصوصاً أطول وأطول، تنفد "المساحة الذهنية" (الذاكرة) المتاحة لها لتتبع الأجزاء المهمة.

تقدم هذه الورقة البحثية أداة جديدة تسمى KVzap، والتي تعمل كأمين مكتبة فائق الكفاءة لنماذج الذكاء الاصطناعي هذه. وإليك كيف تعمل، مقسمة إلى مفاهيم بسيطة:

المشكلة: "الفوضى الذهنية"

عندما يقرأ الذكاء الاصطناعي جملة، فإنه ينشئ زوجاً من "المفتاح والقيمة" (Key-Value أو KV) لكل كلمة. فكر في هذه الأزواج كأنها ملاحظات لاصقة مكتوب عليها الكلمة ومخزنة في كومة ضخمة.

  • عنق الزجاجة: إذا قرأ الذكاء الاصطناعي مستنداً مكوناً من 100,000 كلمة، فسيكون لديه 100,000 ملاحظة لاصقة. والاحتفاظ بكل هذه الملاحظات يستنزف كمية هائلة من الذاكرة، مما يؤدي إلى إبطاء الذكاء الاصطناعي وجعل تشغيله مكلفاً.
  • الطريقة القديمة: حاولت الطرق السابقة التخلص من الملاحظات اللاصقة بناءً على قواعد بسيطة (مثل "احتفظ فقط بآخر 100 كلمة" أو "احتفظ بالكلمات التي ظهرت أكثر من غيرها"). لكن هذه القواعد كانت غالباً بدائية للغاية، حيث كانت تتخلص من المعلومات المهمة عن طريق الخطأ، مما يجعل الذكاء الاصطناعي يرتكب الأخطاء.

الحل: KVzap (أمين المكتبة الذكي)

إن KVzap هي طريقة جديدة تقرر أي الملاحظات اللاصقة يجب الاحتفاظ بها وأيها يجب التخلص منها، ولكنها تفعل ذلك بسرعة، بذكاء، وبأمانة (دون فقدان سياق القصة).

إليك تشبيه لكيفية عمل KVzap:

1. مشكلة "التحقق المزدوج" (الطريقة القديمة)
كانت هناك طريقة سابقة رفيعة المستوى تسمى KVzip. وكانت تعمل كالتالي: لتحديد ما إذا كانت الكلمة مهمة، كان على الذكاء الاصطناعي أن يتظاهر بقراءة الكتاب بأكمله مرة أخرى ليرى الكلمات التي أولاها اهتماماً.

  • العيب: هذا يشبه مطالبة طالب بقراءة فصل، ثم مطالبته بقراءته مرة ثانية فقط ليقرر أي الجمل كانت مهمة. هذا الأمر بطيء جداً ويستهلك الكثير من الطاقة. كما أنه لم يكن بإمكانه العمل أثناء قيام الذكاء الاصطناعي بالكتابة (التوليد/decoding)، بل كان يعمل فقط أثناء القراءة.

2. اختصار KVzap
يحل KVzap هذه المشكلة عبر تدريب "مساعد" صغير فائق السرعة (شبكة عصبية صغيرة) لتخمين الكلمات المهمة دون إعادة قراءة النص.

  • التشبيه: تخيل أمين مكتبة متمرس قد قرأ آلاف الكتب. بدلاً من إعادة قراءة كتاب جديد للعثور على أجزائه المهمة، يلقي أمين المكتبة نظرة خاطفة على الصفحة ويعرف فوراً: "هذه الفقرة حيوية، احتفظ بها. أما تلك فهي مجرد حشو، تخلص منها".
  • كيف يتعلم: قام الفريق بتدريب هذا "المساعد" عبر إظهار "الحالات الخفية" (hidden states) الخاصة بالذكاء الاصطناعي له، وطلب منه التنبؤ بما كان سيقوله أسلوب "التحقق المزدوج" البطيء. تعلم المساعد محاكاة الخبير بدقة تامة ولكن في جزء ضئيل من الثانية.

3. شبكة الأمان "النافذة المنزلقة" (Sliding Window)
للتأكد من أن الذكاء الاصطناعي لا ينسى السياق المباشر (مثل آخر بضع جمل كتبها للتو)، يحتفظ KVzap بـ "نافذة منزلقة" تضم آخر 128 كلمة.

  • التشبيه: حتى لو كنت تلخص رواية كاملة، فإنك تحتفظ دائماً بالصفحات القليلة الأخيرة في يدك حتى لا تفقد مكانك. يحتفظ KVzap بهذه الكلمات الأخيرة آمنة ولا يتخلص منها أبداً.

لماذا يعد هذا أمراً هاماً؟

تدعي الورقة البحثية أن KVzap تُعد تغييراً لقواعد اللعبة لثلاثة أسباب رئيسية:

  • إنها سريعة: لا تضيف وقتاً إضافياً تقريباً إلى العملية. الأمر يشبه امتلاك أمين مكتبة يقوم بفرز الكتب بينما لا تزال أنت في طريقك للدخول إلى المكتبة.
  • إنها قابلة للتكيف: لا تستخدم قاعدة ثابتة (مثل "احتفظ بـ 50% من الملاحظات"). بدلاً من ذلك، هي تنظر إلى النص؛ فإذا كان النص معقداً وكثيفاً، فإنها تحتفظ بمزيد من الملاحظات. وإذا كان النص مكرراً، فإنها تتخلص من المزيد. إنها تتكيف تلقائياً.
  • إنها دقيقة: في الاختبارات المتعلقة بمهام القراءة الطويلة (مثل الإجابة على أسئلة من مستند مكون من 4,000 كلمة) ومهام الاستنتاج (مثل حل المسائل الرياضية)، تمكن KVzap من تقليص استخدام الذاكرة بمقدار 2 إلى 4 مرات مع الحفاظ على دقة الذكاء الاصطناعي لتكون مطابقة تقريباً لما لو كان يحتفظ بجميع الملاحظات.

النتائج

اختبر الباحثون هذا النظام على نماذج ذكاء اصطناي شهيرة (مثل Qwen و Llama). ووجدوا أن:

  • KVzap تفوق على 15 طريقة موجودة حالياً.
  • حقق أفضل النتائج في لوحة صدارة المهام ذات السياق الطويل.
  • يعمل لكل من قراءة المستندات الطويلة (prefilling) وكتابة القصص الطويلة أو حل المشكلات خطوة بخطوة (decoding).

باختصار

KVzap تشبه منح الذكاء الاصطناعي "مرشحاً ذكياً" يعرف فوراً الأجزاء الجوهرية من محادثة طويلة أو مستند طويل، والأجزاء التي ليست سوى ضجيج. إنها تسمح للذكاء الاصطناعي بالتعامل مع نصوص أطول بكثير دون نفاد الذاكرة أو الارتباك، وكل ذلك دون إبطاء العملية. ويعتقد المؤلفون أن هذا يجعلها جاهزة للاستخدام في أنظمة الذكاء الاصطناعي الكبرى في العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →