← أحدث الأبحاث
🤖 machine learning

A Simple Plug-in for Improving Eviction-Based KV Cache Compression

تقدم الورقة البحثية VECTOR، وهو ملحق لضغط ذاكرة التخزين المؤقت لـ KV القائم على الإخلاء، والذي يعزز استنتاج النماذج اللغوية الكبيرة ذات السياق الطويل من خلال تنفيذ استراتيجية توجيه الرموز ثلاثية المسارات (الاحتفاظ، والتقريب، والإخلاء) لاستعادة معلومات القيمة القابلة لإعادة البناء وتحسين المقايضات بين الجودة والذاكرة.

المؤلفون الأصليون: Yuping Lin, Jiayuan Ding, Yue Xing, Pengfei He, Jiliang Tang, Subhabrata Mukherjee

نُشر 2026-05-25
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuping Lin, Jiayuan Ding, Yue Xing, Pengfei He, Jiliang Tang, Subhabrata Mukherjee

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل نموذج لغة ضخم (LLM) كأنه أمين مكتبة عبقري ولكنه نسيّ، يحاول الإجابة على سؤال بناءً على كتاب ضخم ولا ينتهي. وللقيام بعمله، يحتفظ أمين المكتبة بـ "مسودة" (تسمى KV Cache) لأهم الأجزاء التي قرأها من الكتاب حتى الآن.

المشكلة؟ كلما طال الكتاب، كبرت هذه المسودة. وفي النهاية، ينفد من أمين المكتبة مساحة المكتب (الذاكرة)، ويضطر لرمي بعض الصفحات لتوفير مساحة لصفحات جديدة.

الطريقة القديمة: سلة المهملات "الكل أو لا شيء"

سابقًا، كان أمناء المكتبات يستخدمون قاعدة بسيطة: "إذا لم تكن الصفحة مهمة للغاية في هذه اللحظة، ارمِها في القمامة للأبد".

  • المشكلة: هذا يشبه رمي صفحة لمجرد أنك لا تنظر إليها في هذه الثانية تحديدًا. حتى لو لم تكن بحاجة إليها فورًا، فقد تحتوي تلك الصفحة على حقيقة يمكنك تخمينها أو إعادة بنائها بسهها لاحقًا. وبرميها تمامًا، تفقد تلك المعلومة للأبد.

الطريقة الجديدة: VECTOR (نظام "الأدراج الثلاثة")

يقدم البحث نظام VECTOR، وهو نظام يمنح أمين المكتبة ثلاثة أدراج مختلفة بدلاً من مجرد "احتفظ" أو "ارمي".

  1. درج "الاحتفاظ" (Retention): للصفحات الأكثر أهمية (مثل اسم الشخصية الرئيسية أو حبكة القصة)، يحتفظ أمين المكتبة بالنسخة الأصلية المثالية.
  2. درج "القمامة" (Eviction): للصفحات غير ذات الصلة حقًا (مثل إعلان عشوائي في منتصف فصل ما)، يتم رميها تمامًا.
  3. درج "المخطط" (Approximation): هذه هي الخطوة السحرية الجديدة. بالنسبة للصفحات المهمة نوعًا ما ولكنها ليست حاسمة، لا يقوم أمين المكتبة برميها. بدلاً من ذلك، يتخلص من النص الكامل ولكنه يحتفظ بـ مخطط بسيط أو تلميح رياضي يسمح له بإعادة رسم الصفحة لاحقًا إذا لزم الأمر.

كيف يعمل "المخطط"؟

يشرح البحث أنه في نماذج الذكاء الاصطنا-عي هذه، ترتبط "المفاتيح" (الملصق الموجود على الصفحة) و"القيم" (المحتوى الفعلي) رياضيًا، مثل القفل ومفتاحه.

  • الرؤية الثاقبة: "المفتاح" حساس للغاية؛ إذا أفسدته، سيصاب أمين المكتبة بالارتباك حول أين يبحث. لكن "القيمة" (المحتوى) أكثر مرونة.
  • الحيلة: يحافظ VECTOR على "المفتاح" آمنًا. ثم يستخدم صيغة رياضية محسوبة مسبقًا (تسمى OLS) لتخمين كيف يجب أن تبدو "القيمة" بناءً على ذلك المفتاح.
  • النتيجة: إذا كان التخمين جيدًا (وهو ما يثبته البحث عادةً)، فإن أمين المكتبة يوفر مساحة هائلة عبر تخزين المفتاح والصيغة فقط، بدلًا من تخزين النص الكامل الثقيل. وإذا كان التخمين سيئًا، فإنه يحتفظ بالنص الكامل.

عملية اتخاذ القرار "الثلاثية"

عندما يحتاج أمين المكتبة لتوفير مساحة، يسأل سؤالين لكل صفحة:

  1. هل هذه الصفحة مهمة؟ (إذا كانت الإجابة لا \leftarrow ارمِها في القمامة).
  2. إذا كانت مهمة، هل يمكننا إعادة رسمها بسهولة من ملصقها؟
    • إذا كانت الإجابة نعم (سهلة الرسم) \leftarrow ضعها في درج المخطط (لتوفير المساحة).
    • إذا كانت الإجابة لا (صعبة الرسم) \leftarrow احتفظ بـ النسخة الكاملة (للحفاظ على الدقة).

ماذا وجدوا؟

اختبر المؤلفون هذا على عدة نماذج ذكاء اصطناعي ذات حدود ذاكرة صارمة جدًا (مثل محاولة وضع موسوعة كاملة في صندوق أحذية).

  • النتيجة: باستخدام "درج المخطط" هذا، أدت النماذج أداءً أفضل بكثير من السابق، خاصة عندما كانت الذاكرة ضيقة للغاية. تمكنت من تذكر المزيد من التفاصيل والإجابة على الأسئلة بدقة أكبر دون الحاجة إلى المزيد من ذاكرة الكمبيوتر.
  • العائق: يعمل هذا بشكل أفضل عندما لا يكون أمين المكتبة انتقائيًا للغاية بشأن ما يحتفظ به. إذا كان أمين المكتبة يحتفظ بالفعل فقط بالصفحات الأكثر مثالية، فلن تتبقى مساحة كبيرة لاستخدام حيلة "المخطط".

باخت-صار

VECTOR هو ترقية ذكية لإدارة ذاكرة الذكاء الاصطناعي. فبدلاً من مجرد اتخاذ قرار "احتفظ" أو "ارمي"، فإنه يضيف خيارًا أوسط: "احتفظ بتلميح حتى نتمكن من إعادة بنائه لاحقًا". هذا يسمح لنماذج الذكاء الاصطناعي بالتعامل مع القصص الطويلة والمهام المعقدة دون نفاد الذاكرة، ببساطة عبر كونها أكثر ذكاءً في كيفية التخلص مما ترميه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →