← أحدث الأبحاث
🤖 machine learning

FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference

يُعد FreeKV إطار عمل خالٍ من التدريب يجمع بين الاسترجاع التخميني، والتصحيح دقيق التفاصيل، وإدارة الذاكرة الهجينة بين المعالج المركزي ومعالج الرسوميات لتسريع استرجاع ذاكرة التخزين المؤقت (KV cache) للنماذج اللغوية الكبيرة بشكل كبير، محققاً تسريعاً يصل إلى 13 ضعفاً مقارنة بأحدث الطرق الحالية مع الحفاظ على دقة تقارب الدقة الأصلية.

المؤلفون الأصليون: Guangda Liu, Chengwei Li, Zhenyu Ning, Jing Lin, Yiwu Yao, Danning Ke, Minyi Guo, Jieru Zhao

نُشر 2026-03-10
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Guangda Liu, Chengwei Li, Zhenyu Ning, Jing Lin, Yiwu Yao, Danning Ke, Minyi Guo, Jieru Zhao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول قراءة رواية ضخمة مكونة من 1,000 صفحة للإجابة على سؤال واحد في نهايتها. للقيام بذلك بكفاءة، يحتاج عقلك (الذكاء الاصطناعي) إلى الاحتفاظ بأهم أجزاء القصة في "ذاكرتك العاملة" حتى لا تضطر لإعادة قراءة الكتاب بأكွယ် كلما فكرت في جملة جديدة.

في عالم النماذج اللغوية الكبيرة (LLMs)، تُسمى هذه الذاكرة العاملة بـ KV Cache.

المشكلة: "حقيبة الظهر المزدحمة للغاية"

مع ازدياد ذكاء نماذج الذكاء الاصطناعي، تحتاج إلى تذكر سياقات أطول وأطول (مثل كتب كاملة أو قواعد بيانات برمجية).

  • الطريقة القديمة (إسقاط KV): حاولت بعض الطرق حل هذه المشكلة عن طريق التخلص من الصفحات "غير المهمة" من حقيبة الظهر. لكن هنا تكمن المشكلة: الصفحة التي بدت مملة في الفصل الأول قد تكون هي المفتاح لحل لغز في الفصل الخمسين. التخلص منها يتسبب في حدوث "هلوسة" للذكاء الاصطناعي أو إعطاء إجابات خاطئة.
  • الطريقة "الذكية" الحالية (استرجاع KV): تحاول طرق أخرى الاحتفاظ بالكتاب كاملاً ولكنها تستخرج فقط الصفحات المحددة التي تعتقد أنها مطلوبة للجملة التالية. هذه الطريقة دقيقة، لكنها بطيئة. تخيل أن عليك الركض إلى المكتبة، والبحث عن الكتاب، وتقليب الصفحة الصحيحة، ثم إحضارها إلى مكتبك في كل مرة تكتب فيها كلمة واحدة. الوقت المستغرق في الركض (نقل البيانات) طويل جداً لدرجة أنه يبطئ العملية برمتها.

الحل: FreeKV

ابتكر مؤلفو هذه الورقة البحثية، FreeKV، استراتيجية من جزئين لجعل هذه العملية سريعة ودقيقة في آن واحد. فكر في الأمر كترقية لنظام القراءة الخاص بك بإضافة "قارئ استباقي" و "أمين مكتبة ذكي".

1. القارئ الاستباقي (جانب الخوارزمية)

التشبيه: تخيل أنك تقرأ رواية غموض. أنت الآن في الصفحة 50. أنت واثق جداً من أن الصفحة التالية (51) ستكون عن المحقق وهو ينظر إلى خريطة، لذا فأنت بالفعل تذهب لإحضار الصفحة 51 من المكتبة بينما لا تزال تقرأ الصفحة 50.

  • كيف يعمل: نماذج الذكاء الاصطناعي يمكن التنبؤ بها للغاية. "السؤال" الذي تطرحه في الخطوة التالية يكون متطابقاً تقريباً مع السؤال الذي طرحته في الخطوة السابقة. يفترض FreeKV أن الصفحات المطلوبة للخطوة التالية هي نفسها الصفحات المستخدمة للخطوة الحالية.
  • السحر: يبدأ النظام في جلب الصفحات التالية قبل أن ينهي الحساب الحالي. هذا يخفي "وقت الركض" (زمن الاستجابة/Latency) تماماً. وبحلول الوقت الذي يصبح فيه الذكاء الاصطناعي جاهزاً للخطوة التالية، تكون الصفحات موجودة بالفعل على المكتب.
  • شبكة الأمان (التصحيح الدقيق): ماذا لو كان التخمين خاطئاً؟ (مثلاً: تغيرت القصة فجأة وانتقلت إلى موقع مختلف). يمتلك FreeKV "فحصاً سريعاً للمنطق". يلقي نظرة خاطفة على السؤال الجديد، وإذا أدرك أن التخمين كان خاطئاً، يقوم فوراً باستبدال الصفحات بالصفحات الصحيحة. هذا يحدث نادراً وبسرعة كبيرة لدرجة أنه لا يبطئ العملية.

2. أمين المكتبة الذكي (جانب النظام)

التشبيه: تخيل أن المكتبة (ذاكرة CPU) والمكتب الخاص بك (ذاكرة GPU) بعيدان عن بعضهما البعض. كانت الطريقة القديمة لجلب الصفحات تشبه محاولة حمل الكتب واحداً تلو الآخر، أو في مجموعات مكسرة وغير منتظمة، مما جعل الرحلة بطيئة وغير منظمة.

  • التنسيقات الهجينة (Hybrid Layouts): ينظم FreeKV الكتب على الرف (CPU) بطريقة تجعل من السهل التقاطها في كتل كبيرة، لكنه يبقيها بتنسيق مختلف وأسرع على مكتبك (GPU). إنه يشبه وجود حزام ناقل يقوم تلقائياً بإعادة ترتيب الصناديق أثناء انتقالها من المستودع إلى الشاحنة.
  • التخزين المزدوج (Double-Buffering): بدلاً من انتظار وصول كتاب واحد قبل طلب الكتاب التالي، يستخدم FreeKV منطقتين "للتحميل". بينما يقرأ الذكاء الاصطناعي من المنطقة (أ)، يقوم أمين المكتبة بالفعل بتحميل الكتب في المنطقة (ب). هذا يخلق خط إنتاج مثالياً حيث لا يضطر الذكاء الاصطناعي أبداً لانتظار وصول الكتب.

النتيجة: السرعة دون تضحية

قبل FreeKV، كان عليك الاختيار بين الدقة (الاحتفاظ بجميع الصفحات، ولكن ببطء) أو السرعة (التخلص من الصفحات، ولكن بعدم دقة).

FreeKV يكسر هذه المقايضة.

  • الدقة: إنه يحتفظ بـ "الكتاب" كاملاً في الذاكرة، لذا لا ينسى أبداً السياق المهم. إنه يحقق دقة تقارب الكمال، حتى في مهام الاستدلال المعقدة مثل الرياضيات أو البرمجة.
  • السرعة: من خلال التخمين المسبق وتحسين كيفية نقل البيانات، هو أسرع بما يصل إلى 13 مرة من أفضل الطرق الحالية.

باختصار

FreeKV يشبه منح الذكاء الاصطناعي الخاص بك بلورة سحرية (للتنبؤ بما يحتاجه لاحقاً) و حزام ناقل عالي السرعة (لنقل البيانات فوراً). إنه يسمح للذكاء الاصطناعي بقراءة مستندات ضخمة والإجابة على الأسئلة فوراً، دون أن "ينسى" تفصيلاً واحداً أبداً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →