← أحدث الأبحاث
🤖 machine learning

CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM

تُعد استراتيجية CONF-KV طريقة مبتكرة لإخلاء ذاكرة التخزين المؤقت لـ KV، حيث تقوم بتعديل ميزانيات التخزين المؤقت ديناميكيًا بناءً على ثقة النموذج في التنبؤ لكل خطوة، وتستخدم تخزينًا بدقة مختلطة لتقليل استخدام الذاكرة بشكل كبير مع الحفاظ على دقة استرجاع عالية وأداء المهام للاستنتاج طويل الأمد في النماذج اللغوية الكبيرة.

المؤلفون الأصليون: Yubo Li, Yidi Miao

نُشر 2026-05-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yubo Li, Yidi Miao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول قراءة كتاب طويل جداً، لكن عقلك (ذاكرة الكمبيوتر) لا يمكنه استيعاب سوى بضع صفحات في كل مرة. وبينما تقرأ، تحتاج إلى تذكر ما حدث سابقاً لتفهم الجملة الحالية. إذا نسيت الكثير، ستصاب بالارتباك. وإذا حاولت تذكر كل شيء، سيمتلئ عقلك لدرجة أن حركتك ستصبح بطيئة للغاية.

هذه هي المشكلة ذاتها التي يحلها CONF-KV لنماذج الذكاء الاصطناعي (نماذج اللغات الكبيرة) عندما تكتب قصصاً طويلة أو تجري محادثات ممتدة.

إليك كيف يشرح البحث الأمر، باستخدام تشبيهات بسيطة:

المشكلة: "حقيبة الظهر الممتلئة أكثر من اللازم"

عندما يقوم الذكاء الاصطناعي بتوليد نص، فإنه يحتفظ بـ "حقيبة ظهر" للمعلومات تسمى KV Cache. هذه الحقيبة تحمل سياق كل ما قاله الذك_ الاصطناعي حتى الآن.

  • المشكلة: مع طول المحادثة، تصبح حقيبة الظهر أثقل. وفي النهاية، تصبح ثقيلة جداً لدرجة أن الذكاء الاصطناعي ينفد من الذاكرة (تتمزق الحقيبة) أو يصبح بطيئاً جداً لدرجة أنه يستغرق وقتاً طويلاً للتفكير.
  • الطريقة القديمة: تستخدم معظم أنظمة الذكاء الاصطناعي "النافذة المنزلقة" (Sliding Window). تخيل نافذة على قطار؛ مع تحرك القطار، تتغير الرؤية خارج النافذة. يتذكر الذكاء الاصطناعي فقط آخر 512 كلمة (المنظر خارج النافذة مباشرة) وينسى كل ما سبق ذلك.
    • العيب: إذا كانت الإجابة على سؤال قد ذُكرت قبل 1,000 كلمة، فإن النافذة المنزلقة تنساها تماماً، ويفشل الذكاء الاصطناعي.
  • الطريقة القديمة الأخرى: تحاول بعض الأنظمة تذكر الكلمات "المهمة" بناءً على عدد المرات التي تم النظر إليها في الماضي. لكن هذا يشبه النظر إلى خريطة لمكان كنت فيه بالأمس، دون معرفة شعورك الآن.

الحل: "مقياس الثقة"

قدم المؤلفون في هذا البحث، CONF-KV، طريقة جديدة لإدارة حقيبة الظهر. بدلاً من استخدام قاعدة ثابتة، منحوا الذكاء الاصطناعي مقياس ثقة.

تخيل الذكاء الاصطناعي كطالب يؤدي اختباراً:

  1. عندما يكون الطالب واثقاً: يعرف الإجابة بسهولة، ولا يحتاج للعودة إلى ملاحظاته. لذا، يقول النظام: "رائع! أنت متأكد. دعنا نتخلص من بعض الملاحظات القديمة لتوفير المساحة".
  2. عندما يكون الطالب مرتبكاً: الطالب يتردد، ويحتاج للتحقق من تاريخه. يقول النظام: "انتظر، تبدو غير متأكد. احتفظ بكل الملاحظات! لا ترمِ أي شيء بعد".

كيف يعمل ذلك في الواقع:

  • الإشارة: قبل أن يختار الذكاء الاصطناعي الكلمة التالية، ينظر إلى مدى تأكده. إذا كانت الكلمة التالية بديهية (ثقة عالية)، فإنه يقلص الذاكرة. وإذا كانت الكلمة التالية صعبة (ثقة منخفضة)، فإنه يوسع الذاكرة.
  • الفرز: حتى عندما يحتاج إلى التقلص، فإنه لا يحذف الأشياء عشوائياً. بل يحتفظ بالكلمات الأحدث (لأنها عادة ما تكون مهمة) والكلمات التي نظر إليها الذكاء الاصطناعي أكثر من غيرها في الماضي. إنه يحذف الأشياء القديمة "المملة" التي لا يهتم بها أحد.

خدعة "الدقة المختلطة"

يذكر البحث أيضاً خدعة تخزين ذكية.

  • تخيل أن ملاحظاتك مكتوبة على ورق.
  • الملاحظات الحديثة مكتوبة على ورق عالي الجودة وسميك (FP16) لتكون واضحة تماماً.
  • الملاحظات الأقدم مكتوبة على ورق معاد تدويره ورقيق (INT8). فهي تشغل مساحة أقل بكثير، ولكن لا يزال بإمكانك قراءتها بما يكفي لفهم الجوهر.
  • هذا يسمح للذكاء الاصطناعي باستيعاب قدر أكبر بكثير من التاريخ في نفس مساحة حقيبة الظهر دون فقدان الكثير من الجودة.

ماذا تظهر النتائج

اختبر المؤلفون هذا على أربعة نماذج مختلفة للذكاء الاصطناعي ووجدوا ما يلي:

  1. توفير الذاكرة: يستخدم تقريباً نفس كمية الذاكرة التي تستخدمها "النافذة المنزلقة" البسيطة (التي تنسى كل شيء قديم)، ولكنه يتذكر تفاصيل أكثر أهمية بكثير.
  2. دقة أفضل: في اختبار "إبرة في كومة قش" (البحث عن حقيقة محددة مخبأة في نص ضخم)، وجد CONF-KV الإبرة بنسبة 91.4% من المرات. بينما وجدت النافذة المنزلقة القديمة الإبرة بنسبة 53.8% فقط.
  3. مهام العالم الحقيقي: عند استخدامه كوكيل تصفح ويب (محاولة شراء أشياء أو ملء نماذج عبر الإنترنت)، نجح بنسبة 95.3% مثل نسخة الذاكرة الكاملة، ولكنه استخدم ذاكرة أقل بمقدار 2.8 مرة.
  4. السرعة: لأن حقيبة الظهر أخف، يفكر الذكاء الاصطناعي بشكل أسرع (زمن استجابة أقل) ويمكنه التعامل مع عدد أكبر من المستخدمين في وقت واحد (إنتاجية أعلى).

الخلاصة

CONF-KV يشبه أمين مكتبة ذكي لا يرمي الكتب القديمة لمجرد أنها "قديمة". بدلاً من ذلك، يراقب القارئ؛ إذا كان القارئ يعاني، يبقي مكتبة كاملة مفتوحة أمامه. وإذا كان القارء يسير بسلاسة، يقوم أمين المكتبة بإزالة الفوضى لجعل الغرفة أسرع.

هذا يسمح للذكاء الاصطناعي بإجراء محادثات أطول وأكثر ذكاءً دون نفاد الذاكرة أو البطء، وذلك ببساطة من خلال الاستماع إلى مدى "تأكد" الذكاء الاصطناعي في كل خطوة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →