← أحدث الأبحاث
💬 NLP

ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution

يُعد ForesightKV إطار عمل قائمًا على التدريب يعمل على تحسين عملية استبعاد ذاكرة التخزين المؤقت لـ KV لنماذج الاستنتاج من خلال الجمع بين خوارزمية "الاستبعاد الذهبي" (Golden Eviction) والتعلم الخاضع للإشراف والتعلم المعزز (GRPO) للتنبؤ بأزواج KV الأكثر أهمية والاحتفاظ بها، مما يقلل بشكل كبير من تكاليف الذاكرة مع الحفاظ على أداء عالٍ في مهام الاستنتاج الطويلة.

المؤلفون الأصليون: Zican Dong, Peiyu Liu, Junyi Li, Zhipeng Chen, Han Peng, Shuo Wang, Wayne Xin Zhao

نُشر 2026-02-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zican Dong, Peiyu Liu, Junyi Li, Zhipeng Chen, Han Peng, Shuo Wang, Wayne Xin Zhao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق بارع (الذكاء الاصطناعي) تحاول حل لغز طويل ومعقد للغاية. للقيام بذلك، تحتاج إلى الاحتفاظ بدفتر ملاحظات ضخم من الأدلة (KV Cache) على مكتبك. ومع استمرار تطور القصة، يصبح دفتر ملاحظاتك أكثر سمكًا، حتى يمتلئ مكتبك بالأوراق لدرجة أنك لا تستطيع تحريك يديك، ويستغرق الأمر وقتًا طويلاً جدًا للعثور على دليل محدد تحتاجه لاتخاذ استنتاجك التالي. هذه هي مشكلة "فرط التحميل في الذاكرة" في النماذج اللغوية الكبيرة.

تقليديًا، لتفريغ المكتب، يستخدم الناس قواعد بسيطة: "تخلص من أقدم الأوراق" أو "تخلص من الأوراق التي تحتوي على أقل قدر من الحبر". لكن ورقة البحث ForesightKV تجادل بأن هذه القواعد غبية للغاية. فأحيانًا، قد تكون ورقة قديمة أو ورقة بحبر باهت هي الدليل الأكثر أهمية لحل اللغز لاحقًا في القصة. والتخلص منها يتسبب في وقوع المحقق في خطأ يدمر بقية التحقيق.

إليك كيف يحل ForesightKV هذه المشكلة، عبر ثلاث خطوات بسيطة:

1. المشكلة: خطأ "المرور لمرة واحدة"

تخيل أنك تجهز حقيبة للسفر. الطريقة القياسية قد تقول: "احتفظ بآخر 10 أشياء وضعتها في الحقيبة، وتخلص من الباقي". ولكن ماذا لو كان أول شيء وضعته (خريطة مثلاً) ضروريًا للرحلة بأكملها، رغم أنه في أقصى عمق الحقيبة؟
تحاول الطرق الموجودة حاليًا تخمين الأدلة التي يجب الاحتفاظ بها بناءً على أنماط بسيطة (مثل "الاحتفاظ بالأحدث" أو "الاحتفاظ بالأكثر شيوعًا"). وقد وجدت الورقة البحثية أنه في التفكير المعقد (مثل المسائل الرياضية)، تمتلك الأدلة ثلاثة أنواع من الشخصيات:

  • النجم العالمي: مهم دائمًا، مهما حدث.
  • الجار المحلي: مهم لفترة قصة فقط.
  • المتخفي الدلالي: هذا هو النوع الماكر. قد يبدو الدليل عديم الفائدة الآن، ولكن بعد 50 خطوة، يصبح هو المفتاح للغز بأكمله. القواعد البسيطة تفشل في رصد هؤلاء "المتخفين".

2. الحل: مدرب "يسافر عبر الزمن"

ابتكر المؤلفون نظامًا جديدًا يسمى ForesightKV. بدلاً من استخدام كتاب قواعد جامد، قاموا بتدريب مساعد صغير وذكي (نموذج تسجيل النقاط - Scoring Model) ليعمل كمدرب يمكنه رؤية المستقبل.

هذا المدرب لا ينظر فقط إلى الأدلة في الوقت الحالي؛ بل يتعلم التنبؤ بأي الأدلة ستكون الأكثر أهمية في المستقبل. وهو يفعل ذلك من خلال عملية تدريب مكونة من مرحلتين:

المرحلة الأولى: "المعيار الذهبي" (التعلم الخاضع للإشراف)

أولاً، قام الباحثون بتشغيل الذكاء الاصطناعي عبر مسألة رياضية دون التخلص من أي شيء. راقبوا انتباه الذكاء الاصطناعي وسألوا: "إذا اضطررنا للتخلص من بعض الأدلة الآن، فأي منها سيسبب أقل ضرر للإجابة النهائية؟"
استخدموا طريقة تسمى التخلص الذهبي (Golden Eviction) للعثور على المجموعة المثالية من الأدلة التي يجب الاحتفاظ بها. ثم علموا المساعد الصغير محاكاة عملية اتخاذ القرار "المثالية" هذه. الأمر يشبه إظهار نموذج الإجابة لطالب وقول: "تعلم كيف تختار الإجابات الصحيحة".

المرحلة الثانية: "محاكاة العالم الحقيقي" (التعلم التعزيزي)

ومع ذلك، فإن "نموذج الإجابة المثالي" ليس مثاليًا دائمًا عندما يقوم الذكاء الاصطناعي بحل مسألة فعليًا، لأن عقل الذكاء الاصطناعي يتغير أثناء تفكيره.
لذلك، المرحلة الثانية تشبه محاكاة لعبة فيديو. يُطلب من المساعد: "اذهب وتخلص من بعض الأدلة. إذا ارتكب الذكاء الاصطناعي خطأ في نوع معين من الكلمات (مثل رقم أو رمز يسهل الخطأ فيه)، فستتعرض لعقوبة. وإذا استمر الذكاء الاصطناعي في الحل بشكل صحيح، فستحصل على مكافأة."
يتعلم المساعد أن يكون أكثر ذكاءً، مدركًا أن الاحتفاظ ببعض الكلمات "المملة" (ذات الإنتروبيا المنخفضة) أمر حيوي لمنع الذكاء الاصطناعي من الهلوسة بالأرقام لاحقًا.

3. النتيجة: مكتب أذكى وأخف

اختبرت الورقة البحثية هذا النظام على ثلاثة نماذج ذكاء اصطناعي مختلفة باستخدام اختبارات رياضية صعبة (AIME 2024 و2025).

  • الادعاء: يمكن لـ ForesightKV حل هذه المسائل الرياضية بنفس كفاءة الدفتر الكامل والثقيل، ولكن باستخدام نصف مساحة الذاكرة فقط.
  • التشبيه: الأمر يشبه القدرة على حمل حقيبة ظهر أخف بنسبة 50%، ومع ذلك لا تزال تتذكر كل دليل تحتاجه للفوز في اللعبة.
  • السرعة: نظرًا لأن الحقيبة أخف، يمكن للذكاء الاصطناعي التفكير بشكل أسرع والتعامل مع عدد أكبر من الأشخاص في آن واحد (إنتاجية أعلى).

ملخص

ForesightKV هو طريقة جديدة لإدارة ذاكرة الذكاء الاصطناعي. بدلاً من التخلص من الملاحظات القديمة بشكل عشوائي، فإنه يستخدم مساعدًا مدربًا وذكيًا يتعلم التنبؤ بالملاحظات التي ستكون حاسمة للحل على المدى الطويل. ومن خلال الجمع بين مرحلة تدريب "المثال المثالي" ومرحلة "التعلم بالممارسة" (اللعبة)، فإنه يحافظ على سرعة وكفاءة الذكاء الاصطناعي دون جعله ينسى التفاصيل المهمة اللازمة لحل ألغاز الاستدلال المعقدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →