← أحدث الأبحاث
🤖 machine learning

ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference

تُعد ProxyKV إطار عمل عابر للنماذج يستخدم وسيط نموذج صغير خفيف الوزن وغير متزامن، بالإضافة إلى تقنية HybridAxialMapper مبتكرة، لتقليم ذاكرة التخزين المؤقت (KV cache) بكفاءة لاستنتاج النماذج اللغوية الكبيرة ذات السياق الطويل، محققاً دقة عالية تضاهي الأساليب الرائدة مع تقليل عبء مرحلة التعبئة المسبقة (prefilling) بشكل كبير.

المؤلفون الأصليون: Junjie Li, Jiong Lou, Jie Li

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Junjie Li, Jiong Lou, Jie Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحث ProxyKV، مترجم إلى لغة بسيطة مع استخدام تشبيهات إبداعية.

المشكلة: "جدار الذاكرة"

تخيل نموذج لغة ضخم (LLM) مثل محقق بارع يحاول حل لغز بناءً على ملف يحتوي على 100,000 صفحة. للقيام بمهمته، يحتفظ المحقق بـ "مسودة ملاحظات" (تسمى KV Cache) حيث يدون أهم الأدلة من كل صفحة قرأها حتى الآن.

ومع ازدياد طول الملف، تصبح هذه المسودة ضخمة جداً. وفي النهاية، تصبح كبيرة لدرجة أنها لا تتسع على مكتب المحقق (ذاكرة الكمبيوتر). يتسبب هذا في تعثر المحقق في خطواته، مما يبطئ عملية التحقيق بشكل كبير.

لحل هذه المشكلة، نحتاج إلى تقليم (Pruning) مسودة الملاحظات—أي التخلص من الصفحات المملة وغير المهمة والاحتفاظ بالأدلة الحيوية فقط. ولكن هنا تكمن العقبة:

  • الطريقة (أ) (التخمين السريع): يقوم مساعد مبتدئ بإلقاء نظرة سريعة على الصفحات الأخيرة ويخمن ما يجب الاحتفاظ به. هي طريقة سريعة، لكنهم غالباً ما يتخلصون من أدلة حاسمة مخبأة في منتصف الكتاب.
  • الطريقة (ب) (إعادة القراءة المثالية): يعيد المحقق قراءة الكتاب بالكامل مرة ثانية ليعرف بالضبط ما الذي يجب الاحتفاظ به. هذه الطريقة مثالية، لكنها تستغرق وقتاً طويلاً جداً، مما يفقدنا الغرض من تسريع العملية.

الحل: ProxyKV (المحقق الظل)

يقترح المؤلفون نظام ProxyKV، وهو نظام ذكي يجمع بين أفضل ما في العالمين.

تخيل أن المحقق الرئيسي (النموذج الضخم) مشغول بحل القضية. وبدلاً من أن يعيد قراءة الكتاب بنفسه، يقوم بتعيين محقق ظل (نموذج وسيط صغير).

  1. محقق الظل: هو نسخة أصغر وأسرع من المحقق الرئيسي. ينتميان إلى نفس "العائلة" (تدربا على بيانات متشابهة) ولكنه أخف وزناً وأسرع بكثير.
  2. المهمة المتوازية: بينما يقرأ المحقق الرئيسي الصفحة الأولى، يكون محقق الظل قد بدأ بالفعل في قراءة الكتاب بأكمله في الخلفية، على مكتب منفصل.
  3. المترجم: لا يتحدث محقق الظل نفس لغة المحقق الرئيسي تماماً (لديهما عدد مختلف من "الرؤوس" أو آليات الانتباه). لذا، يقوم مترجم خاص (يسمى HybridAxialMapper) بتحويل ملاحظات "الظل" إلى تنسيق يفهمه المحقق الرئيسي.
  4. النتيجة: بحلول الوقت الذي ينهي فيه المحقق الرئيسي قراءة الصفحة الأولى، يسلمه المترجم قائمة "أهم 10 أدلة". يمكن للمحقق الرئيسي الآن التخلص من الصفحات غير المهمة فوراً ومواصلة حل القضية بسرعة البرق، دون الحاجة أبداً لإعادة قراءة الكتاب بالكامل.

كيف يعمل المترجم (HybridAxialMapper)

تقدم الورقة أداة خاصة تسمى HybridAxialMapper. فكر فيها كآلة فرز ذكية.

  • الزمن مقابل الرؤوس: يرى محقق الظل القصة بطريقة مختلفة عن المحقق الرئيسي. يقوم المترجم بفصل "الخط الزمني للقصة" (ماذا حدث ومتى) عن "المنظور" (أي جزء من الدماغ لاحظ ذلك).
  • لعبة التصنيف: بدلاً من محاولة تخمين الدرجة الدقيقة لكل صفحة (وهو أمر صعب وعرضة للخطأ)، يتعلم المترجم تصنيفها. هو يسأل: "هل الصفحة 50 أكثر أهمية من الصفحة 51؟". هذا الأمر أسهل وأكثر دقة لاتخاذ قرار بشأن ما يجب التخلص منه.

النتائج: سرعة ودقة

اختبر الباحثون هذا النظام على عدة نماذج ذكاء اصطناعي شهيرة (مثل Llama و Qwen) بأحجام مختلفة (من 7 مليار إلى 32 مليار معلمة/Parameter).

  • السرعة: في نموذج بـ 8 مليارات معلمة، جعل ProxyKV مرحلة "البداية" للقراءة أسرع بـ 3.2 مرة من الطريقة المثالية لكن البطيئة. وحتى على جهاز كمبيوتر واحد، كان أسرع بـ 1.5 مرة.
  • الدقة: حافظ النظام على 98.7% من دقة الطريقة المثالية. بعبارة أخرى، حل المحقق اللغز بنفس جودة إعادة قراءة الكتاب بالكامل، لكنه فعل ذلك في جزء بسيط من الوقت.
  • السياقات الطويلة: استمر هذا التعزيز في السرعة حتى عندما كان "الملف" ضخماً (يصل إلى 170,000 كلمة).

المقايضة

هناك تكلفة صغيرة واحدة: لتشغيل محقق الظل والمترجم، تحتاج إلى مساحة ذاكرة إضافية مؤقتاً أثناء قراءة الكتاب. ومع ذلك، بمجرد انتهاء القراءة واختيار "أهم 10 أدلة"، يرحل محقق الظل، مما يفرغ تلك المساحة لبقية العمل.

الملخص

ProxyKV يشبه توظيف مساعد سريع وأصغر حجماً للقيام بالعمل الشاق المتمثل في فرز مكتبة ضخمة، بينما يركز الخبير الرئيسي على القرار النهائي. يستخدم النظام مترجماً ذكياً لضمان فهم ملاحظات المساعد بشكل مثالي، مما يسمح للذكاء الاصطناعي بالتعامل مع كميات هائلة من النصوص بسرعة دون فقدان ذكائه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →