← أحدث الأبحاث
🤖 machine learning

PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference

يُعد PolyKV نظاماً مبتكراً يُمكّن وكلاء استدلال نماذج اللغات الكبيرة (LLM) المتعددين والمتزامنين من مشاركة مجمع ذاكرة تخزين مؤقت (KV cache) واحد مضغوط بشكل غير متماثل —باستخدام تكميم int8 للمفاتيح (Keys) وتكميم 3-بت قائم على تحويل فورييه السريع (FWHT) للقيم (Values)— محققاً خفضاً في الذاكرة يصل إلى 97.7% مع تدهور طفيف في الارتباك (perplexity) مع الحفاظ على جودة مخرجات عالية عبر مختلف أحجام النماذج وأطوال السياق.

المؤلفون الأصليون: Ishan Patel, Ishan Joshi

نُشر 2026-04-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ishan Patel, Ishan Joshi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مكتبة حيث يريد 15 شخصًا مختلفًا (وكلاء/Agents) قراءة نفس الكتاب الطويل في نفس الوقت.

الطريقة القديمة (الاستدلال القياسي للنماذج اللغوية الكبيرة - Standard LLM Inference):
في الوقت الحالي، إذا أراد 15 شخصًا قراءة هذا الكتاب، ستقوم المكتبة بعمل 15 نسخة ضوئية كاملة وعالية الجودة من الكتاب بأك അതിന്റെ. يحصل كل شخص على حزمة أوراق خاصة به.

  • المشكلة: هذا يستهلك مساحة هائلة من الرفوف (الذاكرة). إذا كان الكتاب ضخمًا، فستنفد المساحة من المكتبة وتصبح الرفوف مزدحمة.

حل PolyKV:
ابتكر الباحثون وراء PolyKV طريقة أذكى لمشاركة الكتاب دون صنع 15 نسخة.

1. مفهوم "النسخة الأصلية الواحدة" (One Master Copy)

بدلاً من صنع 15 نسخة، يقوم PolyKV بإنشاء نسخة أصلية واحدة مضغوطة من الكتاب.

  • فكر في هذه النسخة الأصلية كأنها "نسخة ملخصة للغاية، مشوشة قليلاً، ولكنها لا تزال قابلة للقراءة" من النص.
  • عندما يبدأ الـ 15 قارئاً، لا يحصل كل منهم على حزمة أوراق مادية خاصة به؛ بدلاً من ذلك، يتطلعون جميعًا إلى هذه النسخة الأصلية الواحدة.
  • السحر: يقوم النظام فوراً بإسقاط المعلومات من هذه النسخة الأصلية الواحدة في "عقل" كل قارئ (ذاكرة الكمبيوتر الخاصة به) لكي يتمكنوا من القراءة وكتابة ملاحظاتهم الخاصة بشكل مستقل. هم لا يحتاجون إلى حزم أوراق ثقيلة خاصة بهم؛ بل يحتاجون فقط إلى رؤية واضحة للنسخة الأصلية.

2. "الضغط الذكي" (غير المتماثل - Asymmetric)

يوضح البحث أن الأجزاء المختلفة من الكتاب ليست متساوية في أهميتها للاحتفاظ بها بتفاصيل مثالية.

  • "المفاتيح" (Keys - الفهرس): هذه تشبه جدول المحتويات أو الفهرس. يجب أن تكون دقيقة للغاية حتى تتمكن من العثيد الجزء الصحيح. يحتفظ PolyKV بهذه المفاتيح بجودة عالية (دقة 8-بت)، مثل نسخة ضوئية حادة وواضحة.
  • "القيم" (Values - القصة): هذه هي الكلمات والجمل الفعلية. وجد الباحثون أنه يمكنك تلخيص هذه الكلمات بقوة دون فقدان المعنى. لقد استخدموا خدعة رياضية خاصة (تسمى TurboQuant) لتقليص القصة إلى 3 بت فقط من المعلومات.
    • التشبيه: تخيل أخذ صورة عالية الدقة لمنظر طبيعي وتحويلها إلى صورة فيديو "بكسلية" (Pixelated) بدقة 8-بت للعبة فيديو. قد تبدو الصورة مربعة أو مشوشة، لكن لا يزال بإمكانك بوضوح تمييز الجبل والشجرة. هذا "التشوه" (الضجيج) يساعد القراء في الواقع على التركيز على الصورة الكبيرة بدلاً من التشتت بالتفاصيل الصغيرة غير المهمة.

3. النتائج: توفير المساحة دون فقدان المعنى

اختبر الباحثون هذا باستخدام "مكتبتين" مختلفتين (نماذج ذكاء اصطي-SmolLM2 وهو نموذج صغير، وLlama-3 وهو نموذج أكبر). كان لديهم ما يصل إلى 15 قارئاً يتشاركون نفس النص.

  • توفير هائل في المساحة: عندما شارك 15 شخصاً قصة مكونة من 4,000 كلمة، احتاجت الطريقة القديمة إلى 19.8 جيجابايت من الذاكرة. بينما احتاج PolyKV فقط إلى 0.45 جيجابايت. هذا يمثل انخفاضاً بنسبة 97.7%. إنه يشبه تقليص رف كتب كامل إلى بطاقة فهرس واحدة.
  • بقيت الجودة عالية: للمفاجأة، لم يرتبك القراء.
    • "فهم القراءة" (الذي يُقاس بدرجة تسمى Perplexity) لم يتغير تقريباً. في الواقع، مع القصص الأطول والأكثر تماسكاً، كان أداء النسخة المضغوطة أحياناً أفضل من النسخة الكاملة.
    • لما لماذا؟ يفترض الباحثون أن "الضجيج" الناتج عن الضغط يعمل كـ "فلتر" (مرشح)، حيث يزيل الضوضاء الصغيرة والمشتتة، مما يساعد القراء على التركيز على الأفكار الرئيسية، تماماً كما يساعدك تضييق عينيك أحياناً على رؤية شكل جسم بعيد بشكل أفضل.
  • التطابق الدلالي (Semantic Match): عندما قارنوا ما كتبه القراء، كان المعنى متطابقاً تقريباً (بنسبة 92.8%) مع ما كانوا سيكتبونه باستخدام الكتاب الكامل غير المضغوط.

4. مفاجأة "التنظيم" (Regularization)

كانت واحدة من أكثر النتائج إثارة للاهتمام هي أنه كلما زاد عدد القراء، قلت جودة الانخفاض.

  • التشبيه: تخيل غرفة صاخبة. إذا حاول شخص واحد الاستماع إلى همس، فقد يفقده. ولكن إذا كان 15 شخصاً يستمعون جميعاً إلى نفس الهمس عبر مرشح (Filter) مشوش قليلاً، فإن هذا "التشويش" يساعدهم في الواقع على تجاهل الضجيج في الخلفية وسماع الرسالة الجوهرية بشكل أفضل.
  • يشير البحث إلى أنه بالنسبة للقصص الطويلة والمتماسكة، يعمل هذا الضجيج الناتج عن الضغط كـ "منظم" (Regularizer)، مما يمنع الذكاء الاصطناعي من التعلق بالتفاصيل الصغيرة والمتكررة ويساعده على فهم تدفق القصة بشكل أفضل.

الملخص

PolyKV هو نظام يسمح للعديد من وكلاء الذكاء الاصطناعي بقراءة نفس المستند من خلال مشاركة مجمع ذاكرة واحد مضغوط للغاية وملخص بذكاء بدلاً من صنع نسخة كاملة لكل مستخدم.

  • يوفر 97% من الذاكرة.
  • يعمل لـ 15 شخصاً أو أكثر في وقت واحد.
  • يحافظ على المعنى بشكل شبه مثالي.
  • بل ويساعد الذكاء الاصطناعي على التركيز بشكل أفضل على القصص الطويلة من خلال تصفية التشتتات الصغيرة.

يخلص البحث إلى أن هذا هو المرة الأولى التي ينجح فيها أي شخص في الجمع بين نظام "ذاكرة مشتركة" و"ضغط مع فقدان للبيانات" (Lossy Compression) لمستخدمين متعددين، مما يثبت أنه من الممكن توفير مساحات هائلة من الذا thức دون تعطيل عقل الذكاء الاصطناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →