← أحدث الأبحاث
🤖 machine learning

Efficient Remote KV Cache Reuse with GPU-native Video Codec

يُعد KVCodec نظاماً مبتكراً يستفيد من برامج ترميز الفيديو الأصلية لوحدات معالجة الرسومات (GPU-native video codecs) وتنسيق تنسيقي (tensor layout) متخصص لضغط ونقل مخازن KV المؤقتة عن بُ بعد (remote KV caches) بكفاءة، مما يقلل بشكل كبير من زمن الوصول لأول رمز (time-to-first-token) في السيناريوهات محدودة النطاق الترددي مع الحفاظ على دقة خالية من الفقد.

المؤلفون الأصليون: Liang Mi, Weijun Wang, Jinghan Chen, Ting Cao, Haipeng Dai, Yunxin Liu

نُشر 2026-05-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Liang Mi, Weijun Wang, Jinghan Chen, Ting Cao, Haipeng Dai, Yunxin Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مساعداً آلياً ذكياً جداً، ولكنه بطيء، وهو عبارة عن نموذج لغوي كبير (LLM) يساعد الناس في كتابة القصص، أو تصحيح الأخطاء البرمجية، أو الإجابة على الأستمارات. لكي يؤدي وظيفته بشكل جيد، يحتاج الروبوت إلى تذكر كل ما قرأه حتى الآن. هذه "الذاكرة" تسمى KV Cache.

المشكلة: ذاكرة الروبوت ثقيلة جداً

في كل مرة يبدأ فيها الروبوت محادثة جديدة، يتعين عليه إعادة قراءة التاريخ بأكمله ليتذكر السياق. هذا يشبه طالباً يعيد قراءة كتاب مدرسي كامل في كل مرة يتلقى فيها سؤالاً جديداً، حتى لو كان النصف الأول من الكتاب هو نفسه تماماً كما في المرة السابقة.

لحل هذه المشكلة، صمم المهندسون نظاماً حيث يحفظ الروبوت "ملاحظات ذاكرته" (KV Cache) على رف بعيد. إذا طرح مستخدم جديد سؤالاً يبدأ بنفس الكلمات التي استخدمها مستخدم سابق، يمكن للروبوت ببساطة أخذ الملاحظات المحفوظة بدلاً من إعادة قراءة الكتاب. وهذا ما يسمى Remote KV Cache Reuse (إعادة استخدام ذاكرة الـ KV عن بُعد).

ومع ذلك، هناك عقبة:

  1. الملاحظات ضخمة جداً: الملاحظات المحفوظة هي ملفات هائلة الحجم. إرسالها عبر الإنترنت يستغرق وقتاً، خاصة إذا لم يكن اتصال الإنترنت سريعاً للغاية (وهو أمر شائع في الخوادم الاقتصادية).
  2. الطريقة القديمة لتقليص حجمها: استخدمت المحاولات السابقة لتقليص حجم هذه الملاحظات طريقة ضغط "ثقيلة". كان الأمر يشبه محاولة ضغط حقيبة سفر عن طريق حشوها بآجر (طوبة). لفتح الحقيبة (فك ضغط الملاحظات)، كان على الروبوت التوقف عن كل شيء آخر واستخدام قوة دماغه الرئيسية لفك الضغط. وقد أدى ذلك إلى إبطاء الروبوت بشكل كبير.
  3. الحل المكلف: كان هناك حل آخر يتمثل في شراء آلة مساعدة خاصة وغالية الثمن (SmartNIC). لكن هذا يكلف آلاف الدولارات لكل خادم، وهو أمر غير عملي للجميع.

الحل: KVCodec (خدعة "ترميز الفيديو")

أدرك مؤلفو هذه الورقة البحثية، KVCodec، أن بطاقات الرسوميات الحديثة (GPUs) تحتوي بالفعل على سلاح سري مدمج بداخلها: ترميزات الفيديو (Video Codecs).

تخيل أن وحدة معالجة الرسومات (GPU) هي مطبخ مزدحم. الطهاة الرئيسيون (General Purpose Cores) يقومون بطهي إجابات الروبوت. لكن المطبخ يحتوي أيضاً على محطة تحرير فيديو مخصصة وسريعة للغاية (NVDEC/NVENC) تظل خاملة بينما يعمل الطهاة. هذه المحطة مصممة لضغط وتوسيع ملفات الفيديو (مثل ضغط فيلم بدقة 4K إلى ملف MP4 صغير) بسرعة فائقة دون إزعاج الطهاة.

يسأل KVCodec: لماذا لا نستخدم محطة الفيديو الخاملة هذه لتقليص وتوسيع ملاحظات ذاكرة الروبوت؟

كيف يعمل (التشبيه الإبداعي)

1. التنسيق "الصديق للترميز" (طي الملاحظات)
لا يمكنك مجرد رمي كومة عشوائية من الأوراق في ضاغط الفيديو؛ فلن ينجح الأمر. لقد توصل مؤلفو الورقة إلى طريقة خاصة لترتيب ملاحظات الذاكرة بحيث يحبها ضاغط الفيديو.

  • التشبيه: تخيل أن لديك كومة من 100 صفحة من النصوص. إذا قمت بتكديسها فحسب، سيرى ضاغط الفيديو ضجيجاً عشوائياً. ولكن إذا رتبتها بحيث تبدو الصفحة 1 مشابهة جداً للصفحة 2، والصفحة 2 تشبه الصفحة 3 (مثل الإطارات في فيلم)، يمكن للضاغط أن يقول: "أوه، هذا مجرد تغيير طفيف عن الإطار السابق!" ويقوم بتقليص حجم الملف بشكل هائل.
  • النتيجة: تمكنوا من تقليص حجم ملاحظات الذاكرة بمقدار 11.9 مرة دون فقدان أي معلومات (بدون فقدان - lossless)، مما جعلها صغيرة بما يكفي لإرسالها بسرعة عبر اتصالات الإنترنت القياسية.

2. "الجالب الذكي" (المايسترو)
إرسال الملاحظات هو نصف المعركة فقط. يحتاج الروبوت إلى استعادتها، وفك ضغطها، ووضعها في ذاكرته بينما لا يزال يفكر في سؤال المستخدم.

  • التشبيه: تخيل مطبخ مطعم. إذا قام النادل (الجالب) بإحضار صينية طعام ضخمة وسد الباب، فلن يتمكن الطهاة من العمل.
    • الطريقة القديمة: يأتي النادل بالطعام، ويسد الباب، وينتظر الطهاة.
    • طريقة KVCodec: لدى النادل "مسار خلفي" خاص. يحضر الطعام، وتقوم محطة الفيديو فوراً بفك ضغطه، ويأخذ الطهاة المكونات بينما لا يزال النادل يحضر الصينية التالية. النادل لا يسد الطريق أبداً أمام الطهاة.
  • الالنتيجة: لا يضطر الروبوت أبداً للتوقف لانتظار وصول الملاحظات أو فك ضغطها. إنه يستمر في العمل بسلاسة.

النتائج

اختبر الفريق هذه التقنية على أنواع مختلفة من بطاقات الرسوميات (من عالية الأداء إلى الاقتصادية) وعلى نماذج مختلفة من الروبوتات.

  • السرعة: وجدوا أن الحصول على الإجابة الأولى (Time-to-First-Token) كان أسرع بمقدار 1.5 إلى 3.5 مرة من أفضل الطرق الموجودة حالياً.
  • الدقة: نظرًا لأنهم لم يستخدموا ضغطاً "فقدانياً" (الذي يتخلص من التفاصيل)، كانت إجابات الروبوت دقيقة تماماً، تماماً كما لو كان قد أعاد قراءة الكتاب بالكامل.
  • التكلفة: إنها تستخدم أجهزة موجودة بالفعل في كل وحدة معالجة رسومات حديثة، لذا فهي لا تكلف أي شيء إضافي لتثبيتها.

الملخص

KVCodec يشبه منح روبوت مشغول محرر فيديو مخصص وسريع جداً للتعامل مع ملاحظات ذاكرته. بدلاً من التوقف لإعادة قراءة الكتب أو انتظار عملية فك ضغط ثقيلة وبطيئة، يستخدم الروبوت أداة مدمجة لتقليص وتوسيع ذاكرته فورياً. هذا يجعل الروبوت أسرع بكثير، وأرخص في التشغيل، ويمنعه من التعثر في الازدحام، وكل ذلك دون الحاجة لشراء معدات جديدة ومكلفة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →