← أحدث الأبحاث
🤖 machine learning

OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization

يُعد OSCAR طريقةً قابلة للنشر لتقنيات تكميم ذاكرة التخزين المؤقت (KV cache) بدقة بتّين (2-bit)، والتي تستفيد من تقدير التباين الطيفي غير المتصل (offline spectral covariance estimation) لاستخلاص تدويرات محاذية للانتباه وعتبات قصّ (clipping thresholds)، مما يُمكّن من تحقيق دقة تقارب عدم الفقد في مهام الاستدلال ذات السياق الطويل، مع تقليل استهلاك الذاكرة بشكل كبير وتحسين إنتاجية الاستدلال في أطر عمل خدمة النماذج اللغوية الكبيرة الحديثة.

المؤلفون الأصليون: Zhongzhu Zhou, Donglin Zhuang, Jisen Li, Ziyan Chen, Shuaiwen Leon Song, Ben Athiwaratkun, Xiaoxia Wu

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhongzhu Zhou, Donglin Zhuang, Jisen Li, Ziyan Chen, Shuaiwen Leon Song, Ben Athiwaratkun, Xiaoxia Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحث OSCAR، مترجم إلى لغة يومية مع استخدام تشبيهات إبداعية.

المشكلة الكبيرة: "المُكنز المنسي"

تخيل نموذج لغة كبير (LLM) كأنه أمين مكتبة عبقري ولكنه كثير النسيان. عندما تطرح عليه سؤالاً طويلاً، يتعين عليه الاحتفاظ بقائمة مستمرة لكل ما قلته حتى الآن (ما يسمى بـ "KV Cache") لفهم السياق.

ومع طول المحادثة (التي قد تصل إلى 32,000 كلمة أو أكثر)، تصبح هذه القائمة ضخمة جداً. ولتخزينها، يحتاج أمين المكتبة إلى كمية هائلة من الذاكرة باهظة الثمن (مثل مستودع ضخم وعالي السرعة). وإذا امتلأ المستودع، سيضطر أمين المكتبة للتوقف عن العمل أو التباطؤ بشكل حاد.

هدف هذه الورقة البحثية هو تقليص حجم ذلك المستودع بمقدار 8 مرات دون أن ينسى أمين المكتبة أي شيء مهم. إنهم يريدون ضغط الملاحظات من "الدقة العالية" (BF16) إلى حجم "الرسم التخطيطي الصغير" (2-bit).

الطريقة القديمة: "خلط هادامارد"

في السابق، حاول الباحثون تقليص هذه الملاحظات ببساطة عن طريق إعادة ترتيب الكلمات. استخدموا خدعة رياضية تسمى دوران هادامارد (Hadamard rotation).

  • التشبيه: تخيل أن لديك غرفة فوضوية بها بعض الأرائك الضخمة والمزعجة (القيم المتطرفة/Outliers) والكثير من الكراسي الصغيرة. لا يمكنك وضعها جميعاً في صندوق صغير. كانت الطريقة القديمة هي أخذ خلاط عملاق وتدوير الغرفة حول نفسها. هذا يؤدي إلى توزيع الأرائـا الضخمة بحيث تبدو مثل كراسي أكبر قليلاً، مما يجعل من السهل تعبئتها.
  • العيب: هذا الخلط هو عملية "عمياء". فهي لا تعرف أي أجزاء من الغرفة هي المهمة فعلياً لعمل أمين المكتبة. عندما تضغط كل شيء إلى رسم تخطيطي صغير (2-bit)، فإن هذا الخلط الأعمى يتسبب بالخطأ في طمس التفاصيل الأكثر أهمية، مما يجعل أمين المكتبة يبدأ في "الهلوسة" أو تقديم إجابات خاطئة. الأمر يشبه محاولة تعبئة مزهرية رقيقة وحجر معاً في صندوق واحد؛ إذا قمت بهز الصندوق فقط، ستتحطم المزهرية.

الحل الجديد: OSCAR (المهندس المعماري الذكي)

يقترح المؤلفون نظام OSCAR (الدوران المدرك للتباين الطيفي خارج الخط - Offline Spectral Covariance-Aware Rotation). بدلاً من هز الغرفة بشكل عشوائي، يعمل OSCAR كمهندس معماري ذكي يدرس بالضبط كيف يعمل أمين المكتبة قبل بدء عملية التعبئة.

1. "المعايرة خارج الخط" (مرحلة الدراسة)

قبل أن يبدأ أمين المكتبة في خدمة العملاء، يأخذ OSCAR عينة صغيرة من المحادثات ويسأل: "أي أجزاء من الذاكرة يستخدمها أمين المكتبة فعلياً لاتخاذ القرارات؟"

  • التشبيه: تخيل أن أمين المكتبة عليه اختيار كتاب بناءً على سؤال محدد. يدرك OSCAR أن أمين المكتبة يهتم بشدة بـ لون غلاف الكتاب (الاستعلام/Query) لكنه لا يهتم كثيراً بـ سُمك الصفحات (القيمة/Value).
  • النتيجة: ينشئ OSCAR خريطة مخصصة (مصفوفة دوران) توائم تخزين الذاكرة مع هذه الاحتياجات المحددة. يضمن ذلك أن الأجزاء التي يهتم بها أمين المكتبة أكثر من غيرها يتم الحفاظ عليها بدقة عالية، بينما يتم ضغط الأجزاء الأقل أهمية بشكل أكثر عدوانية.

2. "التعبئة الذكية" (الدوران)

يستخدم OSCAR هذه الخريطة لتدوير البيانات إلى شكل مثالي لعملية الضغط.

  • التشبيه: بدلاً من مجرد تدوير الغرفة عشوائياً، يقوم OSCAR بإعادة ترتيب الأثاث بحيث تصطف جميع القطع الهشة بطريقة تناسب تماماً الصندوق الصغير. إنه يفصل "الاتجاهات المهمة" عن "الضجيج".
  • السحر: من خلال القيام بذلك، يمكنهم ضغط البيانات لتصل إلى 2 بت (صغيرة جداً) ومع ذلك يحافظون على دقة أمين المكتبة لتكون مطابقة تقريباً للنسخة الأصلية عالية الدقة.

3. "المستودع الهجين" (النظام)

لا يقوم OSCAR بضغط كل شيء دفعة واحدة. بل يستخدم نظاماً هجيناً ذكياً:

  • رموز "المصب" و"الأحدث" (Sink and Recent Tokens): الكلمات القليلة الأولى في بداية القصة، والكلمات القليلة الأخيرة (ما قلته للتو)، يتم الاحتفاظ بهما بدقة عالية. هذه هي الركائز الأكثر أهمية.
  • رموز "التاريخ" (History Tokens): الجزء الأوسط من المحادثة (التاريخ الطويل) هو الجزء الذي يتم ضغطه إلى الرسم التخطيطي الصغير (2-bit) باستخدام دوران OSCAR الذكي.

لماذا هذا مهم (النتائج)

اختبرت الورقة البحثية هذا النظام على بعض أذكى نماذج الذكاء الاصطنا الـمتاحة (مثل Qwen و GLM) مع سياقات طويلة جداً.

  • الدقة: عندما حاولت الطرق الأخرى الضغط إلى 2 بت، فقدت النماذج قدرتها على التفكير (انخفضت الدقة إلى ما يقرب من الصفر). أما OSCAR فقد حافظ على ذكاء النماذج ليكون مطابقاً تقريباً للنسخة الأصلية عالية الدقة.
  • السرعة والذاكرة: لأن البيانات أصغر بمقدار 8 مرات، يمكن للمستودع استيعاب 8 أضعاف المحادثات. وهذا يعني أن النظام يمكنه التعامل مع 7 أضعاف عدد المستخدمين في وقت واحد دون نفاد الذاكرة.
  • جاهز للاستخدام الواقعي: لم يكتفِ المؤلفون بكتابة نظرية فحسب؛ بل بنوا نظاماً يعمل بالفعل ويتناسب مع خوادم الذكاء الاصطنا الحديثة (SGLang و vLLM). الأمر يشبه أنهم لم يصمموا صندوقاً أفضل فحسب، بل بنوا شاحنة جديدة تستخدم هذا الصندوق وتتحرك بشكل أسرع.

الملخص

OSCAR هو وسيلة تمنع نماذج الذكاء الاصطناعي من "النسيان" عندما تحاول توفير الذاكرة. بدلاً من سحق البيانات بشكل عشوائي، يقوم أولاً بدراسة ما يهتم به الذكاء الاصطناعي فعلياً، ثم يعيد ترتيب البيانات لتناسب تلك الاحتياجات، ومن ثم يضغطها. يتيح ذلك للذكاء الاصطناعي تذكر كميات هائلة من المعلومات (مثل كتاب كامل) باستخدام جزء ضئيل من الذاكرة، دون فقدان ذكائه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →