When Quantization Is Free: An int4 KV Cache That Outruns fp16 on Apple Silicon
تُثبت هذه الورقة أنه على معالجات Apple Silicon، فإن نواة Metal مدمجة ومتخصصة لتكميم ذاكرة KV cache بتنسيق int4 لا تحافظ على جودة النموذج فحسب، بل تتفوق أيضاً على تنسيق fp16 في زمن الاستجابة من خلال الاستفادة من عرض نطاق الذاكرة الموحدة وتقنيات التدوير المتقدمة للقضاء على تدهور الأداء لكل رمز (per-token).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحثية بعنوان "عندما يكون التكميم مجانيًا" (When Quantization Is Free)، باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.
الفكرة الكبرى: كسر قاعدة "السرعة مقابل الجودة"
عادةً، عندما تريد جعل برنامج كمبيوتر يعمل بشكل أسرع، يتعين عليك التضحية ببعض الجودة. الأمر يشبه قيادة السيارة: إذا كنت تريد الذهاب بسرعة فائقة، فقد تضطر إلى اتخاذ طريق مختصر ليس بنفس السلاسة، أو قد تضطر إلى إزالة مكيف الهواء لتوفير الوزن.
في عالم الذكاء الاصطناوي (تحديداً النماذج اللغوية الكبيرة)، هناك "ازدحام مروري في الذاكرة". بينما يقرأ الذكاء الاصطناعي قصة طويلة أو محادثة، يجب عليه تذكر كل ما قرأه للتو. هذه الذاكرة (تسمى KV Cache) تصبح ضخمة جداً.
- الطريقة القديمة: الاحتفاظ بالذاكرة بتنسيق عالي الجودة وثقيل (مثل ملف فيديو بدقة Full HD). إنه دقيق، لكنه يشغل مساحة كبيرة ويتحرك ببطء عبر "طريق" الكمبيوتر السريع (نطاق عرض الذاكرة).
- الحل القياسي: ضغط الذاكرة (مثل تحويل الفيديو إلى ملف MP4 أصغر). هذا يوفر المساحة، ولكن عادةً ما يضطر الكمبيوتر للعمل بجهد أكبر لفك الضغط، مما يجعل العملية برمتها أبطأ.
تزعم هذه الورقة البحثية أنه على شرائح Apple Silicon (M1/M2/M3)، تم كسر هذه القاعدة. فقد وجدوا طريقة لضغط الذاكرة بفعالية تجعل الذكاء الاصطناعي يعمل بسرعة أكبر من النسخة غير المضغوطة، دون فقدان أي جودة.
التشبيه: المكتبة وأمين المكتبة
تخيل أن الذكاء الاصطناعي هو أمين مكتبة يحاول الإجابة على الأسئلة بناءً على مكتبة ضخمة من الكتب (السياق).
المشكلة (الكتب الثقيلة):
يجب على أمين المكتبة إبقاء الصفحات الأخيرة من الكتب مفتوحة على المكتب للرجوع إليها. إذا كانت الكتب ثقيلة، مثل الموسوعات ذات الغلاف المقوى (تنسيق fp16 القياسي)، فإن أمين المكتبة يقضي معظم وقته في مجرد حملها ذهاباً وإياباً من الرفوف إلى المكتب. المكتب صغير، لذا لا يمكنه إبقاء سوى عدد قليل من الكتب مفتوحة في وقت واحد.الحل القياسي (النسخة المصورة):
عادةً، لتوفير المساحة، يتم تصوير الصفحات على ورق رقيق (الضغط). لكن أمين المكتبة يضطر للتوقف، وفرد الأوراق المصورة، وقراءتها، ثم طيها مرة أخرى في كل مرة يحتاج فيها للبحث عن شيء ما. عملية "الطي والفرد" هذه تستغرق وقتاً طويلاً لدرجة أن أمين المكتبة يصبح في الواقع أبطأ مما لو كان يحمل الكتب الثقيلة فقط.حل Apple Silicon (المجلد السحري):
بنى المؤلفون مجلداً سحرياً خاصاً (Fused Metal Kernel).
- الخدعة: هم لا يقومون فقط بتصغير حجم الورق؛ بل يعيدون ترتيب الكلمات على الصفحة باستخدام عملية خلط رياضية خاصة (تسمى SRFT، أو تحويل فورييه العشوائي الإشاري) بحيث تبدو النصوص وكأنها ضوضاء عشوائية. هذا يجعل النص سهل الضغط إلى "لقيمات" (nibbles) صغيرة بقدر 4 بت (مثل تحويل فقرة كاملة إلى سطر واحد من الكود).
- السرعة: لأن ذاكرة جهاز Apple هي ذاكرة "موحدة" (أمين المكتبة والرفوف بجانب بعضهما البعض تماماً)، فإن نقل هذه الصفحات الصغيرة والمضغوطة سريع للغاية. الوقت المستغرق في "الخلط والضغط" قصير جداً لدرجة أنه في الواقع أسرع من نقل الكتب الثقيلة غير المضغوطة.
- النتيجة: يمكن لأمين المكتبة الآن إبقاء 3 أضعاف عدد الكتب مفتوحة على المكتب، ولا يزال يقرأها بشكل أسرع من ذي قبل.
النتائج الرئيسية بلغة بسيطة
- ليس مقايضة: على شرائح Apple، تحصل على أفضل ما في العالمين: سعة ذاكرة أكبر بـ 3 أضعاف وَ سرعة أكبر. تطلق الورقة على هذا اسم "التكميم مجاني".
- "الخلط السحري" (SRFT): يستخدمون خدعة رياضية تسمى "تحويل فورييه العشوائي الإشاري". فكر في الأمر كخلط مجموعة أوراق لعب بشكل مثالي بحيث يتم توزيع الأوراق ذات القيمة العالية (القيم المتطرفة) بالتساوي. هذا يمنع "النسخة المصورة" من أن تصبح مشوشة. وقد وجدوا أن هذا يعمل بشكل جيد مثل طرق الخلط الأخرى (Hadamard) ولكنه أفضل ملاءمة لأجهزة Apple.
- إصلاح "الكارثة": في نموذج واحد محدد (Qwen)، تسبب ضغط النص ببساطة في ارتكاب الذكال الاصطناعي لأخطاء فادحة (مثل أمين مكتبة يقرأ كلاماً غير مفهوم). أصلح المؤلفون ذلك عن طريق إضافة "مقبض صوت" صغير (scaling لكل قناة) لكل كلمة محددة قبل الضغط. هذا حافظ على الجودة دون إبطاء العملية.
- التعلم مقابل العشوائية: اختبروا ما إذا كان بإمكانهم "تعليم" الذكاء الاصطناعي عملية الخلط المثالية. ومن المثير للدهشة، أن الخلط العشوائي كان يعمل بشكل أفضل من "الخلط المتعلم" بالنسبة للنتيجة النهائية، رغم أن الخلط المتعلم بدا أكثر دقة في الاختبار الرياضي. اتضح أن الخلط العشوائي يعمل كـ "منظم" (regularizer) مفيد يحافظ على استقرار الذكاء الاصطناعي.
الخلاصة
توضح الورقة البحثية أنه على أجهزة Apple، يمكنك تقليص بصمة ذاكرة الذكاء الاصطناعي بمقدار 3 مرات (مما يوفر مساحة هائلة)، ولأن طريقة عمل ذاكرة الكمبيوتر كذلك، فإن الذكاء الاصطناعي يعمل في الواقع أسرع بنسبة 3% إلى 8% مما كان عليه من قبل.
الأمر يشبه العثح طريقة لترتيب حقيبة سفر بإحكام شديد بحيث تصبح أخف وزناً، ومع ذلك يمكنك إخراج ملابسك منها بشكل أسرع مما لو كانت الحقيبة نصف فارغة وضخمة.
لمن هذا الكلام؟
هذا مخصص لتشغيل نماذج الذكاء الاصطناعي على أجهزة Apple Silicon (أجهزة اللابتوب، الهواتف، والأجهزة اللوحية). يشير المؤلفون إلى أن هذه الزيادة في السرعة قد لا تحدث على أجهزة الكمبيوتر الأخرى (مثل وحدات معالجة NVIDIA القياسية) لأن بنية الذاكرة لديهم مختلفة.
ما الذي يتيحه هذا؟
إنه يسمح لهذه الأجهزة بالتعامل مع محادثات أطول بكثير أو قراءة مستندات أطول بكثير دون نفاد الذاكرة أو البطء، كل ذلك مع الحفاظ على ذكاء إجابات الذكاء الاصطناعي كما كانت.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.