← أحدث الأبحاث
💬 NLP

PolarQuant: Optimal Gaussian Weight Quantization via Hadamard Rotation for LLM Compression

تُعد PolarQuant طريقةً للكمية ما بعد التدريب (post-training quantization) للنماذج اللغوية الكبيرة، حيث تحقق ضغطاً يقترب من كونه غير فاقد للمعلومات عبر تطبيق التنميط القائم على الكتل (block-wise normalization) وتدوير "والش-هادامارد" (Walsh-Hadamard rotation) لتحويل الأوزان إلى توزيع غاوسي تقريبي، مما يتيح كمية دقيقة للغاية دون الحاجة إلى بيانات معايرة، بينما تعمل كخطوة معالجة مسبقة فعالة لمكممات INT4 اللاحقة.

المؤلفون الأصليون: Caio Vicentino

نُشر 2026-04-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Caio Vicentino

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة، مفصلة للغاية من المعرفة (نموذج لغوي كبير مثل Qwen3.5). لكي تضع هذه المكتبة في حقيبة ظهر صغيرة (حاسوبك المحمول أو هاتفك)، ستحتاج إلى تقليص حجم الكتب. تُسمى هذه العملية الكمية (Quantization).

المشكلة في طرق التقليص الحالية هي أنها تشبه محاولة حزم حقيبة سفر عبر رمي كل شيء فيها عشوائياً. سينتهي بك الأمر بإضاعة مساحة كبيرة على أشياء ضخمة ونادرة (القيم المتطرفة/Outliers) بينما تقوم بسحق الأشياء الشائعة والمهمة (كتلة البيانات الأساسية) لأنه لم يتبقَّ مساحة كافية.

PolarQuant هو طريقة ذكية وجديدة لحزم تلك الحقيبة. فهو لا يكتفي بتقليص حجم الكتب فحسب؛ بل يعيد ترتيبها أولاً لتناسب المساحة تماماً.

إليك كيف يعمل، باستخدام تشبيهات بسيطة:

1. المشكلة: مشكلة "القيم المتطرفة" (Outlier)

تخيل أنك تحزم حقيبة سفر. معظم ملابسك هي قمصان وسراويل جينز قياسية. لكن لديك أيضاً معطف شتاء ضخم ومنفوش، وبعض الأقراط الصغيرة والدقيقة.

  • الطريقة القديمة (Absmax): تقيس حجم أكبر قطعة (معطف الشتاء) وتستخدمها كمسطرة لكل شيء آخر.
    • النتيجة: يستحوذ معطف الشتاء على 90% من مساحة الحقيبة. أما القمصان وسراويل الجينز الخاصة بك فتتحول إلى فتات صغير غير قابل للتمييز لأن المسطرة المستخدمة كبيرة جداً بالنسبة لها. الحقيبة ممتلئة، لكن الملابس تدمرت.

2. الحل: "الخلط السحري" (تدوير هادامارد - Hadamard Rotation)

يقدم PolarQuant خطوة سحرية قبل عملية الحزم. فهو يأخذ كومة ملابسك الفوضوية (أوزان النموذج) ويقوم بعملية تدوير هادامارد (Hadamard Rotation).

فكر في هذا كأنه خلط سحري.

  • أنت تأخذ ذلك المعطف الضخم والأقراط الصغيرة.
  • يقوم الخلط السحري بتفكيك المعطف إلى خيوط وخلطها مع خيوط سراويل الجينز والقمصان.
  • فجأة، لم تعد تملك قطعة واحدة ضخمة والعديد من القطع الصغيرة. بدلاً من ذلك، أصبح لديك 128 كومة من الملابس التي جميعها بنفس الحجم تقريباً.

لماذا هذا رائع؟
إن لحظة "الإدراك" في الورقة البحثية هي أن البيانات بعد هذا الخلط تبدو مثل منحنى جرس مثالي (توزيع غاوسي/Gaussian distribution). في الإحصاء، هذه هي منطقة "الاعتدال" حيث يكون كل شيء قابلاً للتنبؤ به ومنتشراً بشكل متساوٍ.

3. الحزم: الملاءمة المثالية

الآن بعد أن أصبحت جميع "ملابسك" (نقاط البيانات) بنفس الحجم والشكل تقريباً، يمكنك حزمها بكفاءة.

  • المراكز (The Centroids): بدلاً من التخمين أين تضع الأشياء، يستخدم PolarQuant خريطة محسوبة مسبقاً (Lloyd–Max centroids) تخبرك بالضبط أين تضع كل قطعة لتقليل الضرر إلى أدنى حد.
  • النتيجة: يمكنك وضع المكتبة بأكملها في مساحة أصغر بكثير مع عدم فقدان الجودة تقريباً.

"السر الخفي": الخلط يقوم بـ 98% من العمل

أجرى المؤلفون اختباراً لمعرفة ما الذي يقوم بالجهد الأكبر فعلياً. ووجدوا شيئاً مفاجئاً:

  • الخلط السحري (تدوير هادامارد): يمثل 98% من التحسن.
  • الخريطة المثالية (المراكز): تمثل 2% فقط.

لقتم أن مجرد إعادة ترتيب البيانات لتصبح موحدة هو الجزء الأصعب. بمجرد القيام بذلك، فإن أي طريقة حزم بسيطة ستعطي نتائج مذهلة.

لماذا يهمك هذا؟

  1. تشغيل الذكاء الاصطناعي على حاسوبك المحمول: نموذج بـ 9 مليارات معلمة (parameter) يحتاج عادةً إلى خادم GPU ضخم وغالي الثمن (18 جيجابايت من الذاكرة). باستخدام PolarQuant، يمكنك تشغيله على حاسوب محمول قياسي أو حتى جهاز Apple Mac mini بذاكرة تبلغ 4.8 جيجابايت فقط.
  2. لا حاجة لإعادة التدريب: لست بحاجة لإعادة تعليم الذكاء الاصطناعي كيف يتحدث. إنها طريقة "ما بعد التدريب" (post-training)، مما يعني أنه يمكنك أخذ نموذج موجود وتقليصه فوراً دون الحاجة إلى بيانات إضافية.
  3. السرعة: لا يؤدي هذا إلى إبطاء الذكاء الاصطناعي. في الواقع، ولأن البيانات محزومة بدقة شديدة، يمكن للحاسوب قراءتها بنفس السرعة كما كانت من قبل.

خدعة "الحزم المزدوج"

تظهر الورقة البحثية أيضاً خدعة رائعة: يمكنك استخدام PolarQuant لتقليص النموذج إلى 5 بت، ثم فكه قليلاً، ثم تقليصه مرة أخرى إلى 4 بت باستخدام أدوات قياسية.

  • التشبيه: تخيل ضغط ملف باستخدام ZIP، ثم فتحه، ثم ضغطه مرة أخرى باستخدام RAR. عادةً، هذا يدمر الملف. ولكن لأن PolarQuant قام بـ "تنظيف" البيانات أولاً، فإن خطوة الضغط الثانية تعمل بشكل أفضل مما لو كنت قد ضغطت الملف الأصلي الفوضوي مباشرة.

الملخص

PolarQuant يشبه الشخص المحترف في ترتيب الحقائب الذي يعرف أنه إذا قمت فقط بـ خلط العناصر حول بعضها لتصبح جميعها بنفس الحجم، يمكنك وضع خزانة ملابس كاملة في حقيبة يد صغيرة دون سحق قميص واحد. إنه يجعل تشغيل الذكاء الاصطناي القوي على الأجهزة اليومية أمراً ممكناً، سريعاً، ومجانياً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →