← أحدث الأبحاث
🤖 machine learning

CubicQuant: Parametric Non-Uniform Codebooks for High-Throughput LLM Inference with 1-8-Bit Weights

يقدم CubicQuant تنسيقًا قياسيًا غير منتظم ومعلميًا يربط أكواد المقدار المتباعدة بانتظام بمستويات إعادة بناء تكيفية عبر منحنى تكعيبي رتيب، مما يتيح استنتاج نماذج اللغات الكبيرة (LLM) بكفاءة بدقة 1-8 بت مع تقليل خطأ إعادة البناء مقارنة بالكمية الصحيحة المنتظمة والكمية ذات الفاصلة العائمة المحدودة، مع الحفاظ على قابلية التنفيذ المباشر على وحدات معالجة الرسومات (GPU).

المؤلفون الأصليون: Xuetian Gao

نُشر 2026-08-10
📖 7 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Xuetian Gao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول وضع مكتبة ضخمة من الكتب في حقيبة ظهر صغيرة للغاية. في عالم الذكاء الاصطناعي، هذه "الكتب" هي مليارات الأرقام (التي تسمى الأوزان) التي تشكل نموذج لغة كبيرًا (LLM) — النوع الذي يكتب القصص، ويجيب على الأسئلة، ويتحدث معك. لجعل هذه النماذج تعمل بسرعة على أجهزة الكمبيوتر، يحاول العلماء تقليص هذه الأرقام، وهي عملية تسمى التكميم (Quantization). فكر في الأمر كضغط صورة عالية الدقة إلى حجم ملف أصغر لكي يتم تحميلها بسرعة على هاتفك.

ومع ذلك، هناك توازن دقيق وصعب. إذا قمت بتقليص الأرقام بشكل مفرط أو جامد للغاية، فستفقد التفاصيل المهمة، ويبدأ الذكاء الاصطناعي في ارتكاب أخطاء سخيفة. وإذا أبقيتها كبيرة جدًا، فسيصبح جهاز الكمبيوتر مثقلاً ويعمل ببطء. تقليديًا، استخدم العلماء طريقتين رئيسيتين لتقليص هذه الأرقام: التكميم الموحد (Uniform Quantization)، وهو مثل استخدام مسطرة ذات مسافات متساوية تمامًا (بسيط ولكنه جامد)، والفاصلة العائمة (Floating-Point)، وهي مثل مسطرة مرنة تتمدد في بعض الأماكن وتتقلص في أماكن أخرى (أكثر مرونة ولكنها أصعب في الاستخدام). السؤال الكبير كان دائمًا: هل يمكننا الحصول على تنسيق يكون بمرونة المسطرة المطاطية ولكن بسهولة استخدام المسطرة البسيطة؟

هنا يأتي دور طريقة جديدة تسمى CubicQuant. إنها تشبه ابتكار مسطرة سحرية متغيرة الشكل، يمكنها الانحناء لتناسب الشكل الدقيق للبيانات التي تقيسها، مع بقائها بسيطة بما يكفي ليقرأها الكمبيوتر فورًا. يقترح الباحث وراء هذه الورقة البحثية، شوتيان "إليوت" غاو، نظامًا يستخدم منحنى رياضيًا خاصًا (منحنى تكعيبي) لتحديد كيفية تعبئة هذه الأرقام. بدلًا من إجبار كل مجموعة من الأرقام على اتباع خط مستقيم وجامد، يسمح CubicQuant لـ "علامات المسطرة" بالتجمع حيث تكون البيانات كثيفة والتباعد حيث تكون نادرة، كل ذلك مع الحفاظ على حزم البيانات بإحكام في شبكة منتظمة.

وجدت الورقة أن هذا النهج يعمل بشكل جيد بشكل مدهش. فعندما اختبروه على أنواع مختلفة من توزيعات البيانات (مثل منحنى الجرس للتوزيع الطبيعي أو القمم الحادة لتوزيع لابلاس)، قلل CubicQuant الخطأ في إعادة بناء الأرقام الأصلية بمقادير كبيرة — بنسبة تصل إلى 28.14% أفضل من الطرق القياسية لأنواع معينة من البيانات. كما أظهر أنه يمكن تشغيل هذا التنسيق مباشرة على بطاقات الرسوميات الحديثة (GPUs) دون الحاجة إلى فك حزم كل شيء أولاً، وهو ما يعد فوزًا كبيرًا للسرعة. ومع ذلك، يحرص المؤلف على ملاحظة أنه بينما تبدو الأرقام رائعة في المحاكاة والاختبارات المعزولة، إلا أنهم لم يثبتوا بعد أن هذا يجعل الذكاء الاصطناعي "أذكى" أو أسرع في تطبيق حقيقي كامل مثل الدردشة مع مستخدم. النتائج واعدة وسليمة رياضيًا، لكن الاختبار النهائي لما إذا كان سيغير عالم الذكاء الاصطناعي لا يزال قادمًا.

سحر "المسطرة متغيرة الشكل"

لفهم سبب أهمية CubicQuant، دعونا ننظر إلى كيفية حله لـ "مشكلة حقيبة الظهر" الخاصة بالذكاء الاصطناعي.

الطرق القديمة: الجامدة مقابل الفوضوية
تخيل أن لديك كيسًا من الكرات الملونة بأحجام مختلفة، وتريد تعبئتها في صندوق.

  • التكميم الموحد (Uniform Quantization) هو مثل استخدام صندوق ذي أرفف ثابتة ومتباعدة بالتساوي. إذا كانت كراتك جميعها من نفس الحجم، فهذا مثالي. ولكن إذا كان لديك مزيج من الحصى الصغير والصخور الضخمة، فستقوم إما بإضاعة المساحة على الصخور أو سحق الحصى. إنه بسيط وسريع، لكنه لا يتكيف مع شكل أغراضك.
  • الكتب المشفرة المتعلمة (Learned Codebooks) هي مثل توظيف عامل تعبئة محترف ينظر إلى كل كرة على حدة ويصنع لها رفًا مخصصًا. هذا فعال للغاية، ولكنه بطيء، وفوضوي، ويتطلب الكثير من الملاحظات الإضافية (البيانات الوصفية) لتذكر مكان كل شيء. ومن الصعب على الكمبيوتر قراءته بسرعة.

حل CubicQuant
CubicQuant هو الأفضل من العالمين. فهو يستخدم كتاب رموز بارامتري غير منتظم (parametric non-uniform codebook). وهذه طريقة معقدة لقول إنه يستخدم "مسطرة متغيرة الشكل".

  • بدلًا من الأرفف الثابتة، يستخدم خطًا منحنيًا سلسًا (منحنى تكعيبي) لتحديد مكان الأرفف.
  • يتم التحكم في هذا المنحنى بواسطة معلمتي شكل (shape parameters) ومعامل مقياس واحد (scale factor) لكل مجموعة صغيرة من الأوزان (مجموعة).
  • فكر في الأمر كمسطرة مرنة يمكنها الانحناء. إذا كانت البيانات مزدحمة بالقرب من الصفر (مثل وجود الكثير من الأرقام الصغيرة)، فإن المسطرة تنحني لوضع المزيد من "العلامات" (مستويات إعادة البناء) هناك تمامًا. وإذا كانت البيانات منتشرة في الأطراف، فإن المسطرة تتمدد.
  • والأهم من ذلك، أن هذا الانحناء يتم التحكم فيه بواسطة معادلة بسيطة. لا يحتاج الكمبيوتر إلى جدول بحث ضخم؛ بل يقوم فقط بحساب المنحنى في الوقت الفعلي. وهذا يبقي البيانات محزمة بإحكام (مثل تدفق أرقام صحيحة منتظم) مع السماح لها بالتكيف مع الإحصائيات المحلية لنموذج الذكاء الاصطناعي.

كيف يعمل: استراتيجية "المجموعة"

تشرح الورقة أن أوزان نموذج الذكاء الاصطناعي يتم تقسيمها إلى مجموعات صغيرة (مثل مجموعات من 128 أو 256 رقمًا). لكل مجموعة، يحسب CubicQuant ما يلي:

  1. المقياس (Scale): مدى كبر الأرقام في هذه المجموعة بشكل عام.
  2. معاملي الشكل (a و b): وهما يخبران المنحنى بكيفية الانحناء. أحدهما يتحكم في الميل الأولي، والآخر يتحكم في الانحناء.

هذا يعني أنه حتى لو كان النموذج بأكمله يحتوي على مليارات الأرقام، فإن الكمبيوتر يحتاج فقط إلى تخزين قدر ضئيل من المعلومات الإضافية (البيانات الوصفية) لكل مجموعة لمعرفة كيفية "ثني" المسطرة لهذا الجزء المحدد. تشير الورقة إلى أنه بالنسبة لحجم مجموعة يبلغ 128، فإن هذا يضيف 0.5 بت فقط من العبء الإضافي لكل وزن (بالإضافة إلى حمولة الـ 4 بت)، مما يجعله فعالًا جدًا.

النتائج: أخطاء أقل، نفس السرعة

أجرى الباحث تجارب لمعرفة مدى جودة عمل هذه المسطرة الجديدة مقارنة بالمسطرات القديمة. وقد اختبروها على ثلاثة أنواع من توزيعات البيانات:

  • الموحدة (Uniform): بيانات منتشرة بالتساوي.
  • غاوس (Gaussian): منحنى الجرس الكلاسيكي (معظم الأشياء متوسطة، وقليل منها متطرف).
  • لابلاس (Laplace): توزيع له قمة حادة وأطراف ثقيلة (الكثير من الأرقام الصغيرة، ولكن هناك بعض الأرقام الكبيرة جدًا).

النتائج:

  • للبيانات الموحدة: بما أن البيانات موزعة بالتساوي بالفعل، فإن المسطرة المرنة لا تساعد كثيرًا. فهي تؤدي بنفس أداء المسطرة الجامدة.
  • لبيانات غاوس ولابلاس: هنا يتألق CubicQuant. نظرًا لأن هذه التوزيعات تحتوي على الكثير من الأرقام المتجمعة بالقرب من الصفر وأرقام أقل في الأطراف، يمكن للمسطرة المرنة أن تجمع "العلامات" بالقرب من الصفر لالتقاط التفاصيل بشكل أفضل.
    • في بيانات غاوس، قلل الخطأ بنسبة 13.49% مقارنة بالطريقة القياسية.
    • في بيانات لابلاس، كان التحسن أكبر، حيث وصل إلى 28.14%.
    • كما تفوق أيضًا على أفضل تنسيقات "الفاصلة العائمة" (التي هي بالفعل مرنة للغاية) بنسبة تتراوح بين 6.27% إلى 9.44% اعتمادًا على عرض البتات.

تؤكد الورقة أن هذه هي عمليات محاكاة وبراهين رياضية لمدى جودة إعادة بناء الأرقام. وهي لا تدعي بعد أن هذا يجعل الذكاء الاصطناعي أكثر ذكاءً أو أسرع في تطبيق واقعي. "جودة" إجابات الذكاء الاصطناعي (مثل الارتباك/Perplexity، أو الاستنتاج، إلخ) لا تزال سؤالًا مفتوحًا.

"المساران" لتشغيل الذكاء الاصطناعي

أحد أروع ميزات CubicQuant هو أنه يدعم طريقتين مختلفتين لتشغيل الذكاء الاصطناعي على الكمبيوتر، وهو يناسب كليهما تمامًا:

  1. مسار نوع بيانات النموذج (Model-Dtype Path): يقوم الكمبيوتر بإعادة بناء الأرقام تمامًا كما هي (باستخدام حسابات الفاصلة العائمة). وهذا جيد للدقة.
  2. مسار Dynamic-A8: يقوم الكمبيوتر برسم الأرقام على تنسيق عدد صحيح 8 بت (INT8) في الوقت الفعلي. وهذا رائع للسرعة لأن أجهزة الكمبيوتر الحديثة تمتلك وحدات معالجة خاصة (Tensor Cores) سريعة جدًا في إجراء العمليات الحسابية باستخدام الأعداد الصحيحة 8 بت.

تظهر الورقة أن CubicQuant يمكن "تكييفه" ليعمل بشكل جيد لكلا المسارين في نفس الوقت. إنه يشبه تصميم مفتاح يناسب قفلين مختلفين. وجد الباحث أنه بالنسبة للمهام الصغيرة، تكون الطريقة القياسية أسرع، ولكن مع زيادة حجم المهمة (زيادة عدد الصفوف من البيانات)، يصبح مسار Dynamic-A8 أسرع بشكل ملحوظ (بنسبة تصل إلى 4.46 ضعفًا في بعض الاختبارات على وحدة معالجة رسوميات NVIDIA H200).

ما لا يفعله (قائمة الـ "لا")

من المهم معرفة ما لا يفعله CubicQuant، وفقًا للورقة البحثية:

  • إنه ليس حلاً سحريًا لذكاء الذكاء الاصطناعي. تنص الورقة صراحة على أنهم لم يقيسوا ما إذا كان هذا يجعله أكثر ذكاءً أو أفضل في اتباع التعليمات. هذا سؤال مستقبلي.
  • إنه ليس تسريعًا عالميًا. تعتمد مكاسب السرعة بشكل كبير على شكل البيانات ونوع شريحة الكمبيوتر. بالنسبة للمهام الصغيرة جدًا، قد تظل الطريقة القياسية أسرع.
  • إنه لا يحل مشكلة "التنشيط المستمر" (Persistent Activation). حاول الباحث الاحتفاظ بالأرقام المضغوطة في الذاكرة بين الخطوات لتوفير المساحة، لكن ذلك أدى في الواقع إلى إبطاء العمل لأن الكمبيوتر قضى وقتًا طويلاً في إدارة البيانات. لذا، فقد استبعدوا ذلك في الوقت الحالي.

الخلاصة

CubicQuant هو طريقة جديدة ذكية لتعبئة أوزان الذكاء الاصطناعي تستخدم منحنى رياضيًا بسيطًا للتكيف مع شكل البيانات. إنه يقدم نقطة التقاء مثالية: فهو مرن بما يكفي لالتقاط التفاصيل بشكل أفضل من الطرق الجامدة، وبسيط بما يكفي للعمل بسرعة على أجهزة الكمبيوتر الحديثة. الرياضيات سليمة، والمحاكاة تظهر تحسينات كبيرة في الدقة، واختبارات السرعة المبكرة على وحدات معالجة الرسومات القوية واعدة. ولكن مثل أي أداة جديدة، فإنه يحتاج إلى مزيد من الاختبار في العالم الحقيقي لمعرفة ما إذا كان سيغير حقًا طريقة بنائنا واستخدامنا للذكاء الاصطناعي. في الوقت الحالي، هو مرشح قوي جدًا للجيل القادم من نماذج الذكاء الاصطناعي الفعالة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →