← أحدث الأبحاث
💬 NLP

Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling

تقدم هذه الورقة تقنية "أربعة على ستة" (4/6)، وهي تقنية تغيير حجم الكتلة التكيفية لتكميم NVFP4 تعمل على تقليل خطأ التكميم من خلال ضبط مقاييس الكتل ديناميكيًا للتعامل بشكل أفضل مع القيم الكبيرة، مما يحقق أداءً في التدريب والاستدلال أقرب إلى BF16 مع حد أدنى من العبء الحسابي.

المؤلفون الأصليون: Jack Cook, Junxian Guo, Guangxuan Xiao, Yujun Lin, Song Han

نُشر 2026-05-08
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jack Cook, Junxian Guo, Guangxuan Xiao, Yujun Lin, Song Han

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حزم مكتبة ضخمة من الكتب في حقيبة سفر صغيرة محمولة. تمثل الكتب "عقل" نموذج لغوي كبير (AI)، وتمثل حقيبة السفر ذاكرة الكمبيوتر. لكي تتمكن من وضع كل شيء في الداخل، تحتاج إلى تقليص حجم الكتب.

لفترة طويلة، كنا نستخدم طريقة تسمى BF16 (تنسيق قياسي عالي الدقة)، وهي تشبه حزم الكتب في صناديق متينة وثقيلة. إنها دقيقة، لكن الحقيبة تمتلئ بسرعة. مؤخرًا، حاول المهندسون التبديل إلى NVFP4، وهو تنسيق أصغر بكثير. فكر في NVFP4 كمجموعة من صناديق الأوريجامي الصغيرة والخفيفة الوزن. إنها تستوعب عددًا أكبر بكثير من الكتب وتجعل الذكاء الاصطناي يعمل بشكل أسرع، ولكن هناك عقبة: نظرًا لأن الصناديق صغيرة جدًا، فإن بعض الكتب "الكبيرة" تتعرض للضغط أو التجعد أو فقدان صفحاتها. هذا "التجعد" يسمى خطأ التكميم (quantization error)، وهو ما يجعل الذكاء الاصطناعي يرتكب أخطاءً.

المشكلة: "الحافة الخشنة" للصناديق الصغيرة

يوضح البحث أن لـ NVFP4 ميزة غريبة؛ إذ لديه أحجام محددة يمكنه استيعابها: 0.5، 1، 1.5، 2، 3، 4، و6.

  • إذا كان الكتاب بحجم 4 تمامًا، فإنه يناسب الصندوق تمامًا.
  • إذا كان الكتاب بحجم 5، فهو لا يناسب. عليك إما حشره في صندوق بحجم 4 أو صندوق بحجم 6.
  • إذا أجبرت كتابًا بحجم 5 داخل صندوق بحجم 4، فستفقد الكثير من المعلومات (سيتم سحقه). أما إذا أجبرته في صندوق بحجم 6، فستضيع مساحة كبيرة (سيتمايل بداخله).

وجد المؤلفون أن "السحق" يحدث غالبًا مع الكتب التي تكون تقريبًا في حجم أكبر صندوق متاح (القيم القريبة من الحد الأقصى). في الطريقة القياسية، يتم ضبط حجم الحقيبة لتتسع لأكبر كتاب ممكن (حجم 6). لكن هذا يترك فجوة كبيرة حيث يتم سحق الكتب ذات الحجم 5 بشكل سيء.

الحل: "أربعة على ستة" (4/6)

ابتكر المؤلفون، جاك كوك وفريقه، خدعة ذكية تسمى "أربعة على ستة" (Four Over Six).

تخيل أنك تحزم حقيبة سفر. بدلًا من إجبار كل قطعة على التناسب مع صندوق "حجم 6"، انظر إلى كل مجموعة من القطع.

  • الطريقة القديمة: تفترض أن كل مجموعة تحتاج إلى صندوق "حجم 6". إذا كانت المجموعة تحتوي على كتاب بحجم 5، فستقوم بسحقه.
  • طريقة 4/6: تتحقق من المجموعة. إذا كان أكبر كتاب في تلك المجموعة المحددة هو حجم 5 فقط، فتقول: "حسنًا، لسنا بحاجة إلى صندوق حجم 6 لهذه المجموعة. لنستخدم صندوق حجم 4 بدلاً من ذلك".

من خلال التبديل إلى صندوق أصغر (حجم 4) لهذه المجموعة المحددة، يصبح الكتاب (حجم 5) -الذي أصبح الآن أصغر نسبيًا مقارنة بحد الصندوق- أكثر راحة في المكان. لم يعد معرضًا للسحق عند الحافة.

التشبيه:
فكر في الأمر مثل شخصية في لعبة فيديو تقفز.

  • NVFP4 القياسي: تفترض اللعبة أن الشخصية يمكنها القفز حتى 10 أقدام. إذا حاول القفز 9 أقدام، تقوم اللعبة بتقريب الرقم لأسفل إلى 8 أقدام (هبوط كبير).
  • طريقة 4/6: تتحقق اللعبة من المستوى المحدد. إذا كان أعلى منصة هي 6 أقدام فقط، فإنها تغير "حد القفز" إلى 6 أقداء. الآن، القفزة بطول 5 أقدام سيتم تقريبها إلى 6 أقدام (أو 4 أقدام) بدقة أكبر بكثير. الشخصية لن تسقط بعيدًا.

كيف يعمل ذلك عمليًا

يصف البحث خوارزمية ذكية تنظر في كل جزء صغير من البيانات (يسمى كتلة أو block) قبل الحزم:

  1. تحاول حزم الكتلة في صندوق "حجم 6" وتحسب مقدار المعلومات المفقودة.
  2. تحاول حزم نفس الكتلة في صندوق "حجم 4" وتحسب الخسارة أيضًا.
  3. تختار الصندوق الذي يسبب ضررًا أقل (خطأ أقل).

عادةً، بالنسبة للكتل التي تحتوي على أرقام كبيرة جدًا، يكون صندوق "الحجم 4" هو الفائز لأنه يجعل الأرقام "القريبة من الحد الأقصى" تتناسب بشكل أفضل.

النتائج

اختبر الفريق هذه الطريقة على نموذج ذكاء اصطناعي ضخم يسمى Nemotron 3 Nano (30 مليار معامل).

  • التدريب: عندما قاموا بتدريب الذكاء الاصطناعي باستخدام 4/6، تعلم الذكاء الاصطناعي بشكل أفضل وارتكب أخطاء أقل مقارنة بطريقة NVFP4 القياسية. لقد اقترب كثيرًا من أداء طريقة "BF16" الثقيلة والبطيئة، مع الحفاظ على مزايا السرعة والحجم الخاصة بـ NVFP4.
  • السرعة: أظهروا أن هذا "الحزم الذكي" لا يبطئ الكمبيوتر. فهو يضيف أقل من 15% من العمل الإضافي، وهو ثمن ضئيل مقابل دقة أفضل بكثير.
  • النماذج الموجودة: جربوا هذه الطريقة أيضًا على نماذج مدربة مسبقًا (مثل Llama و Qwen). حتى بدون إعادة التدريب، جعل استخدام 4/6 هذه النماذج أكثر ذكاءً ودقة في اختبارات مثل الاستيعاب القرائي والألغاز المنطقية.

الخلاصة

يزعم البحث أنه بمجرد كونك أكثر ذكاءً بشأن أي حجم صندوق ستستخدم لمجموعات مختلفة من البيانات — أحيانًا باستخدام "4" بدلًا من "6" — يمكنك وقف "سحق" المعلومات المهمة. هذا يجعل الذكاء الاصطناعي منخفض الدقة (NVFP4) أكثر دقة بكثير، مما يسمح لنا بتشغيل نماذج ذكاء اصطناعي أكبر وأسرع على الأجهزة الحالية دون أن تفقد "قدراتها الذهنية".

لقد قاموا حتى بنشر الكود (kernels) لكي يتمكن الآخرون من استخدام طريقة "الحزم الذكي" هذه على وحدات معالجة NVIDIA Blackwell الجديدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →