Search Your Block Floating Point Scales!
تقدم هذه الورقة ScaleSearch، وهي استراتيجية مبتكرة تعمل على تحسين عوامل قياس الفاصلة العائمة الكتلية (Block Floating Point) من خلال بحث دقيق لبتات المانتيسا (mantissa bits) لتقليل خطأ التكميم بشكل كبير وتحسين أداء النماذج التوليدية منخفضة الدقة، بما في ذلك خوارزمية ScaleSearchAttention المتخصصة التي تحقق فقدانًا يقارب الصفر في الأداء.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحثية بعنوان "!Search Your Block Floating Point Scales" باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.
الصورة الكبيرة: حزم حقيبة السفر بكفاءة
تخيل أنك تحاول حزم حقيبة سفر (ذاكرة الكمبيوتر) للرحلة. لديك الكثير من الأغراض (البيانات) لتضعها في الداخل، لكن الحقيبة صغيرة. لجعل كل شيء يتسع، عليك ضغط هذه الأغراض (وهذا ما يسمى بـ التكميم - quantization).
في الماضي، عند حزم مجموعة من الأغراض، كنت تنظر إلى أكبر قطعة في المجموعة وتقول: "حسناً، سأقوم بتصغير بقية القطع حتى تتناسب هذه القطعة الكبيرة تماماً". هذه هي الطريقة القياسية المستخدمة في شرائح الذكاء الاصطناعي الحديثة.
المشكلة:
لاحظ المؤلفون أنه مجرد كون القطعة الأكبر قد تناسب الحجم، لا يعني بالضرورة أن بقية القطع قد حُزمت بكفاءة. أحياناً، يؤدي تصغير كل شيء بناءً على القطعة الأكبر إلى ترك مساحات فارغة كثيرة أو ضغط القطع الصغيرة بشكل مبالغ فيه، مما يجعل من الصعب التعرف عليها لاحقاً. الأمر يشبه محاولة وضع دب كبير (دب قطني) وزر صغير في صندوق واحد؛ إذا جعلت حجم الصندوق على مقاس الدب، فسيضيع الزر وسط الفوضى.
الحل: "ScaleSearch" (المُعلب الذكي)
تقدم الورقة البحثية استراتيجية جديدة تسمى ScaleSearch. بدلاً من مجرد النظر إلى أكبر قطعة ووضع قاعدة واحدة، يقوم الخوارزمي باستخدام "كشاف بحث" صغير للتحقق من عدة طرق مختلفة لحزم الحقيبة.
- الطريقة القديمة: "أكبر قطعة طولها 10 بوصات. سأجعل المقياس الخاص بي 10".
- الطريقة الجديدة (ScaleSearch): "أكبر قطعة طولها 10 بوصات. ولكن انتظر... إذا جعلت المقياس 9.5، فستظل القطعة الكبيرة مناسبة، لكن القطع المتوسطة ستصبح أكثر وضوحاً. وإذا جعلت المقياس 10.5، فستبدو القطع الصغيرة أفضل. دعني أختبر سريعاً هذه الخيارات القليلة وأختار الخيار الذي يجعل المجموعة الكاملة تبدو في أفضل حال".
تظهر الورقة البحثية أنه من خلال عملية البحث الصغيرة والسريعة هذه، يمكن للكمبيوتر حزم البيانات بدقة أكبر بكبثير، مما يقلل من "خطأ التكميم" (الفوضى الناتجة عن الضغط) بنسبة تقارب 27%.
الأجهزة الخاصة: NVFP4
تعمل هذه الحيلة تحديداً بفضل شرائح الكمبيوتر الجديدة فائقة السرعة (بنية NVIDIA Blackwell) التي تستخدم تنسيقاً يسمى NVFP4.
تخيل طريقة الحزم القديمة كأنها استخدام مسطرة بها علامات كبيرة فقط (1، 2، 3). أما الشرائح الجديدة، فهي تمتلك مسطرة بها علامات دقيقة وصغيرة جداً (1.0، 1.1، 1.2، إلخ). ScaleSearch هو التقنية التي تستخدم تلك العلامات الدقيقة والرفيعة لإيجال المقاس المثالي، بدلاً من مجرد التخمين باستخدام العلامات الكبيرة.
ترقية "الانتباه": ScaleSearchAttention
يجب على نماذج الذكاء الاصطناي (مثل روبوتات الدردشة) أن تنتبه للكلمات التي قالتها بالفعل لتفهم الكلمة التالية. هذه "الذاكرة" تسمى KV Cache. تخزين هذه الذاكرة يستهلك مساحة كبيرة ويبطئ العمل.
ابتكر المؤلفون نسخة خاصة تسمى ScaleSearchAttention.
- ماذا تفعل: تطبق منطق "المُعلب الذكي" على ذاكرة الذكاء الاصطناعي.
- النتيجة: تسمح للذكاء الاصطناعي بتخزين ذاكرته بتنسيق مدمج جداً (4-bit) دون فقدان قدرته على فهم السياق.
- التشبيه: تخيل أمين مكتبة يضطر عادةً لكتابة عناوين كل الكتب بالتفصيل الممل (بطيء وضخم). باستخدام هذه الطريقة الجديدة، يستخدم أمين المكتبة رمز اختصار ذكي وصغير وسريع الكتابة، لكنه يراجع الرمز مرتين للتأكد من أنه لم يفت أي تفاصيل مهمة.
ماذا أثبتوا؟ (النتائج)
اختبرت الورقة البحثية ذلك على نماذج ذكاء اصطناعي حقيقية (مثل Llama و Qwen) وأدوات توليد الفيديو (مثل Mochi).
- رياضيات واستنتاج أفضل: عندما استخدموا ScaleSearch في المسائل الرياضية، أصبح الذكاء الاصطناعي أذكى بشكل ملحوظ. في أحد النماذج، قفزت الدرجة في اختبار الرياضيات بمقدار 15 نقطة مقارنة بالطريقة القياسية.
- لغة أفضل: عندما كتب الذكاء الاصطناعي قصصاً أو أجاب على أسئلة، ارتكب أخطاء أقل. انخفضت "الحيرة" (Perplexity - وهو مقياس لمدى ارتباك الذكاء الاصطناي)، مما يعني أن الذكاء الاصطناعي أصبح يبدو أكثر طبيعية وبشرية.
- السرعة: الجزء الأفضل؟ عملية "البحث" هذه سريعة جداً لدرجة أنها لا تبطئ الكمبيوتر تقريباً. الأمر يشبه التحقق من ثلاث طرق مختلفة لربط حذائك؛ يستغرق الأمر جزءاً من الثانية ولكنه يضمن عدم تعثرك لاحقاً. يعمل النظام بـ 98% من سرعة الطريقة القياسية.
الملخص
تقول الورقة البحثية: "لا تكتفِ بالتخمين حول كيفية تصغير بياناتك بناءً على القطعة الأكبر فقط. خذ لحظة وجيزة للتحقق من بعض الخيارات القريبة، وستحصل على نتيجة أكثر وضوحاً ودقة مع عدم وجود عقوبة في السرعة تقريباً".
يطلقون على هذا اسم ScaleSearch، وعند تطبيقه على ذاكرة الذكاء الاصطناعي، يطلقون عليه ScaleSearchAttention. إنه يجعل نماذج الذكاء الاصطناعي أكثر ذكاءً وكفاءة دون الحاجة إلى أجهزة جديدة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.