← أحدث الأبحاث
💻 computer science

BF16 Component-Product Emulation of FP32 and FP64 GEMM on Intel AMX

تقدم هذه الورقة خوارزمية موجهة نحو وحدة المعالجة المركزية (CPU) تستفيد من نواتج مصفوفات Intel AMX BF16 لمحاكاة عمليات ضرب المصفوفات (GEMM) عالية الدقة من نوع FP32 وFP64، محققةً إنتاجية تنافسية ودقة قابلة للضبط عبر تفكيك المعاملات إلى مكونات متعددة منخفضة الدقة وتجميعها في دقة أعلى.

المؤلفون الأصليون: Bing Cui, Yu Liu

نُشر 2026-09-07✓ Author reviewed
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bing Cui, Yu Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تُبنى الحواسيب الحديثة مع انقسام متزايد في آلاتها الداخلية. فمن ناحية، توجد محركات قوية مصممة خصيصًا للذكاء الاصطناائي، وهي تتفوق في إجراء مليارات العمليات الحسابية البسيطة بسرعة هائلة. تعمل هذه المحركات بشكل أفضل مع الأرقام القصيرة والبسيطة، مضحيةً بجزء ضئيل من التفاصيل مقابل سرعة هائلة. ومن ناحية أخرى، لا يزال عالم الاكتشاف العلمي — مثل محاكاة أنماط الطقس، أو نمذجة كيفية ترابط الذرات، أو التنبؤ بتدفق السوائل — يعتمد على أرقام طويلة ودقيقة. تحتاج هذه الحسابات العلمية إلى كل ذرة من التفاصيل لتبقى مستقرة ودقيقة، لكن أجزاء الحاسوب القياسية التي تتعامل معها غالبًا ما تكون أبطأ وأقل كفاءة من محركات الذكاء الاصطناعي الجديدة. وهذا يخلق معضلة: العلماء يحتاجون إلى سرعة الأجهزة الجديدة، لكنهم لا يستطيعون تحمل فقدان الدقة التي يتطلبها عملهم.

استكشف باحثون في شركة "ماجينفرا" (Magizable Co., Ltd.) في الصين طريقة لسد هذه الفجوة باستخدام نوع محدد من الرقائق الحاسوبية يسمى "إنتل AMX". كان هدفهم هو معرفة ما إذا كان يمكن خداع محركات الذكاء الاصطناعي السريعة ومنخفضة الدقة للقيام بالرياضيات البطيئة وعالية الدقة المطلوبة للعلوم. وبدلاً من مطالبة الرقاقة بالقيام بالرياضيات الصعبة مباشرة، قاموا بتفكيك المشكلة إلى قطع أصغر وأبسط. تخيل محاولة قياس مسافة طويلة جدًا باستخدام مسطرة تحتوي فقط على علامات لكل بوصة كاملة؛ يمكنك قياس البوصات الكاملة، ثم قياس الكسر المتبقي، ثم قياس الجزء الضئيل المتبقي، ثم جمعها جميعًا للحصول على إجمالي دقيق. طبق الباحثون هذا المنطق نفسه على الأرقام؛ حيث أخذوا رقمًا واحدًا معقدًا وقسموه إلى عدة أجزاء أبسط يمكن لمحرك الذكاء الاصطناعي السريع التعامل معها بسهولة. ثم قاموا بإجراء العديد من الحسابات السريعة على هذه الأجزاء وجمع النتائج بعناية لإعادة بناء الإجابة النهائية عالية الدقة.

اختبر الفريق هذا النهج على مستويين مختلفين من الدقة. أولاً، تناولوا حسابات الدقة الأحادية (single-precision)، وهي المعيار للعديد من التطبيقات العلمية. ووجدوا أنه من خلال تقسيم كل رقم إلى ثلاثة أجزاء وإجراء ست عمليات حسابية محددة، يمكنهم تحقيق نتائج دقيقة تمامًا مثل أفضل البرمجيات الحالية، ولكن بسرعة أكبر بكثير. في الرقائق الحاسوبية التي اختبروها، كانت هذه الطريقة أسرع بمعدل يتراوح بين 1.14 و2.56 مرة من الطريقة القياسية للقيام بالرياضيات. وكان التسارع ملحوظًا بشكل أكبر مع مجموعات البيانات الأكبر، حيث يصبح العبء الإضافي الناتج عن تقسيم وإعادة تجميع الأرقام أقل أهمية مقارنة بالسرعة الهائلة للحسابات.

وعندما انتقلوا إلى حسابات الدقة المزدوجة (double-precision)، وهي أكثر دقة وتُستخدم لأكثر المحاكاة العلمية تطلبًا، زاد التحدي. هنا، كان على الباحثين تقسيم كل رقم إلى ستة أجزاء. ولأن الحسابات يجب إعادة تجميعها بعناية فائقة، أصبحت العملية أكثر تعقيدًا. اختبروا نسخًا مختلفة من هذه الطريقة، مع الاحتفاظ بما يتراوح بين ست إلى واحد وعشرين قطعة من قطع الحساب الصغيرة. واكتشفوا مقايضة واضحة: الاحتفاظ بمزيد من القطع يجعل الإجابة أكثر دقة، ولكنه يبطئ العملية أيضًا. فباستخدام ست قطع فقط، كانت الطريقة سريعة بما يكفي للتفوق على البرامج القياسية للمشكلات الكبيرة جدًا، حيث كانت أسرع بمعدل يصل إلى 1.7 مرة. ومع ذلك، مع إضافة المزيد من القطع لتحسين الدقة، فإن العمل الإضافي المطلوب لإدارتها استهلك ميزة السرعة. وفي النهاية، جعلت محاولة الاحتفاظ بواحد وعشرين قطعة الطريقة أبطأ من النهج القياسي، رغم أنها كانت أكثر دقة.

كما سلطت الدراسة الضوء على أن هذه التقنية ليست حلاً عالميًا لكل حالة. فهي تعمل بشكل أفضل عندما تظل الأرقام التي يتم حسابها ضمن نطاق محدد، تمامًا كما أن المسطرة ذات الطول المحدود لا يمكنها قياس مسافة شاسعة جدًا أو ضئيلة جدًا دون تعديلات خاصة. وأشار الباحثون إلى أن طريقتهم لا تعمل مع كل أنواع الأرقام، لا سيما الأرقام الكبيرة جدًا أو الصغيرة جدًا، وهي لا تضمن تطابقًا تامًا (بت مقابل بت) مع البرمجيات الحالية. بدلاً من ذلك، هي تقدم أداة جديدة للعلماء الذين يحتاجون إلى سرعة عالية ودقة عالية، بشرط أن تقع بياناتهم ضمن حدود هذه الطريقة. ومن خلال إظهار إمكانية استخدام الأجهزة منخفضة الدقة لحل مشكلات عالية الدقة، تشير هذه الدراسة إلى مستقبل يمكن فيه استخدام المحركات المتخصصة المبنية للذكاء الاصطناعي لتسريع المهام الشاقة للاكتشاف العلمي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →