← أحدث الأبحاث
💻 computer science

Stencil Computations on Cerebras Wafer-Scale Engine

تقدم هذه الورقة البحثية CStencil، وهو إطار عمل ينجح في تعيين حسابات القوالب (stencil computations) ثنائية الأبعاد على محرك Cerebras WSE-3، محققاً تسريعاً يصل إلى 342 ضعفاً مقارنة بمرجع أساسي من وحدات معالجة الرسومات المعدلة، وذلك عبر الاستفادة من الذاكرة الضخمة الموجودة على الشريحة والترابط الشبكي للتغلب على اختناقات الذاكرة التقليدية.

المؤلفون الأصليون: Elia Belli, Daniele De Sensi

نُشر 2026-05-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Elia Belli, Daniele De Sensi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز ضخم ومعقد، حيث تعتمد كل قطعة فيه على القطع الملامسة لها. في عالم العلوم، يُسمى هذا "الحساب القالبي" (Stencil Computation). وهو النوع من الرياضيات المستخدم لمحاكاة أشياء مثل كيفية انتشار الحرارة عبر لوح معدني، أو كيفية تدفق الرياح حول طائرة، أو كيفية تغير أنماط المناخ على مدى عقود.

على مدار العقد الماضي، كانت أفضل الأدوات لحل هذه الألغاز هي وحدات معالجة الرسومات (GPUs) (وهي الرقائق القوية الموجودة في بطاقات الرسوميات والحواسيب الفائقة). ولكن هناك مشكلة: وحدات معالجة الرسومات تشبه أسطولاً من شاحنات التوصيل فائقة السرعة التي يتعين عليها الذهاب والعودة إلى مستودع بعيد (الذاكرة الرئيسية) لجلب كل قطعة من اللغز. وبالرغم من أن الشاحنات سريعة، إلا أنها تقضي معظم وقتها عالقة في حركة المرور بانتظار المستودع. وهذا ما يُعرف باسم "جدار الذاكرة" (Memory Wall).

المنافس الجديد: محرك سيريبراس على مستوى الرقاقة (Cerebras WSE-3)

هنا يظهر محرك سيريبراس على مستوى الرقة (WSE-3). بدلاً من أسطول من الشاحنات، تخيل أرض مصنع ضخمة مبنية على قطعة واحدة عملا يعمل كلياً من السيليكون (رقاقة كاملة). في أرض المصنع هذه، يوجد 900,000 عامل صغير (معالجات)، ولكل واحد منهم صندوق أدواته الخاص (الذاكرة) بجانبه تماماً. هم لا يحتاجون للقيادة إلى مستودع؛ بل يتبادلون الملاحظات فقط مع جيرانهم المباشرين.

يسأل البحث سؤالاً بسيطاً: هل يمكننا استخدام هذا المصنع المصمم بالذكاء الاصطناعي لحل هذه الألغاز العلمية بشكل أسرع من شاحنات وحدات معالجة الرسومات التقليدية؟

التجربة: CStencil مقابل ConvStencil

لمعرفة ذلك، صمم الباحثون برنامجاً جديداً يسمى CStencil ليعمل على مصنع سيريبراس. وقاموا بمقارنته بالبرنامج المعياري الذهبي الحالي لوحدات معالجة الرسومات، والذي يسمى ConvStencil.

لجعل السباق عادلاً، كان عليهم تعديل القواعد قليلاً. مصنع سيريبراس مُحسّن لـ "التقديرات السريعة والخشنة" (الحسابات ذات الدقة المنخفضة)، بينما تتطلب المحاكاة العلمية عادةً "حسابات عالية الدقة" (الدقة المزدوجة). وبما أن سيريبراس لا يتعامل جيداً مع الدقة المزدوجة، فقد قام الباحثون بتعديل برنامج وحدة معالجة الرسومات ليعمل بالدقة الفردية، تماماً مثل رقاقة سيريبراس، حتى يتمكنوا من مقارنة "التفاح بالتفاح".

كيف فعلوا ذلك: تبادل "الهالة" (Halo Swap)

الجزء الصعب في هذه الألغاز هو الحواف. عندما يقوم عامل في منتصف الشبكة بتحديث قطعته، فإنه يحتاج لمعرفة ما يفعله جيرانه.

  • في وحدة معالجة الرسومات (GPU): يتعين على العمال الصراخ عبر الغرفة إلى مستودع مركزي للحصول على بيانات الجار. وهذا يستغرق وقتاً.
  • في سيريبراس (Cerebras): يمرر العمال الملاحظات مباشرة إلى الشخص الواقف بجانبهم.

اضطر الباحثون لتعليم عمال سيريبراس طريقتين مختلفتين لتمرير الملاحظات:

  1. نمط النجمة (Star Pattern): مجرد تمرير الملاحظات إلى الأشخاص الأربعة الموجودين في جهات الشمال والجنوب والشرق والغرب مباشرة.
  2. نمط الصندوق (Box Pattern): تمرير الملاحظات إلى الجيران الأربعة المباشرين بالإضافة إلى الأشخاص الأربعة الواقفين بشكل قطري. وبما أن العمال يمكنهم التحدث فقط مع الجيران المباشرين، فقد اضطروا لاستخدام نظام "ترحيل": تمرير الملاحظة القطرية إلى الجار، الذي يقوم بدوره بتمريرها إلى الصديق القطري.

النتائج: فوز ساحق

كانت النتائج مذهلة.

  • السرعة: في أكبر الألغاز التي تم اختبارها، كانت شريحة سيريبراس أسرع بـ 342 مرة من وحدة معالجة الرسومات.
  • السبب: كانت وحدة معالجة الرسومات عالقة في حركة المرور (بانتظار الذاكرة). أما شريحة سيريبراس فلم تغادر أرض المصنع أبداً. ولأن كل عامل لديه ذاكرته الخاصة بجانبه، فقد تمكنوا من الحساب بسرعة تفكير عقولهم، دون انتظار أي عملية تسليم.
  • التوسع (Scaling): كلما كبر اللغزا، أصبحت وحدة معالجة الرسومات أبطأ بسبب سوء حالة المرور. بينما أصبحت شريحة سيريبراس أسرع (أو ظلت بنفس السرعة) لأنها ببساطة أضافت المزيد من العمال إلى أرض المصنع، وعملوا جميعاً معاً بانسجام تام.

العقبة: من الصعب برمجتها

يعترف البحث بأنه رغم كون شريحة سيريبراس وحشاً في السرعة، إلا أن قيادتها أصعب بكثير.

  • وحدة معالجة الرسومات (GPU): يمكنك استخدام أدوات عالية المستوى (مثل CUDA) التي تتعامل مع حركة المرور نيابة عنك. الأمر يشبه قيادة سيارة أوتوماتيكية.
  • سيريبراس (Cerebras): يجب عليك إخبار كل عامل يدوياً متى يمرر ملاحظة ومتى يبدأ الحساب. الأمر يشبه أن تكون قائد أوركسترا حيث يتعين عليك إخبار 900,000 عازف بالضبط متى يصفقون. إذا ارتكبت خطأً واحداً، سيتوقف الكل.

الخلاصة

يثبت هذا البحث أن الأجهزة المصممة للذكاء الاصطناعي (الذي يعشق تمرير البيانات بين الجيران) يمكن إعادة توظيفها لحل المشكلات العلمية التقليدية. بالنسبة للمحاكاة الضخمة مثل نمذجة المناخ أو ديناميكا السوائل، توفر محرك سيريبراس على مستوى الرقاقة طريقة لكسر "جدار الذاكرة" الذي أعاق الحواسيب الفائقة لسنوات، مما يقدم سرعات كانت مستحيلة سابقاً. ومع ذلك، وإلى أن تصبح أدوات البرمجة أسهل في الاستخدام، ستظل أداة متخصصة للخبراء بدلاً من أن تكون بديلاً للحواسيب اليومية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →