History-First Reliability-Gated Fusion for Sampled-Peak System and GPU Memory Utilization Prediction in HPC Clusters
تقدم هذه الورقة إطار عمل للدمج يعتمد على الأولوية التاريخية وبوابة الموثوقية، يجمع بين التخزين المؤقت التاريخي للنصوص الدقيقة وبين مشفر Qwen2.5-Coder المُعدل بتقنية LoRA لتحسين دقة التنبؤ باستخدام ذاكرة النظام ومعالج الرسوميات في مجموعات الحوسبة عالية الأداء بشكل كبير، مع تقليل العبء الحسابي من خلال الاستدلال الانتقائي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في القاعات الشاسعة والنابضة بالحياة للحوسبة عالية الأداء، حيث تحل الحواسيب الفائقة مشكلات معقدة للغاية تفوق قدرة أي آلة منفردة، يبرز تحدٍ هادئ ولكنه حاسم: إدارة الموارد. هذه العناقيد تشبه مدنًا ضخمة من المعالجات، وبنوك الذاكرة، ومسرعات الرسوميات، التي تعمل جميعها في تناغم. ولإبقاء المدينة تسير بسلاسة، يجب على المسؤولين تحديد مقدار الطاقة التي سيتم تخصيصها لكل مهمة حتى قبل أن تبدأ. حاليًا، يعتمدون على طلب المهمة نفسه — أي مستخدم أو نص برمجي (script) يطلب قدرًا معينًا من الذاكرة أو الوقت. ومع ذلك، غالبًا ما تكون هذه الطلبات تخمينات متحفظة، تُوضع لضمان عدم تعطل المهمة. وعندما يطلب الجميع أكثر مما يحتاجون، تصبح المدينة مجزأة؛ حيث تظل مساحات قيمة فارغة بينما تنتظر مهام أخرى في الطابور. والهدف من الأبحاث الحديثة في هذا المجال هو تجاوز هذه التخمينات التقريبية والتنبؤ بدقة بما ستستخدمه المهمة فعليًا، مما يسمح للنظام بتعبئة المهام بشكل أكثر إحكامًا وكفاءة.
تكمن الصعوبة الجوهرية في طبيعة العمل نفسه. فسلوك المهمة ليس مجرد رقم، بل هو قصة مكتوبة بالكود. أحيانًا يقوم المستخدم بتشغيل نفس النص البرمجي الذي استخدمه بالأمس، وتكون النتيجة متوقعة. وفي أحيان أخرى، يقوم بتعديل سطر واحد من الكود، أو تغيير ملف بيانات، أو التشغيل على نوع مختلف من الحواسيب، ويمكن أن يتغير استهلاك الموارد بشكل جذري. الطرق التقليدية التي تنظر فقط إلى الأرقام الماضية غالبًا ما تفشل عندما يتغير النص البرمسي، بينما الطرق التي تحاول قراءة الكود من الصفر قد تكون بطيئة ومكلفة حاسوبيًا. وكان السؤال الذي واجهه الباحثون هو ما إذا كان بإمكانهم بناء نظام يعرف متى يثق بالماضي ومتى يقرأ الكود الجديد، ويدمج هذين المصدرين من المعلومات لإجراء تنبؤ دقيق قبل بدء المهمة.
قام فريق من الباحثين من جامعة شرق الصين العادية، وجامعة رنمين، وجامعة نيويورك شنغهاي، بمهمة حل هذه المشكلة عبر إنشاء نوع جديد من محرك التنبؤ لعناقيد الحوسبة عالية الأداء. لقد ركزوا على موردين محددين: ذاكرة النظام التي تحفظ البيانات للمعالجة العامة، وذاكرة الفيديو (VRAM) التي تستخدمها بطاقات الرسوميات للحسابات الثقيلة. نهجهم، الذي يسمون به "التتابع ذو البوابة الموثوقية المعتمد على التاريخ أولاً"، يعمل مثل مراقب مرور ذكي. فبدلاً من إجبار كل مهمة على الخضوع لتحليل معقد، يتحقق النظام أولاً مما إذا كان هناك سجل موثوق لتشغيل نفس النص البرمجي بالضبط بنجاح في الماضي. إذا كان التاريخ واضحًا وموثوقًا، يستخدم النظام تلك البيانات الماضية فورًا، متجاوزًا العمليات الشاقة. هذه هي آلية "التجاوز" (bypass)، المصم diseñada لتوفير الوقت والطاقة عندما تكون الإجابة معروفة بالفعل.
ومع ذلك، فإن النظام ليس أعمى عن التغيير. فإذا كان النص البرمجي جديدًا، أو إذا كان تاريخ الماضي مشتتًا جدًا بحيث لا يمكن الوثوق به، يقوم النظام بتنشيط أداة متطورة لقراءة الكود. هذه الأداة، القائمة على نموذج ذكاء اصطناعي متخصص تم تدريبه لفهم لغات البرمجة، تحلل النص البرمجي المقدم، وهوية المستخدم، والطلبات المحددة للمهمة. إنها تقرأ الكود لفهم المنطق المقصود، بحثًا عن أدلة حول مقدار الذاكرة أو قوة الرسوميات التي ستحتاجها المهمة فعليًا. لم يترك الباحثون الذكاء الاصطناعي يخمن ببساية؛ بل بنوا طبقة ثانية من اتخاذ القرار تحدث بعد أن ينتهي الذكاء الاصطناي من عمله. تقوم هذه الطبقة بمقارنة تنبؤ الذكاء الاصطناعي مع البيانات التاريخية المتاحة. فإذا كان التاريخ قويًا، تسحب الطبقة التنبؤ النهائي نحو السجل الماضي، ولكن ضمن نطاق آمن ومحسوب لمنع التقلبات الحادة. أما إذا كان التاريخ ضعيفًا، فإنها تترك للذكاء الاصطناعي الذي قرأ الكود زمام المبادرة. هذا الدمج الديناميكي يضمن أن النظام يتكيف مع الحالة المحددة لكل مهمة على حدة.
لاختبار هذه الطريقة، فحص الباحثون مجموعة بيانات واقعية من عنقود إنتاج يحتوي على ما يقرب من 20,000 مهمة مكتملة على مدار أحد عشر شهرًا ونصف الشهر. وقارنوا نظامهم الجديد بعدة طرق موجودة، بما في ذلك عمليات البحث البسيطة عن آخر مرة قام فيها المستخدم بتشغيل مهمة، ونماذج التعلم الآلي القياسية التي تعتمد فقط على البيانات الوصفية (metadata). وأظهرت النتائج أن نهجهم الهجين كان الأكثر دقة. فبالنسبة للتنبؤ باستخدام ذاكرة النظام، قلل أسلوبهم الجديد متوسط الخطأ بنسبة خمسة بالمائة تقريبًا مقارنة بأفضل طريقة سابقة. أما بالنسبة للتنبؤ باستخدام ذاكرة الرسوميات، فقد كان التحسن أكثر أهمية، حيث خفض متوسط الخطأ بنسبة تقرب من أربعة عشر بالمائة. وكان النظام فعالاً بشكل خاص في تحديد المهام التي ستظل ضمن هامش خطأ آمن، وهو عامل حاسم للمسؤولين الذين يحتاجون لتجنب تحميل الأجهزة فوق طاقتها.
كشفت الدراسة أيضًا عن تفاصيل دقيقة حول كيفية عمل هذه التنبؤات. وجد الباحثون أن نجاح النظام يعتمد بشدة على نوع المهمة. فعندما يقوم مستخدم بتشغيل نفس النص البرمجي مرارًا وتكرارًا، كان النهج البسيط المعتمد على التاريخ غالبًا بنفس جودة الذكاء الاصطناعي المعقد، مما يثبت أن الأداء السابق مؤشر قوي للمهام المتكررة. ومع ذلك، عندما يتغير النص البرمجي أو لا يوجد تاريخ دقيق، يصبح ذكاء اصطناعي قراءة الكود ضروريًا، حيث يقدم رؤى لا يمكن للتاريخ المحض تقديمها. لقد تعلم النظام التعرف على هذه الأنظمة المختلفة، والتبديل بين الاستراتيجيات تلقائيًا. ومن حيث السرعة، قاس الباحثون الوقت الذي يستغرقه النظام لمعالجة مهمة واحدة على بطاقة رسوميات عالية الأداء. بدون أي اختصارات، استغرق التحليل حوالي واحد وثلاثين مللي ثانية، وهو جزء من الثانية يتناسب تمامًا مع الاحتياجات التشغيلية لعنقود حوسبة مزدحم. وباستخدام آلية التجاوز، تجنب النظام هذا التحليل الشاق لنحو نصف المهام، مما أدى إلى تحسين الكفاءة بشكل أكبر.
كان الباحثون حذرين في الإشارة إلى حدود نتائجهم. فقد أُجريت الدراسة على عنقود محدد بخلطة معينة من الأجهزة وأعباء العمل، لذا فإن النتائج تعكس تلك البيئة المحددة. كما أكدوا أن تنبؤاتهم تعتمد على المهام التي اكتملت بنجاح؛ فالنظام لا يتنبأ بالإخفاقات أو الأعطال، بل يتنبأ فقط بذروة استخدام الموارد للمهام التي تعمل حتى النهاية. علاوة على ذلك، فإن التنبؤات تهدف لتكون أدوات تخطيط لمساعدة المسؤولين على اتخاذ قرارات أفضل، وليس ضمانًا بإمكان تحميل النظام فوق طاقته بأمان. تضمنت البيانات المستخدمة في الدراسة نصوصًا برمجية قابلة للتنفيذ فعليًا، والتي تحتوي على معلومات حساسة، لذا لم يتمكن الباحثون من نشر البيانات الخام علنًا، رغم أنهم أتاحوا الكود والبيانات المستمدة للمراجعة الأكاديمية بموجب اتفاقيات محددة.
في نهاية المطاف، يوضح هذا العمل أن مستقبل التنبؤ بالموارد لا يكمن في الاختيار بين التاريخ والكود، بل في دمجهما بذكاء. فمن خلال إنشاء نظام يعرف متى يثق بالماضي ومتى يقرأ الحاضر، قدم الباحثون أداة عملية لجعل عناقيد الحوسبة عالية الأداء أكثر كفاءة. ويشير المنهج إلى أنه مع وجود المزيج الصحيح من فحوصات الموثوقية والتعلم التكيفي، يمكننا الاقتراب من حالة تُستخدم فيها موارد الحوسبة بدقة، مما يقلل الهدر ويسمح بإنجاز أعمال علمية أكثر تعقيدًا. تقدم النتائج مسارًا واضحًا لإدارة المتطلبات المتزايدة للحوسبة الحديثة، مما يثبت أن القليل من التاريخ، الموجه بفهم عميق للكود، يمكن أن يذهب بعيدًا جدًا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.