تقترح هذه الورقة إطار عمل لشبكة ذكية للتدريب الموزع عبر الشبكات واسعة النطاق، يجمع بين البث المتعدد وتجميع مصفوفات البوابات المنطقية القابلة للبرمجة (FPGA) المدمجة مع جداول مزامنة محسنة للتغلب على قيود عرض النطاق الترددي وزمن الاستجابة، مما يؤدي إلى تقليص فجوة الأداء مع التدريب في المواقع المجاورة.
أصبحت أقوى نماذج الذكاء الاصطناوي في العالم كبيرة جداً بحيث لا يمكن استيعابها داخل مبنى واحد. يتطلب تدريب هذه الأنظمة آلاف الحواسيب التي تعمل معاً، ولكن القيود المادية المتعلقة بالطاقة والمساحة تعني أن أي مركز بيانات منفرد لم يعد بإمكانه احتواءها جميعاً. بدلاً من ذلك، يتعين على الباحثين توزيع قدراتهم الحوسبية عبر مواقع متعددة، تفصل بينها أحياناً محيطات. وهذا يخلق مشكلة صعبة: تحتاج الحواسيب إلى التواصل مع بعضها البعض باستمرار لتبقى متزامنة، لكن إرسال كميات هائلة من البيانات عبر مسافات طويلة هو أمر بطيء ومكلف. وغالباً ما تكون الوصلات بين هذه المواقع البعيدة ضيقة وغير متساوية، مما يتسبب في بقاء الحواسيب خاملة بينما تنتظر وصول المعلومات. وإذا لم تتمكن الحواسيب من مشاركة تقدمها بسرعة، فإن عملية التدريب بأكملها تتباطأ، مما يهدر وقتاً وطاقة ثمينين.
اقترح فريق من الباحثين من مؤسسة "دبل زيرو" (DoubleZero Foundation) طريقة جديدة لحل هذه العقبة عن طريق تحويل الشبكة نفسها إلى مساعد نشط. فبدلاً من معاملة اتصال الإنترنت كأنبوب سلبي ينقل البيانات فحسب، يقترحون استخدام أجهزة متخصصة داخل الشبكة لإدارة تدفق المعلومات. يجمع نهجهم بين تقنيتين موجودتين بطريقة مبتكرة للاتصالات واسعة النطاق. أولاً، يستخدمون طريقة تسمى "البث المتعدد" (multicast)، والتي تسمح لحاسوب واحد بإرسال رسالة تقوم الشبكة تلقائياً بنسخها وتسليمها إلى العديد من الوجهات المختلفة في وقت واحد، بدلاً من إرسال نسخ منفصلة لكل وجهة. ثانياً، يضعون رقائق قابلة للبرمجة، تُعرف باسم "FPGAs"، عند حافة الشبكة بالقرب من كل مجموعة حواسيب. تعمل هذه الرقائق كمجمّعات ذكية، حيث تجمع تدفقات البيانات الواردة من مصادر عديدة وتدمجها في تدفق واحد نظيف قبل وصولها إلى الحواسيب المحلية. ومن خلال القيام بالعمل الشاق المتمثل في نسخ ودمج البيانات داخل الشبكة، يقلل النظام من الضغط على الوصلات المحدودة بين المواقع البعيدة.
ولجعل هذا النظام يعمل بفعالية، طور الباحثون أيضاً إطاراً رياضياً جديداً لتحديد كيفية وتوقيت تواصل الحواسيب مع بعضها البعض بالضبط. في الإعداد التقليدي، قد يحاول كل حاسوب التحدث مع كل الحواسيب الأخرى في نفس الوقت، مما يؤدي إلى سد الشبكة. يعامل الإطار الجديد الشبكة كأنها خريطة ذات طرق وقواعد مرور محددة؛ فهو يحسب أفضل طريقة لتجميع الحواسيب في دوائر تواصل صغيرة ودوارة. في كل جولة، تتبادل مجموعة محددة من الحواسيب المعلومات بينما تنتظر المجموعات الأخرى، ثم تنتقل المجموعات في الجولة التالية. والهدف هو إيجاد التوازن المثالي بين مدة انتظار الحواسيب وكمية المعلومات التي تشاركها. اختبر الباحثون هذه الفكرة باستخدام محاكاة قائمة على شبكة حقيقية قابلة للبرمجة تمتد عبر تسع مدن في ثلاث قارات. وقد قاموا بنمذجة أوقات السفر الفعلية وسرعات الاتصال بين مدن مثل طوكيو ونيويورك ولندن لمعرفة كيفية أداء استراتيجيات التجميع المختلفة.
كشفت عمليات المحاكاة أن الاستراتيجية المثلى تعتمد بشكل كبير على قدرات الأجهزة. فعندما كانت رقائق الشبكة تمتلك ذاكرة قليلة جداً، كان النهج الأكثر كفاءة هو تشكيل مجموعات صغيرة مكونة من ثلاثة حواسيب تدور عبر تركيبات مختلفة؛ مما سمح للبيانات بالتدفق بسرعة دون إثقال قدرة النظام على الاحتفاظ بالمعلومات. ومع ذلك، عندما منح الباحثون الرقائق ذاكرة أكبر، تغيرت الاستراتيجية المثلى تماماً. فمع وجود ذاكرة كافية للتعامل مع تأخيرات السفر لمسافات طويلة، استطاع النظام دعم استراتيجية تسمة فيها كل حاسوب يتحدث مع كل الحاسيب الأخرى في آن واحد. أصبح نهج "الكل إلى الكل" (all-to-all) هذا، والذي كان مستحيلاً في السابق عبر المسافات الطويلة، هو الطريقة الأسرع لأنه سمح للمعلومات بالانتشار إلى الجميع في أقصر وقت ممكن. أظهرت الدراسة أنه من خلال الجمع بين تقنيات الشبكة الذكية هذه مع جدول زمني يتكيف مع حدود الأجهزة، من الممكن تقليص الفجوة بين الحواسيب التي يتم تدريبها وهي منتشرة عبر العالم وتلك الموجودة جنباً إلى جنب في نفس الغرفة.
يؤكد الباحثون أن عملهم هو حالياً محاكاة قائمة على شبكة حية لا تزال قيد البناء. وبينما توجد شبكة "دبل زيرو" وتتحمل حركة مرور البيانات، إلا أنها لا تمتلك بعد عدد كافٍ من مجموعات الحواسيب المتصلة لتدريب نموذج ضخم في اختبار واقعي. إن النتائج المعروضة هي بمثابة إثبات للمفهوم، توضح أن المكاسب النظرية حقيقية، وأن الجمع الصحيح بين أجهزة الشبكة ومنطق الجدولة يمكن أن يتغلب على العوائق التقليدية للمسافة. وتشير النتائج إلى أن مستقبل تدريب نماذج الذكاء الاصطناعي العملاقة لن يعتمد فقط على حواسيب أسرع، بل على شبكات أكثر ذكاءً تشارك بنشاط في عملية التعلم، محولةً المسافات الشاسعة بين مراكز البيانات من نقطة ضعف إلى جزء يمكن إدارته من النظام.
ملخص تقني: التدريب الموزع باستخدام شبكة ذكية
بيان المشكلة
يواجه التدريب الموزع للنماذج واسعة النطاق قيوداً متزايدة بسبب حدود مراكز البيانات الفردية المتعلقة بالطاقة، والتراخيص، ولوائح سيادة البيانات. وبينما يعد التدريب داخل مركز بيانات واحد ممكناً نظراً لاتصال عالي النطاق الترددي، ومنخفض زمن الوصول، ومتماثل، فإن التوسع إلى شبكة واسعة النطاق (WAN) يؤدي إلى ظهور اختناقات شديدة. وتتمثل التحديات الرئيسية في:
قيود النطاق الترددي: روابط الشبكة الواسعة (WAN)، وخاصة روابط الخروج/الدخول إلى جزر الحوسبة، باهظة الثمن ومحدودة السعة. إن نهج الانحدار الاشتقاقي العشوائي المتزامن (SGD) القياسي سيتطلب تيرابايت في الثانية لتبادل تحديثات النموذج الكاملة، وهو أمر غير ممكن.
زمن الوصول وعدم التماثل: تضاريس الشبكات الواسعة غير متجانسة، حيث تتميز بزمن وصول عالٍ (بالملي ثانية مقابل الميكرو ثانية) ونطاق ترددي غير متماثل. يتسبب هذا في خمول كبير لموارد الحوسبة أثناء انتظار المزامنة أو يؤدي إلى استخدام معاملات قديمة (stale parameters).
عدم تجانس الطوبولوجيا: المسافات المتباينة وسعات الروابط بين الجزر تجعل مخططات المزامنة القياسية (مثل ring all-reduce) غير فعالة أو مستحيلة دون عبء إضافي هائل.
عادة ما تقوم الأدبيات الموجودة بتكييف الخوارزميات مع الشبكة من خلال تقليل تكرار الاتصال (مثل DiLoCo)، أو ضغط البيانات (الكمية/التخلخل)، أو تحمل قدم البيانات. ومع ذلك، فإن هذه النهج تتعامل مع الشبكة كقيد سلبي بدلاً من مشارك نشط.
المنهجية
يقترح البحث نهجاً ذا شقين حيث تشارك الشبكة بنشاط في عملية التدريب، من خلال الجمع بين تقنيات نظام محددة وإطار عمل لتحسين الخوارج الخوارزمية.
1. المقترح النظامي: تقنيات الشبكة النشطة
يقترح المؤلفون الاستفاف من تقنيتين محددتين لتخفيف اختناقات الدخول والخروج عبر الشبكة الواسعة (WAN):
البث المتعدد (Multicast) لتحسين الخروج: بدلاً من أن تقوم جزيرة مرسلة ببث N−1 من تدفقات البث الفردي (Unicast) (تدفق واحد لكل مستلم)، تستخدم الشبكة البث المتعدد. ترسل الجزيرة المرسلة حمولة واحدة، وتقوم الشبكة بتكرارها عند نقاط التفرع في شجرة التوزيع. هذا يلغي حركة المرور المكررة على الشبكة الأساسية ويقلل بشكل كبير من استخدام نطاق الخروج الترددي.
مصفوفات البوابات المنطقية القابلة للبرمجة (FPGAs) المدمجة للتجميع الداخل: لمعالجة اختناق الدخول حيث قد تستقبل الجزيرة N−1 من التدفقات المتميزة، يتم نشر مصفوفات (FPGAs) عند حافة الشبكة. تقوم هذه المصفوفات بتجميع التدفقات الواردة قبل وصولها إلى رابط الوصول الخاص بالجزيرة.
إدارة الذاكرة: على عكس مفاتيح مراكز البيانات، يجب على مصفوفات (FPGAs) في الشبكات الواسعة التعامل مع الوصول غير المتزامن بسبب تباين أزمنة الوصول. يستخدم النظام ذاكرة ذات نطاق ترددي عالٍ (HBM) لتخزين الأوزان الواردة. يتم التجميع مع وصول الأوزان، ويتم إدارته عبر نظام هاشينج (Weight ID) ومعايير الإخلاء (الاكتمال، أو المهلة الزمنية، أو التعارض).
استعادة الفقد: بما أن البث المتعدد يمنع استخدام بروتوكول TCP، فإن النظام يتعامل مع فقدان الحزم عن طريق إرفاق أرقام تسلسلية للحزم بعد التجميع، حيث تحتفظ مصفوفة (FPGA) بذاكرة مؤقتة لإعادة الإرسال لنطاق زمني محدد (tresend) للسماح للجزيرة المستلمة بطلب الحزم المفقودة، مما يحمي الخطوة النهائية الحرجة.
2. مقترح الخوارزميات: إطار عمل التحسين
يطور المؤلفون إطار عمل للتحسين لإنشاء "جداول مزامنة غنية" بناءً على الطوبولوجيا الفيزيائية للشبكة وقدراتها التكنولوجية.
الكلِقات الدوارة (Rotating Cliques): بدلاً من المزامنة الشاملة (all-to-all)، يتم تقسيم الجزر إلى "كليقات" (مجموعات) منفصلة في كل جولة. وتدور هذه الكليقات بمرور الوقت لضمان الاختلاط العالمي.
دالة الهدف: الهدف هو تقليل دالة التكلفة التي تمثل قدم المعلومات (Information Staleness).
تجمع الدالة بين زمن الجولة (T) و متوسط عمر عدم الاتفاق (A).
يتم اشتقاق A من "منحنيات البقاء" التي تقيس مدى سرعة انتشار جيل معين من تحديثات المعاملات عبر جميع الجزر.
الهدف هو تقليل T(A+1/2)، وهي مقايضة بين تكلفة زمن الجولة وجودة الاختلاط.
قيود الجدوى: يكون الجدول صالحاً فقط إذا كان ضمن زمن الجولة T وقيود ذاكرة الـ (FPGA) (M).
قيد الاكتمال: يجب أن يكون زمن وصول آخر بايت إلى الوجهة ≤T.
قيد الذاكرة: يجب أن تحتفظ الـ (FPGA) بالبايتات في الذاكرة من لحظة وصول أول تدفق حتى وصول الأخير. إذا كانت الذاكرة غير كافية، يجب على الجزر تغيير إزاحات الإرسال (tj) لتنسيق عمليات الوصول، مما يزيد من T.
استراتيجية الحل: يتم العثين على الجدول الأمثل من خلال التكرار عبر طوبولوجيات الكليقات المرشحة، وحساب الحد الأدنى لزمن T لكل منها (عبر حل برنامج خطي للإزاحات ومعدلات التدفق)، واختيار الجدول الذي يقلل دالة الهدف.
المساهمات الرئيسية
الابتكار النظامي: توسيع نطاق البث المتعدد والتجميع داخل الشبكة (عبر FPGAs) من بيئات مراكز البيانات إلى الشبكات الواسعة (WAN). هذا هو أول مقترح لاستخدام هذه التقنيات خصيصاً لحل عدم تماثل النطاق الترددي وزمن الوصول في التدريب الموزع عبر الـ WAN.
الإطار الخوارزمي: إطار عمل لجدولة المزامنة يدمج صراحةً طوبولوجيا الشبكة، وزمن الوصول، والنطاق الترددي، وقيود ذاكرة الأجهزة. إنه يتجاوز الجداول الثابتة أو الاستدلالية إلى نهج قائم على التحسين ينتج "كليقات دوارة" مصممة خصيصاً للشبكة.
التصميم المتكامل: يوضح البحث أن المكونات النظامية والخوارزمية يعزز كل منهما الآخر. فالخوارزمية تستفيد من قدرات البث المتعدد والـ FPGAs، بينما تتيح الأجهزة للخوارزمية تحقيق خصائص الاختلاط التي كان يُعتقد سابقاً أنها مستحيلة عبر الـ WAN.
النتائج
يقيم المؤلفون مقترحهم باستخدام محاكاة تعتمد على شبكة DoubleZero، وهي شبكة برمجية حية تربط تسع مدن عبر ثلاث مناطق (أمريكا الشمالية، أوروبا، آسيا) مع أزمنة وصول واقعية وروابط أساسية بسرعة 100 جيجابت في الثانية.
مقارنة الجداول: تقارن الدراسة أربعة جداول: "المثلثات" (كليقات إقليمية تدور عبر المناطق)، "الأزواج" (مطابقة خطية)، "الكل إلى الكل" (All-to-All)، و"الإقليمية".
بدون ذاكرة الـ FPGA: حقق جدول "المثلثات" أفضل أداء، حيث وازن بين انخفاض الخطأ السريع وأزمنة الجولات الممكنة (~565 مللي ثانية). أما جدول "الكل إلى الكل" فكان غير ممكن بسبب عدم القدرة على تنسيق تسعة مرسلين متزامنين دون تخزين مؤقت في الذاكرة.
مع ذاكرة الـ FPGA (32 جيجابايت): أصبح جدول "الكل إلى الكل" ممكناً بزمن جولة قدره ~676 مللي ثانية. وبفضل خصائص الاختلاط المثالية، تفوق على جميع الجداول الأخرى، مما أثبت أن قدرات الأجهزة تملي مباشرة الاستراتيجية الخوارزمية المثلى.
المقارنة مع SGD المتزامن:
يتطلب SGD المتزامن القياسي (Ring All-Reduce) بقاء وحدات معالجة الرسومات (GPUs) في حالة خمول بنسبة 80% تقريباً لانتظار المزامنة العالمية. ما يقترحه هذا النظام، من خلال تحمل قدر بسيط من قدم المعاملات (ثانية واحدة)، يحقق سرعة إنتاجية للتدريب تبلغ 5 أضعاف.
حتى ضمن SGD المتزامن، فإن استخدام الأجهزة المقترحة (البث المتعدد/FPGAs) يقلل بشكل كبير من وقت الخمول مقارنة بالتجميع التقليدي المعتمد على المضيف.
الأهمية والادعاءات
يدعي البحث أن الفجوة بين التدريب الموزع عبر الـ WAN و"المعيار الذهبي" للتدريب المتمركز يمكن تقليصها بجعل الشبكة مشاركاً نشطاً.
الحداثة: يؤكد المؤلفون أنه بينما تُعرف تقنيات البث المتعدد والـ FPGAs في مراكز البيانات، فإن تطبيقها عبر شبكة واسعة (WAN) للتدريب هو أمر جديد. وبالمثل، فإن إطار عمل المزامنة فريد من نوعه لأنه متجذر بعمق في الخصائص الفيزيائية للشبكة بدلاً من معاملتها كصندوق أسود.
النطاق المتواضع: يقر البحث بأن شبكة DoubleZero هي حالياً شبكة حية للأسواق المالية ولا تربط بعد عدداً كافياً من مجموعات الحوسبة لتدريب نموذج "بجدية" للمقارنة التجريبية الكاملة مع الأنظمة الأخرى. لذلك، فإن النتائج المعروضة هي محاكاة بناءً على طوبولوجيا واقعية.
النظرة المستقبلية: يضع المؤلفون هذا العمل كقاعدة نظرية ونظامية للجيل القادم من النماذج، بحجة أن الشبكات الواسعة (WANs) القابلة للبرمجة والمخصصة، والتي تمتلك تحكماً دقيقاً وذاكرة وفيرة، هي البنية التحتية اللازمة لتجاوز حدود التوسع لمراكز البيانات الفردية. وهم يرفضون صراحةً فكرة أن هذه النهج صالحة فقط للبنى التحتية المحدودة، مؤكدين أن الجمع بين الشبكات النشطة والجدولة المحسنة هو المفتاح لمستقبل التدريب الموزع.