CUCo: An Agentic Framework for Compute and Communication Co-design
يُعد CuCo إطار عمل يعتمد على الوكلاء ولا يتطلب تدريباً، يقوم تلقائياً بتوليد نوى CUDA عالية الأداء من خلال التحسين المشترك للحوسبة والاتصال، مما يقلل بشكل كبير من زمن التأخير النهائي في تدريب واستنتاج النماذج اللغوية الكبيرة الموزعة واسعة النطاق مقارنة بالنهج الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك قائد أوركسترا ضخمة، سريعة الإيقاع، تعزف في ملعب يضم آلاف الموسيقيين (وحدات معالجة الرسومات - GPUs) موزعين عبر مبانٍ مختلفة (مراكز البيانات). الهدف هو عزف سيمفونية معقدة (تدريب نموذج ذكاء اصطناعي عملاق) بأسرع ما يمكن.
المشكلة: عنق الزجاجة لدى "القائد"
في الأيام الخوالي، كان على القائد (وحدة المعالجة المركزية - CPU) أن يقف في المنتصف، ويصرخ بالتعليمات لكل قسم.
- يخبر قسم الوتريات (الحوسبة) بأن يعزفوا نوتة معينة.
- ثم يتوقف، ويركض نحو قسم النحاسيات (الاتصال)، ليخبرهم بتمرير ورقة موسيقية إلى المبنى التالي، وينتظر حتى ينتهوا، ثم يخبر قسم الوتريات بعزف النوتة التالية.
هذا النهج القائم على "التوقف والانطلاق" بطيء للغاية. فالوتريات تظل في حالة خمول بينما يركض القائد ذهابًا وإيابًا. وعلى الرغم من أن الموسيقيين بارعون وسريعون للغاية، إلا أن الأوركسترا بأكملها يمنعها سرعة ركض القائد.
مؤخرًا، تطورت التكنولوجيا: زُوِّد الموسيقيون بأجهزة لاسلكي (واجهات برمجة التطبيقات من جهة الجهاز مثل NVSHMEM/NCCL). الآن، يمكن للوتريات التحدث مباشرة مع النحاسيات دون الحاجة لركض القائد ذهابًا وإيابًا. ولكن هنا تكمن المشكلة: كتابة النص الذي يحدد كيفية تحدث الموسيقيين مع بعضهم البعض أثناء العزف أمر صعب للغاية. إنه يشبه مطالبة مؤلف موسيقي بكتابة نص يجب فيه على عازفي الكمان عزف "سولو" منفرد، وتمرير ملاحظة لصديق في مبنى آخر، والاستماع لإشارة لبدء المازورة التالية في آن واحد — كل ذلك دون ارتباك أو إفساد الأداء. القيام بذلك يدويًا هو كابوس من الأخطاء والتجارب والخطأ.
الحل: CUCo (المؤلف الموسيقي للذكاء الاصطناعي)
إليك CUCo. فكر في CUCo كمؤلف موسيقي ذكي للغاية ولا يكل، لا يكتفي فقط بكتابة الموسيقى، بل يتعلم كيف يكتب النص المثالي لهذه الأوركسترا المحددة، في هذا الملعب المحدد، ومع هذه الأجهزة اللاسلكية المحددة.
يعمل CUCo في مرحلتين متمايزتين، مثل طالب يتعلم القواعد أولاً ثم يتدرب ليصبح بارعًا (Virtuoso):
المرحلة الأولى: "المسار السريع" (الطالب الحريص على السلامة)
تخيل طالبًا قيل له: "اكتب نصًا يعمل، حتى لو لم يكن الأسرع".
- الهدف: الصحة والدقة.
- كيف يعمل: يكتب الذكاء الاصطناعي نصًا حيث يعزف الموسيقيون، ثم يتوقفون، ثم يمررون الملاحظات، ثم يعزفون مرة أخرى. قد يكون النص متعثرًا بعض الشيء، لكنه يضمن عدم حدوث أي تصادم أو انهيار للعرض. إنه ينشئ "أساسًا آمنًا".
- لماذا يهم: إذا حاولت الانتقال مباشرة إلى أكثر النصوص تعقيدًا وسرعة، فمن المرجح أن تواجه خطأ في بناء الجملة (Syntax Error) أو حالة "جمود" (Deadlock) حيث ينتظر الجميع شخصًا لن يتحدث أبدًا. تضمن هذه المرحلة أن يكون الأساس صلبًا.
المرحلة الثانية: "المسار البطيء" (البارع المتطور)
الآن، يأخذ الذكاء الاصطناعي ذلك النص "الآمن ولكن البطيء" ويبدأ تجربة تطورية.
- الهدف: السرعة والكفاءة.
- كيف يعمل: يقوم الذكاء الاصطناعي بإنشاء مئات النسخ المختلفة قليلاً من النص.
- النسخة أ: "لنمرر الملاحظات أثناء عزف النصف الأول من الأغنية".
- النسخة ب: "لنطلب من عازفي الكمان تمرير ملاحظات إلى المبنى المجاور أثناء عزف عازفي التشيلو".
- النسخة ج: "لنحاول طريقة مختلفة للإشارات".
- الاختبار: يتم تشغيل هذه النصوص على الأجهزة الفعلية.
- إذا تسبب نص في انهيار البرنامج؟ يتم إلقاؤه في السلة (لكن الذكاء الاصطناعي يتعلم لماذا تسبب في الانهيار لكي لا يكرر الخطأ).
- إذا كان النص بطيئًا؟ يحصل على درجة منخفضة.
- إذا كان النص سريعًا؟ يحصل على فرصة "للتزاوج" مع النصوص الجيدة الأخرى لصنع نصوص أفضل.
- النتيجة: بعد أجيال عديدة من عملية "البقاء للأصلح"، يصل الذكاء الاصطناعي إلى نص مضبوط بدقة لتلك الأجهزة والشبكة المحددة. إنه يجد حيلًا قد لا تخطر ببال المهندسين البشر، مثل إخفاء الوقت المستغرق في تمرير الملاحظات داخل الوقت المستغرق في عزف الموسيقى.
التشبيه السحري: سباق التتابع
- الطريقة القديمة: يركض العداء (GPU) لفة، ثم يتوقف عند الجدار، وينتظر المدرب (CPU) ليسلمه العصا، ثم يركض مرة أخرى.
- طريقة CUCo: يتم تسليم العصا للعداء بحيث يمكنه الإمساك بها بينما لا يزال يركض. هو لا يتوقف، بل يمرر العصا للعداء التالي في المسار المجاور بينما هو في حالة انطلاق كامل.
لماذا هذا مهم؟
تظهر الورقة البحثية أن CUCo يمكنه جعل مهام تدريب الذكاء الاصطناعي الموزعة أسرع بمقدار يصل إلى 1.57 مرة من أفضل الأكواد التي كتبها البشر.
- لا يتطلب تدريبًا: لا يحتاج الذكاء الاصطناعي لأن "يُعلّم" عبر آلاف الأمثلة؛ بل يستنتج الحل باستخدام قواعد الأجهزة.
- قابل للتكيف: إذا غيرت الملعب (وحدات GPU مختلفة) أو الأجهزة اللاسلكية (الشبكة)، فإن CUCo يعيد تعلم أفضل استراتيجية تلقائيًا.
- مفتوح المصدر: المبتكرون يقدمون هذا "المؤلف الموسيقي للذكاء الاصطناعي" للعالم لكي يتمكن الجميع من بناء أنظمة أسرع.
باختصار، CUCo هو نظام مؤتمت يأخذ المهمة المستحيلة والمملوءة بالأخطاء المتمثلة في كتابة أكواد فائقة السرعة ومعقدة لعناقيد الذكاء الاصطناعي، ويحولها إلى بحث تطوري منظم، ليجد حلولاً أسرع وأكثر كفاءة مما يمكن لأي إنسان كتابته يدويًا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.