← أحدث الأبحاث
⚡ electrical engineering

Scaling Vision Transformers: Evaluating DeepSpeed for Image-Centric Workloads

تقيم هذه الدراسة فعالية إطار التدريب الموزع DeepSpeed لتوسيع نطاق نماذج Vision Transformers عبر تكوينات مختلفة من وحدات معالجة الرسومات ومجموعات البيانات، مع تحليل كيفية تأثير معلمات مثل حجم الدفعة وتراكم التدرج على سرعة التدريب، وحمل الاتصال الإضافي، وقابلية التوسع، لإرساء أساس لتحسين أعباء العمل المتمحورة حول الصور.

المؤلفون الأصليون: Huy Trinh, Rebecca Ma, Zeqi Yu, Tahsin Reza

نُشر 2026-02-25
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Huy Trinh, Rebecca Ma, Zeqi Yu, Tahsin Reza

البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت عملاق وذكي للغاية التعرف على القطط والكلاب والسيارات في الصور. هذا الروبوت يسمى Vision Transformer (ViT). إنه قوي للغاية لأنه، على عكس الروبوتات القديمة التي كانت تنظر إلى الصور قطعة قطعة (مثل قطع الأحجية)، فإن هذا الروبوت ينظر إلى الصورة بأكملة ليفهم كيف يتصل كل شيء ببعضه البعض.

ومع ذلك، هناك مشكلة: هذا الروبوت شره. فهو يلتهم كمية هائلة من ذاكرة الكمبيوتر ويستغหวرق وقتاً طويلاً للتعلم، خاصة عندما تعرض عليه ملايين الصور.

هذه الورقة البحثية تتحدث عن فريق من الباحثين يحاولون حل هذه المشكلة. لقد تساءلوا: "هل يمكننا استخدام أداة تسمى DeepSpeed — والتي صُممت في الأصل لتدريب روبوتات اللغة العملاقة (مثل تلك التي تكتب القصص) — لمساعدة روبوت التعرف على الصور الخاص بنا ليتعلم بشكل أسرع؟"

إليك تفاصيل رحلتهم، مشروحة باستخدام تشبيهات من الحياة اليومية.

1. المشكلة: عقل واحد مقابل فريق

تخيل أنك تحاول رسم جدارية ضخمة.

  • الطريقة القدة (GPU واحدة): يحاول فنان واحد رسم الجدارية بأكملها بمفرده. يستغرق الأمر وقتاً طويلاً جداً، وينفد منه الطلاء (الذاكرة) قبل أن ينتهي.
  • الطريـقة الجديدة (التدريب الموزع): تقوم بتعيين فريق من الفنانين. تعطي كل فنان جزءاً من الجدار ليرسمه.
  • العقبة: في كل مرة ينهي فيها الفنان جزءاً صغيراً، يتعين عليه الركض إلى منتصف الغرفة لمقارنة الملاحظات مع الجميع للتأكد من تطابق الألوان. إذا اضطروا للتوقف والتحدث كثيراً، فسوف يضيع الوقت. يُسمى وقت "التحدث" هذا "عبء الاتصال" (communication overhead).

2. الأداة: DeepSpeed

DeepSpeed يشبه مدير مشروع فائق الكفاءة لهذا الفريق من الفنانين. كان مشهوراً بإدارة فرق الكتاب (نماذج اللغة)، لكن الباحثين أرادوا معرفة ما إذا كان بإمكانه إدارة فريق من الرسامين (Vision Transformers) بنفس الكفاءة.

3. التجارب: اختبار سيناريوهات مختلفة

قام الباحثون بإعداد ثلاث "ورش عمل" (مجموعات حوسبة) مختلفة لاختبار نظريتهم:

  • ورشة العمل أ (Nebula): كانت تحتوي على حواسيب قوية. اختبروا "أحجام دفعات" (batch sizes) مختلفة.

    • تشبيه: تخيل إعطاء الفنانين كومة من 16 صورة ليرسموها قبل أن يتوقفوا للتحدث، مقابل كومة من 256 صورة.
    • النتيجة: إذا كانت الكومة صغيرة جداً (16 صورة)، يقضي الفنانون وقتاً في الركض إلى المنتصف للتحدث أكثر من الوقت الذي يقضونه في الرسم الفعلي. وإذا كانت الكومة ضخمة جداً (256 صورة)، فإن الفنانين يصابون بالإرهاق من حمل الكومة.
    • النقطة المثالية: وجدوا أن كومة مكونة من 64 أو 128 صورة هي التوازن المثالي. لقد قللت من وقت "الركض ذهاباً وإياباً" مع الحفاظ على كفاءة الفنانين.
  • ورشة العمل ب (Tesla): كانت تحتوي على مزيج من الحواسيب القوية والضعيفة.

    • تشبيه: تخيل فريقاً حيث يوجد ثلاثة فنانين محترفين يستخدمون فرشاة سريعة، لكن اثنين يستخدمان فرشاة قديمة وبطيئة.
    • النتيجة: كان هذا كارثياً. كان الفنانون السريعون يضطرون لانتظار البطئين ليلحقوا بهم قبل أن يتمكنوا من مقارنة الملاحظات. تباطأ الفريق بأكمله ليصبح بسرعة أبطأ شخص فيه. علمهم هذا أن الجميع يحتاج إلى امتلاك نفس المعدات ليعمل الفريق بشكل جيد.
  • ورشة العمل ج (Vector): ورشة عمل ضخمة تحتوي على العديد من الحواسيب، وكلها متطابقة.

    • تشبيه: أرض مصنع ضخمة بها 32 فريقاً متطابقاً.
    • النتيجة: عمل هذا بشكل رائع! مع إضافة المزيد من الفرق، تم إنجاز الرسم بشكل أسرع. سواء أضفت المزيد من الفرق إلى نفس الغرفة (intra-node) أو نشرتهم عبر مبانٍ مختلفة (inter-node)، فقد توسع النظام بسلاسة.

4. النتائج الرئيسية

تعلم الباحثون ثلاثة أشياء رئيسية:

  1. لا تتحدث كثيراً: إذا قسمت العمل إلى أجزاء صغيرة جداً، فستقضي الحواسيب وقتاً في "التحدث" (إرسال البيانات) أكثر من "العمل". أنت بحاجة لإعطائهم قطعاً أكبر من العمل (أحجام دفعات أكبر) لجعل الرحلة تستحق العناء.
  2. التوحيد مهم: إذا كان فريقك يحتوي على مزيج من الحواسيب الفائقة وأجهزة اللابتوب القديمة، فإن أجهزة اللابتوب القديمة ستجر الجميع للأسفل. أنت بحاجة إلى أجهزة متطابقة.
  3. إنه يعمل للصور أيضاً: DeepSpeed، الذي صُمم للنصوص، هو في الواقع ملائم جداً للصور. يمكنه المساعدة في تدريب روبوتات الصور الضخمة هذه بشكل أسرع من ذي قبل.

5. ما الخطوة التالية؟

الباحثون متحمسون لكنهم يعلمون أن هذه مجرد بداية.

  • المستقبل: يريدون تجربة صور أكبر (مثل المسحات الطبية أو صور الأقمار الصناعية) ومعرفة ما إذا كان بإمكانهم تقسيم العمل بشكل أكبر.
  • الهدف: جعل من الممكن تدريب روبوتات الصور فائقة الذكاء هذه على مجموعات بيانات ضخمة دون الحاجة إلى حاسوب فائق بحجم مدينة.

باخت-صار: لقد أخذوا أداة صُممت للنصوص، وطبقوها على الصور، وعثروا على إعدادات "غولدي لوكس" (ليست صغيرة جداً ولا كبيرة جداً) لجعل تدريب نماذج الذكاء الاصطناوية الضخمة للصور أسرع وأرخص. لقد أثبتوا أنه مع الإدارة الصحيحة للفريق (DeepSpeed) والمعدات المناسبة، يمكننا تعليم هذه الروبوتات رؤية العالم بشكل أسرع بكثير.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →