Accelerating Vision Transformers on Brain Processing Unit
تقترح هذه الورقة طريقة مبتكرة لتسريع نماذج "Vision Transformers" على وحدات معالجة الدماغ (BPUs) المُحسّنة للشبكات العصبية الالتفافية (CNN)، وذلك عن طريق إعادة هيكلة النموذج لاستبدال الطبقات الخطية بمعاملات التفافية، مما يتيح توريث الأوزان دون الحاجة لإعادة التدريب مع تحقيق تسريع كبير في الاستنتاج مع فقدان ضئيل في الدقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك عامل مصنع فائق الكفاءة ومتخصص يسمى BPU (وحدة معالجة الدماغ). هذا العامل هو خبير في تجميع مكعبات ليغو رباعية الأبعاد (التي تمثل بيانات الصور القياسية مثل الارتفاع، العرض، قنوات الألوان، والدفعات). في عالم الذكاء الاصطناعي، يعتبر هذا العامل هو الخبير المعتمد لبناء الشبكات العصبية التلافيفية (CNNs) (وهي "بناء الطوب" التقليدي في رؤية الحاسوب).
ومع ذلك، فقد وصل مهندس معماري ثوري جديد من نوع مختلف وهو محول الرؤية (Vision Transformer - ViT). بدلاً من البناء باستخدام مكعبات الليغو رباعية الأبعاد، يعمل الـ ViT باستخدام رزم من الورق ثلاثية الأبعاد (تسلسلات من البيانات). إنه ذكي للغاية وغالبًا ما يحقق نتائج أفضل، لكنه يتحدث لغة مختلفة. عندما تحاول توظيف عامل مصنع الـ BPU لبناء ViT، يصاب العامل بالارتباك؛ فهو مصمم لتكديس المكعبات، وليس لفرز رزم الورق. ونتيجة لذلك، يضطر بناء الـ ViT إلى أن يتم بواسطة عامل عام الأغراض وأبطأ بكثير (الـ CPU)، مما يترك الـ BPU الخارق فائق السرعة في حالة خمول.
حل الورق: خدعة "تغيير الشكل"
ابتكر مؤلفا هذه الورقة البحثية، جينتشي تانج ويان غوو، حلاً ذكياً للالتفاف على هذه المشكلة. لم يحاولوا تعليم الـ BPU كيفية قراءة رزم الورق (لأن ذلك سيكون صعباً ويتطلب إعادة تدريب النظام بأكمله)، بل قاموا بإعادة تشكيل رزم الورق لتبدو مثل مكعبات الليغو.
إليك كيف فعلوا ذلك، باستخدام تشبيهات بسيطة:
مشكلة الطبقة الخطية (Linear Layer): في نموذج ViT القياسي، يستخدم "الدماغ" طبقات خطية لمعالجة المعلومات. فكر في هذه الطبقات كأنها مترجم يقرأ قائمة من الكلمات ويخرج قائمة جديدة. الـ BPU لا يستطيع قراءة القوائم؛ هو يفهم فقط الشبكات رباعية الأبعاد.
- الحل: أخذ المؤلفون هذا "المترجم" وأعادوا تشكيل تعليماته لتبدو مثل مكعب ليغو 1×1. رياضياً، يقوم بنفس الوظيفة تماماً، لكنه الآن يتناسب تماماً مع مصنع الـ BPU. الأمر يشبه أخذ خريطة مسطحة ولفها على شكل أسطوانة فقط لكي تتناسب مع أنبوب معين، دون تغيير محتوى الخريطة.
مشكلة تسوية الطبقة (Layer Normalization): يستخدم الـ ViT أيضاً خطوة تسمى "تسوية الطبقة" للحفاظ على توازن بياناته (مثل منظم الحرارة "الثرموستات" الذي يحافظ على درجة حرارة الغرفة). الـ BPU لا يحتوي على منظم حرارة مدمج.
- الحل: قام المؤلفون ببناء "منظم حرارة" باستخدام مكعبات الليغو الموجودة لدى الـ BPU. لقد أنشأوا سلسلة خاصة من المكعبات الصغيرة (تلافيف 1×1) تقوم بحساب المتوسط والتباين، مما يحاكي فعلياً عمل منظم الحرارة باستخدام الأدوات التي يمتلكها الـ BPU بالفعل.
سحر "عدم إعادة التدريب"
عادةً، إذا قمت بتغيير مخطط بناء، عليك هدمه وإعادة بنائه من الصفر. ولكن لأن المؤلفين كانوا حذرين للغاية في جعل "مكعبات الليغو" الخاصة بهم متطابقة رياضياً مع "رزم الورق" الأصلية، فإن المخططات الأصلية (الأوزان) لا تزال تعمل بشكل مثالي.
لم يحتاجوا إلى إعادة تدريب النموذج أو تعليمه أشياء جديدة. لقد قاموا ببساطة بأخذ نموذج "DeiT" الجاهز (وهو نسخة فعالة من ViT)، وطبقوا خدعة تغيير الشكل الخاصة بهم، ثم سلموه إلى الـ BPU. تعرف الـ BPU فوراً على التنسيق الجديد وبدأ العمل بكامل سرعته.
النتائج: السرعة مقابل الدقة
اختبر الفريق نموذجهم في مهمتين مختلفتين: التعرف على آلاف الأشياء (ImageNet) وفرز الزهور.
- المقايضة: عندما تقوم بتحويل نموذج ليعمل على هذا العتاد المتخصص، فإنك تخسر عادةً جزءاً ضئيلاً من الدقة (مثل الانتقال من صورة عالية الدقة إلى صورة JPEG مضغوطة قليلاً).
- في اختبار ImageNet الكبير، انخفضت دقة نموذج DeiT-Base بنسبة 1.4% فقط (من 81.8% إلى 80.4%).
- في اختبار الزهور، كان الانخفاض أقل حتى، حيث بلغ 0.5% فقط.
- العائد: في مقابل هذا الانخفاض الضئيل في الدقة، أصبح النموذج أسرع بكثير.
- النموذج الأكبر (DeiT-Base) كان أسرع بمقدار 3.8 مرة على الـ BPU مقارنة بـ CPU القياسي.
- كما شهدت النماذج الأصغر تحسناً في السرعة، تراوح بين 1.3 إلى 2.1 ضعف.
اكتشاف مضحك
أثناء اختبارهم، لاحظ المؤلفون شيئاً مثيراً للاهتمام. في بعض الأحيان، كانت الملصقات الرسمية على صور الاختبار خاطئة (على سبيل المثال، صورة "أسد" وُصفت بأنها "قرد"). نموذج DeiT الأصلي حدد الأسد بشكل صحيح، لكن النظام اعتبره خطأ بسبب الملصق السيئ. ونموذج المؤلفين الجديد السريع حدد الأسد بشكل صحيح أيضاً. هذا يشير إلى أن النموذج في الواقع أكثر ذكاءً مما تشير إليه الدرجات الرسمية، لأنه يستطيع الرؤية من خلال "الأخطاء المطبعية" في بيانات الاختبار.
باخت تختصار
هذه الورقة هي المرة الأولى التي ينجح فيها شخص ما في أخذ "محول الرؤية" (مهندس رزم الورق) وجعله يعمل على "وحدة معالجة دماغ" متخصصة (مصنع الليغو) دون الحاجة لإعادة بناء المهندس من الصفر. ومن خلال إعادة تشكيل الرياضيات بذكاء لتناسب العتاد، حققوا زيادة في السرعة قدرها 3.8 ضعف مع فقدان ضئيل جداً في الذكاء، مما يثبت أن هذه النماذج المتقدمة من الذكاء الاصطناعي يمكنها أخيراً العمل بكفاءة على الرقائق المتخصصة والمدمجة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.