FTerViT: Fully Ternary Vision Transformer
تقدم هذه الورقة FTerViT، وهو نموذج Vision Transformer ثلاثي القيم بالكامل (fully ternarized) يقوم بتكميم جميع الأوزان ومعلمات التقييس (normalization parameters) لتحقيق ضغط كبير في الذاكرة وتمكين النشر الفعال على الأجهزة في المتحكمات الدقيقة مع الحفاظ على دقة تنافسية في مجموعة بيانات ImageNet-1K.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك أمين مكتبة عبقرياً ومثقفاً للغاية (Vision Transformer أو ViT) يمكنه النظر إلى صورة وإخبارك بدقة ما هي. هذا الأمين ذكي للغاية، لكنه يحمل مكتبة ضخمة من الكتب في رأسه. إذا حاولت وضع هذا الأمين في حقيبة ظهر صغيرة (مثل المتحكم الدقيق - Microcontroller الموجود في ساعة ذكية أو كاميرا رخيصة)، فإن الحقيبة ستتمزق لأن الكتب ثقيلة جداً وتأخذ مساحة كبيرة.
عادةً، لكي يتمكن المهندسون من وضع ذكاء اصطناعي متطور داخل جهاز صغير، يحاولون تقليص حجم الكتب. قد يقومون بتحويل النص إلى رمز أقصر، لكنهم غالباً ما يتركون الصفحات الأكثر أهمية ودقة (مثل الغلاف، والفهرس، والملخص النهائي) بتنسيقها الأصلي الضخم. تجادل الورقة البحثية بأن هذا يشبه محاولة وضع موسوعة ثقيلة في جيب عبر تقليص الفصول الوسطى فقط؛ فالغلاف والفهرس لا يزالان ثقيلين جداً.
إليك ما فعله مؤلفو FTerViT لحل هذه المشكلة:
1. قاموس "الألوان الثلاثة"
بدلاً من استخدام أرقام معقدة (مثل 3.14159...) لتخزين المعلومات، أجبر المؤلفون الذكاء الاصطناوي على استخدام ثلاث رموز بسيطة فقط: -1، و0، و+1.
- فكر في الأمر كقاموس حيث يتم استبدال كل كلمة بنقطة حمراء أو خضراء أو زرقاء.
- من خلال استخدام هذه الخيارات الثلاثة فقط، يمكنهم حزم المعلومات بإحكام شديد. الأمر يشبه طي خريطة عملاقة لتصبح مربعاً صغيراً.
- هم يسمون هذا Ternary (أي "ثلاثي").
2. الأجزاء "الهشة"
المحاولات السابقة لتقليص هذه النماذج من الذكاء الاصطناعي توقفت عند حد معين. لقد قاموا بتقليص "الدماغ الرئيسي" (المُشفّر - Encoder)، لكنهم تركوا "تضمين الرقعة" (Patch Embedding - كيف يرى الذكاء الاصطناعي اللمحة الأولى للصورة)، و"تطبيع الطبقة" (LayerNorm - كيف يوازن الذكاء الاصطناعي أفكاره)، و"المصنف" (Classifier - صانع القرار النهائي) بتنسيقها الأصلي الثقيل.
- أدرك المؤلفون أنه في الجهاز الصغير، هذه الأجزاء "المتبقية" الثقيلة هي التي تشغل أكبر مساحة، رغم أنها قليلة العدد.
- يعد FTerViT أول نموذج يقوم بتقليص كل شيء، بما في ذلك هذه الأجزاء الهشة، إلى التنسيق البسيط (-1، 0، +1).
3. خدعة "المعلم والتلميذ"
تقليص دماغ عملاق إلى دماغ صغير يؤدي عادةً إلى جعله ينسى كيفية التفكير، مما يتسبب في ارتكاب أخطاء سخيفة. ولإصلاح ذلك، استخدم المؤلفون تقنية تسمى Knowledge Distillation (تقطير المعرفة).
- تخيل رئيس طهاة (الذكاء الاصطناعي الأصلي الثقيل) يعلم طباخاً مبتدئاً (الذكاء الاصطناعي الصغير المتقلص).
- بدلاً من مجرد إخبار الطباخ المبتدئ "هذه قطة"، يوضح له رئيس الطهاة كيف يرى هذه القطة: "انظر إلى الأذنين، والشاربين، وشكل الجسم".
- يتعلم الطباخ المبتدئ من خلال تقليد طريقة تفكير "الرئيس"، وليس مجرد الإجابة النهائية. سمح هذا للذكاء الاصطناعي الصغير بالبقاء ذكياً حتى بعد تقليصه إلى أصغر حجم ممكن.
4. النتيجة: ذكاء اصطناعي ذكي في كاميرا بـ 10 دولارات
اختبر المؤلفون هذا على شريحة متحكم دقيق شائعة ورخيصة جداً تسمى ESP32-S3 (الموجودة في الأجهزة التي تكلف حوالي 10 دولارات).
- قبل: كان الذكاء الاصطناعي الأصلي بحجم 88.3 ميجابايت. كان كبيراً جداً بحيث لا يمكنه حتى الاستقرار على الشريحة.
- بعد: نموذج FTerViT الجديد الخاص بهم يبلغ حجمه 5.81 ميجابايت فقط. إنه يناسب الشريحة تماماً.
- الأداء: على الرغم من صغر حجمه، إلا أنه لا يزال ذكياً جداً. فهو يحدد الصور بشكل صحيح بنسبة تقارب 79.6% من المرات. وهذا أفضل بكثير من المحاولات السابقة للتقليص، والتي كانت تنخفض غالباً إلى 74% أو أقل.
5. لماذا يهمك الأمر في جيبك؟
تظهر الورقة البحثية أنك لست بحاجة إلى كمبيوتر خارق لتشغيل رؤية ذكية. يمكنك تشغيلها على جهاز بذاكرة 8 ميجابايت (حوالي حجم ملف نصي صغير).
- السرعة: نظرًا لأن البيانات صغيرة جدًا، لا يحتاج الجهاز إلى العمل بجهد كبير لجلب المعلومات. لذا فهو يعمل بشكل أسرع ويستهلك بطارية أقل.
- الكفاءة: قام المؤلفون ببناء "محرك" مخصص (برمجيات) يشغل هذا الذكاء الاصطناعي الصغير بالكامل على الشريحة، دون الحاجة إلى الاتصال بالإنترنت أو بخادم سحابي.
باختة القول: تقدم الورقة طريقة لتقليص أكثر نماذج الذكاء الاصطناعي تقدماً في رؤية الصور إلى حجم حصاة صغيرة، مما يسمح لها بالعمل على أجهزة رخيصة تعمل بالبطارية، والتي كانت ضعيفة سابقاً عن التعامل معها. لقد فعلوا ذلك عن طريق تبسيط الرياضيات لتقتصر على ثلاثة أرقام فقط واستخدام "معلم" لتعليم النموذج الصغير كيفية التفكير بشكل صحيح.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.