LL-ViT: Edge Deployable Vision Transformers with Look Up Table Neurons
تقترح هذه الورقة البحثية LL-ViT، وهو نموذج "Vision Transformer" مُحسَّن للأجهزة الطرفية يدمج عصبونات جدول بحث (LUT) قابلة للتعلم داخل مِزاج القنوات (channel mixer) لتقليل أوزان النموذج وعمليات الضرب بشكل كبير، محققاً دقة عالية في المهام البصرية مع تقديم كفاءة طاقة فائقة وزمن استجابة أقل على مصفوفات البوابات المنطقية القابلة للبرمجة (FPGAs) مقارنة بالمسرعات الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً آلياً فائق الذكاء (Vision Transformer)، وهو بارع للغاية في النظر إلى الصور وإخبارك بما تحتويه. إنه يشبه ناقد الفنون العبقري. ومع ذلك، يعاني هذا العبقري من مشكلة ضخمة: فهو ثقيل جداً، ويستهلك الكثير من الكهرباء، وبطيء جداً لدرجة تمنعه من التواجد داخل جهاز صغير يعمل بالبطارية مثل طائرة بدون طيار (درون)، أو كاميرا ذكية، أو مكنسة روبوت. الأمر يشبه محاولة وضع مكتبة كاملة الحجم داخل حقيبة ظهر.
سأل الباحثون وراء هذه الورقة البحثية: "كيف يمكننا تقليص حجم هذا العبقري ليعيش داخل حقيبة ظهر دون أن يفقد ذكاءه؟"
إليك التبسيط البسيط لحلهم، LL-ViT:
1. المشكلة: قسم "المهام الشاقة"
في هذه النماذج من الذكاء الاصطناعي، هناك فريقان رئيسيان يقومان بالعمل:
- خلاط الرموز (The Token Mixer): ينظر هذا الفريق إلى أجزاء الصورة المختلفة ويفهم كيف ترتبط ببعضها البعض (مثل ملاحظة أن "العجلة" هي جزء من "السيارة").
- خلاط القنوات (The Channel Mixer): يأخذ هذا الفريق كل المعلومات التي جمعها ويقوم بتنقيحها، حيث يمزج "الألوان" و"الميزات" معاً لاتخاذ قرار نهائي.
اكتشف الباحثون أن خلاط القنوات هو الذي يقوم بالمهام الشاقة. فهو يقوم بنحو 60% من العمل الشاق (الحسابات) ويحتوي على 60% من الذاكرة (الأوزان). إنه الجزء من الدماغ الذي يستهلك أكبر قدر من البطارية ويشغل أكبر مساحة.
2. الطريقة القديمة مقابل الطريقة الجديدة
- الطريقة القديمة (الضرب): يعمل خلاط القنوات تقليدياً مثل الآلة الحاسبة. لمعالجة المعلومات، يقوم باستمرار بضرب الأرقام في بعضها البعض. وعلى شريحة الكمبيوتر، عملية الضرب تشبه طلب من عامل أن يحمل طوبة ثقيلة من جانب إلى آخر في الغرفة، مراراً وتكراراً. هذا الأمر بطيء ويستهلك الكثير من الطاقة.
- الطريقة الجديدة (جداول البحث - Look-Up Tables): استبدل الباحثون "الآلة الحاسبة" بـ جدول بحث (LUT). تخيل بدلاً من القيام بالرياضيات، يمتلك العامل ورقة غش مكتوبة مسبقاً.
- الطريقة القديمة: "كم هو 5 في 7؟ دعني أحسب..." (بطيء، ومجهد).
- الطريقة الجديدة: "أرى 5 و7. أنظر إلى ورقتي، والنتي--------ـة هي 35." (لحظي، ولا يتطلب أي مجهود).
في شرائح الكمبيوتر (تحديداً الـ FPGAs)، تُبنى "أوراق الغش" هذه مباشرة داخل الأجهزة. إنها صغيرة، سريعة، ولا تحتاج إلى حمل طوب ثقيل (عمليات الضرب) على الإطلاق.
3. الابتكار: تعليم ورقة الغش
كانت المحاولات السابقة لاستخدام "أوراق الغش" هذه (LUTs) تعاني من عيب: كانت تحاول فقط نسخ إجابات الآلة الحاسبة على الورقة بعد الانتهاء. كان الأمر يشبه محاولة كتابة الإجابات لاختبار رياضيات خضته بالفعل؛ لم يكن ذلك يعمل جيداً للمهام المعقدة مثل التعرف على الصور.
قام فريق LL-ViT بشيء مختلف. لقد علموا ورقة الغش كيف تتعلم أثناء تدريب النموذج.
- بدلاً من إجبار النموذج على القيام بالرياضيات ثم ترجمتها، تركوا النموذج يتعلم الأنماط مباشرة داخل ورقة الغش.
- فكر في الأمر كتعليم طالب حفظ الإجابات لمجموعة محددة من الألغاز مباشرة، بدلاً من تعليمه كيفية حل الألغاز باستخدام كتاب مدرسي ثقيل.
4. النتائج: عبقري أخف وزناً وأسرع
من خلال استبدال الجزء "الحاسوبي" الثقيل في الذكاء الاصطناعي بهذه "الأوراق المرجعية" الخفيفة، حققوا بعض النتائج المثيرة للإعجاب:
- حجم أصغر: أصبح النموذج أصغر بنسبة 60%. إنه يشبه تقليص حقيبة سفر لتصبح بحجم حقيبة ظهر.
- طاقة أقل: يستخدم نصف الطاقة للجزء الحسابي. الروبوت لا يتعب بسرعة كما كان يحدث.
- أسرع: يعمل بسرعة أكبر بنحو 1.3 مرة وهو أكثر كفاءة في استهلاك الطاقة بمقدار 1.9 مرة مقارنة بالمحاولات السابقة.
- لا يزال ذكياً: رغم كونه أصغر وأسرع، إلا أنه حصل على درجات اختبار قريبة جداً من النسخة الضخمة والثقيلة. في اختبارات الصور القياسية (مثل تحديد القطط، الكلاب، أو السيارات)، حقق دقة بنسبة 95.5%، وهي دقة مطابقة تقريباً للأصل.
الخلاصة
تقدم هذه الورقة البحثية LL-ViT، وهو تصميم جديد يجعل الذكاء الاصطناعي القوي للتعرف على الصور صغيراً بما يكفي ليعمل على الأجهزة الطرفية (مثل FPGAs) دون الحاجة إلى مصدر طاقة ضخم أو ذاكرة هائلة. لقد فعلوا ذلك عن طريق استبدال الجزء الأكثر استهلاكاً للطاقة في الذكاء الاصطناعي بنظام "ورقة غش" ذكي وقابل للتعلم، مما أثبت أنه يمكنك الحصول على ذكاء اصطناعي خفيف الوزن وصديق للبطارية، ومع ذلك يظل ذكياً للغاية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.