Elastic ViTs from Pretrained Models without Retraining
تقدم هذه الورقة SnapViT، وهو أسلوب تقليم هيكلي لما بعد ما قبل التدريب ولا يتطلب إعادة تدريب، يستفيد من معلومات التدرج وخوارزمية تطورية لتقريب الارتباطات عبر الشبكات، مما يمكّن نماذج "Vision Transformers" المدربة مسبقاً من تحقيق استدلال مرن عبر نطاق مستمر من ميزانيات الحوسبة دون الحاجة إلى بيانات مصنفة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مكتبة ضخمة وذكية للغاية (محول رؤية أو ما يعرف بـ Vision Transformer أو "ViT") تعرف كيف تتعرف على أي شيء تقريبًا في الصورة. هذه المكتبة ضخمة جدًا لدرجة أنها تشغل مبنى كاملًا وتتطلب مولدًا كهربائيًا عملاقًا ومكلفًا لتشغيلها.
المشكلة هي أن معظم الأجهزة في العالم الحقيقي (مثل هاتفك، أو طائرة بدون طيار، أو كاميرا ذكية) صغيرة ولديها بطارية محدودة. لا يمكنها استيعاب المكتبة بأكملة، ولا يمكنها تحمل تكلفة الكهرباء لتشغيلها.
عادةً، إذا أردت مكتبة أصغر، سيتعين عليك بناء مكتبة جديدة وأصغر من الصفر. لكن مؤلفي هذا البحث، SnapViT، يقولون: "لماذا نبني واحدة جديدة؟ لنأخذ المكتبة الكبيرة ونقلصها فورًا لتناسب أي حجم تحتاجه، دون أن نفقد ذكاءها".
إليك كيف فعلوا ذلك، مشروحًا ببساًطة:
1. المشكلة: مقاس واحد لا يناسب الجميع
فكر في نماذج الذكاء الاصطناعي هذه مثل مجموعة من دمى "الماتريوشكا" الروسية (الدمى المتداخلة). عادةً، لا تحصل إلا على أحجام محددة: صغير، متوسط، وكبير. إذا كان جهازك يحتاج إلى شيء أصغر قليلاً من "المتوسط" ولكنه أكبر من "الصغير"، فأنت في ورطة. فإما أن تستخدم النموذج الضخم والبطيء، أو النموذج الصغير والغبي.
2. الحل: "التقليص" (Snap) لأي حجم
ابتكر المؤلفون طريقة تسمى SnapViT. إنها تشبه امتلاك مقص سحري يمكنه قص المكتبة الكبيرة إلى أي حجم تريده (أصغر بنسبة 10%، أو أصغر بنسبة 50%، إل إلخ) في "نقرة" واحدة.
- لا إعادة تدريب: عادةً، إذا قطعت قطعة من آلة ما، فإنها تتوقف عن العمل وتحتاج إلى إصلاح (إعادة تدريب) لساعات أو أيام. أما SnapViT فيقص النموذج ويجعله يعمل فورًا. لا حاجة للإصلاح.
- لا حاجة لبيانات مصنفة: معظم الطرق تحتاج إلى "معلم" ليخبرهم بما هو مهم (مثل إظهار آلاف الصور للقطط والكلاب للذكاء الاصطناعي). أما SnapViT فهو يتعلم ذاتيًا؛ فهو يكتشف ما يجب الاحتفاظ به بمجرد النظر إلى الأنماط في البيانات نفسها.
3. كيف يعمل: "المقص الذكي"
لمعرفة أي أجزاء من الذكاء الاصطناي يجب قصها وأيها يجب الاحتفاظ بها، يستخدم المؤلفون نظام تسجيل من خطوتين:
الخطوة 1: الفحص المحلي (اختبار "الألم")
تخيل أنك تضرب الذكاء الاصطناعي بعصا. إذا جعل وخز جزء معين الذكاء الاصطناعي يتعثر، فهذا الجزء مهم. إذا لم يتفاعل، فهذا الجزء على الأرجح غير مفيد. يستخدمون خدعة "التعلم الذاتي" (النظر إلى نفس الصورة من زوايا مختلفة) لمعرفة أي أجزاء من "الدماغ" حساسة. هذا يعطيهم قائمة أساسية لما يمكن قصه.الخطوة 2: الفحص العالمي (اختبار "العمل الجماعي")
هذا هو الجزء الذكي. أحيانًا، قد يبدو جزء ما غير مفيد بمفرده، لكنه في الواقع عضو حاسم في فريق مع جزء آخر. إذا قطعت أحدهما، سيصاب الآخر بالارتباك. لإيجاد هذه الفرق الخفية، يستخدمون خوارزمية جينية (فكر فيها كمحاكي تطور رقمي). بدلاً من حساب كل اتصال منفرد (والذي سيستغرق وقتاً طويلاً جداً)، يقومون بمحاكاة "ماذا لو قطعنا هذا؟" و"ماذا لو قطعنا ذاك؟" آلاف المرات في دقائق معدودة. إنهم يطورون خريطة لكيفية اعتماد أجزاء الذكاء الاصطناعي على بعضها البعض.
4. النتيجة: الاستدلال المرن
بمجرد حصولهم على هذه الخريطة، يمكنهم إنشاء نماذج "مستمرة".
- هل تحتاج إلى نموذج لطائرة بدون طيار فائقة السرعة؟ يمنحك SnapViT نسخة صغيرة جدًا.
- هل تحتاج إلى نموذج لخادم (Server) قوي؟ يمنحك SnapViT نسخة أكبر.
- هل تحتاج إلى شيء بينهما؟ يمنحك SnapViT ذلك أيضًا.
لقد اختبروا ذلك على عدة نماذج شهيرة (مثل DINO و SigLIPv2). ووجدوا أنه يمكنهم قص النموذج بنسبة 40% (مما يجعله أصغر بنسبة النصف تقريبًا) ومع ذلك لا يزال يعمل بكفاءة تقارب الأصل، مع فقدان ضئيل جدًا في الدقة.
5. لماذا هو سريع؟
يزعم المؤلفون أن بإمكانهم القيام بهذه العملية بأكملها في أقل من خمس دقائق على شريحة كمبيوتر واحدة قوية (A100 GPU). هذا سريع للغاية مقارنة بالطرق الأخرى التي قد تستغرق أيامًا.
ملخص التشبيه
تخيل أن لديك دليل تعليمات ضخمًا مكونًا من 100 صفحة لبناء منزل.
- الطريقة القديمة: إذا لم يكن لديك وقت إلا لقراءة 50 صفحة، فعليك إعادة كتابة الدليل بأكمله من الصفر لتجعل منه نسخة من 50 صفحة لا تزال منطقية.
- طريقة SnapViT: تقوم فورًا بتحديد الـ 50 صفحة الأكثر أهمية، ثم تمزق الباقي. الصفحات الـ 50 المتبقية لا تزال تخبرك بالضبط كيف تبني المنزل بشكل مثالي، وقد فعلت ذلك في خمس دقائق دون الحاجة إلى مهندس معماري جديد.
تسمح هذه الطريقة لأي شخص بأخذ ذكاء اصطناعي ضخم وقوي وتقليصه فورًا ليناسب احتياجاته الخاصة، مما يوفر الوقت والمال والطاقة، دون الحاجة إلى إعادة تدريب الذكاء الاصطناعي أو الحاجة إلى معلم ليرشده.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.