Joint Post-Training Quantization of Vision Transformers with Learned Prompt-Guided Data Generation
تقدم هذه الورقة إطار عمل جديد للكمية المشتركة في مرحلة ما بعد التدريب لنماذج محولات الرؤية (Vision Transformers) يحقق دقة عالية في عدد البتات المنخفضة تضاهي أحدث ما توصل إليه العلم دون الحاجة إلى بيانات مصنفة، وذلك عبر الجمع بين تحسين النموذج الكامل واستراتيجية معايرة خالية من البيانات باستخدام نموذج "Stable Diffusion Turbo" بتوجيه من مطالبات متعددة الأنماط متعلمة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك طباخاً عبقرياً، عالماً ومثقفاً للغاية (وهو محول الرؤية - Vision Transformer) يمكنه التعرف على أي جسم في صورة بدقة مذهلة. ومع ذلك، فإن هذا الطباخ عملاق؛ فهو يحتاج إلى مطبخ ضخم، ومكونات باهษة الثمن، وفريق كبير من المساعدين. أنت تريد وضع هذا الطباخ في شاحنة طعام صغيرة (مثل جهاز طرفي - edge device كالهاتف أو الطائرة بدون طيار) حيث المساحة والطاقة محدودة.
لجعل هذا الأمر ممكناً، تحتاج إلى تقليص معرفة الطباخ لتناسب حقيبة ظهر دون أن يفقد قدرته على طهي وجبات رائعة. تسمى هذه العملية التكميم (Quantization).
إليك كيف تحل هذه الورقة البحثية مشكلة تقليص حجم الطباخ، باستخدام حيلتين رئيسيتين:
1. استراتيجية "العناق الجماعي" (التحسين المشترك)
المشكلة:
حاولت الطرق السابقة تقليص معرفة الطباخ كتلة تلو الأخرى. تخيل أنك تحاول تقليص آلة معقدة عن طريق تفكيكها، وإصلاح ترس واحد، ثم إعادة تركيبه، ثم إصلاح الترس التالي. المشكلة هي أنه في نماذج "محولات الرؤية"، تكون جميع التروس متصلة ببعضها البعض بإحكام. إصلاح ترس واحد بمعزل عن غيره غالباً ما يؤدي إلى كسر الاتصال بالترس التالي، مما يتسبب في تعطل الآلة بأكملها.
الحل:
بدلاً من إصلاح التروس واحداً تلو الآخر، تقترح هذه الورقة النظر إلى الآلة بأكملها في وقت واحد.
- التشبيه: تخيل جوقة غنائية (كورال). إذا أخبرت قسم "السوبرانو" بأن يغني بصوت أعلى، فقد يحتاج قسم "الباص" إلى الغناء بصوت أخفض للحفاظ على التناغم. الطرق القديمة كانت تطلب من كل قسم التعديل بمفرده. أما هذه الطريقة الجديدة فتخبر الجوقة بأكملها أن تتعدل معاً في الوقت الفعلي.
- النتيجة: من خلال تحسين جميع الطبقات في وقت واحد، يتعلم النموذج كيفية تعويض الأخطاء في جزء ما عن طريق تعديل جزء آخر. إنه يشبه الرقصة حيث يتحرك الجميع في تزامن، مما يضمن بقاء الأداء النهائي (التعرف على الصورة) مثالياً حتى عندما يتم خفض "مستوى الصوت" (الدقة) بشكل كبير.
2. "مولد الفن السحري" (المعايرة الخالية من البيانات)
المشكلة:
لتقليص حجم الطباخ، تحتاج عادةً إلى إظهار آلاف الصور الحقيقية له (مثل 10,000 صورة لقطط) للتدريب. ولكن ماذا لو لم تكن تملك تلك الصور؟ ربما تكون خاصة، أو ليس لديك القدرة على الوصول إليها فحسب.
- الطريقة القديمة: قد تحاول وصف قطة لمولد صور ذكاء اصطناعي باستخدام أمر بسيط مثل "صورة لقطة". قد يعطيك الذكاء الاصطناعي 100 صورة لنفس القط البرتقالي تماماً وهو يجلس في نفس المكان. هذا أمر ممل ولا يعلم الطباخ كيف يتعرف على قطة سوداء تركض تحت المطر.
- حيلة الورقة البحثية: هم يعلمون مولد صور الذكاء الاصطناعي تعلم "شخصيات" متعددة لكل جسم.
- بدلاً من مجرد أمر واحد، يتعلمون 20 "صوتاً" مختلفاً لكلمة "طائرة ورقية". صوت واحد يتخيل الطائرة الورقية كطائر، وآخر كلعبة، وآخر كشكل ملون في مهب الريح.
- التشبيه: تخيل أنك تدرب حارس أمن. بدلاً من إظهار 1,000 صورة لنفس المشتبه به في نفس المعطف، تظهر له صوراً للمشتبه به بمعطف واقٍ من المطر، وبدلة، وقبعة، وهو يركض بعيداً. أنت تعلم الحارس التعرف على "جوهر" المشتبه به، وليس فقط مظهراً محدداً له.
- كيف يعمل الأمر: يستخدم النظام ذكاءً اصطناعياً قوياً (Stable Diffusion) لتوليد هذه الصور المتنوعة تلقائياً. ويتحقق النظام مما إذا كانت الصور تبدو كالجسم الصحيح ويضمن أنها تبدو مختلفة عن بعضها البعض.
النتائج: حجم صغير جداً، وذكاء فائق
من خلال الجمع بين "العناق الجماعي" (التحسين المشترك) و"مولد الفن السحري" (البيانات الاصطناعية المتنوعة)، حقق المؤلفون شيئاً مذهلاً:
- حجم ضئيل: قاموا بضغط النماذج إلى عدد بتات منخفض للغاية (W1.58A8). فكر في هذا كضغط فيلم عالي الدقة إلى ملف نصي صغير جداً، ومع ذلك يعمل بشكل مثالي. هذه هي المرة الأولى التي يتم فيها القيام بذلك بنجاح لمحولات الرؤية دون الحاجة إلى بيانات حقيقية.
- السرعة: عملية التقليص بأكملها تستغرق حوالي ساعة واحدة على شريحة كمبيوتر واحدة.
- لا حاجة لبيانات حقيقية: لقد أثبتوا أنه يمكنك تدريب النظام باستخدام الصور "السحرية" المولدة بالذكاء الاصطناعي فقط. الأداء يكاد يكون بنفس جودة استخدام 10,000 صورة حقيقية من الإنترنت.
الملخص
هذه الورقة البحثية تشبه اختراع طريقة لتقليص روبوت ضخم ومعقد إلى جهاز صغير بحجم الجيب.
- توقفوا عن إصلاح الروبوت قطعة بقطعة وبدأوا في ضبطه بالكامل في وقت واحد (التحسين المشترك).
- توقفوا عن الحاجة إلى مستودع من الصور الحقيقية وعوضاً عن ذلك علموا الذكاء الاصطناعي تخيل آلاف السيناريوهات التدريبية المتنوعة والمثالية فورياً (توليد البيانات الموجهة بالأوامر المتعلمة).
النتيجة؟ ذكاء اصطناعي ذكي وفعال يمكنه العمل على هاتفك، والتعرف على الأشياء بنفس جودة النسخة الضخمة، دون أن يحتاج أبداً لرؤية صورة حقيقية واحدة أثناء الإعداد.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.