Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
تقترح هذه الورقة DualSpeed، وهو إطار عمل للتدريب السريع-البطيء يجمع بين تقليم الرموز البصرية من أجل الكفاءة مع وضع مساعد للتسلسل الكامل والتقطير الذاتي لمعالجة عدم التطابق بين التدريب والاستدلال، مما يؤدي إلى تسريع تدريب النماذج اللغوية الكبيرة متعددة الوسائط (MLLM) بمقدار يصل إلى 4.0 أضعاف دون المساس بالأداء.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم طالب ذكي جداً (نموذج لغوي كبير متعدد الوسائط) فهم العالم من خلال إطلاعه على آلاف الصور.
المشكلة: "عنق زجاجة" كثرة المعلومات
في الوقت الحالي، تشبه هذه النماذج الطلاب الذين يشعرون بالإرهاق من كثرة المعلومات. فعندما تعرض عليهم صورة، يقوم الكمبيوتر بتفكيكها إلى مئات أو حتى آلاف القطع الصغيرة تسمى "الرموز البصرية" (visual tokens). الأمر أشبه بأنك سلمت الطالب كتاباً مكوناً من 1000 صفحة لكل صورة واحدة، رغم أن معظم تلك الصفحات ليست سوى مساحات بيضاء فارغة أو أنماط متكررة.
محاولة قراءة كل تلك الصفحات تستغرق وقتاً طويلاً جداً، مما يجعل تدريب هذه النماذج بطيئاً للغاية، ومكلفاً، ومستهلكاً للطاقة.
الفكرة القديمة: خطأ "القص واللصق"
أدرك الباحثون أن العديد من تلك الصفحات عديمة الفائدة. لذا جربوا تقنية تسمى "تقليم الرموز البصرية" (Visual Token Pruning)، وهي تشبه استخدام قلم التحديد لشطب الصفحات المملة أو المكررة قبل عرض الكتاب على الطالب. هذه الطريقة تعمل بشكل رائع أثناء "الاختبار" لاحقاً (الاستنتاج)، مما يجعلهم أسرع.
ولكن عندما حاولوا استخدام هذه الطريقة أثناء التدريب، جاءت النتيجة عكسية. لقد خلقت "عدم توافق".
- التشبيه: تخيل أنك دربت الطالب دائماً على ملخص من 10 صفحات فقط، ثم في الامتحان النهائي، سلمته الكتاب الكامل المكون من 1000 صفحة. سيعاني الطالب من الذعر ويفشل، لأنه لم يتعلم أبداً كيف يتعامل مع النسخة الكاملة؛ لقد اعتاد أكثر من اللازم على النسخة القصيرة.
الحل: DualSpeed (معسكر التدريب "السريع-البطيء")
ابتكر المؤلفون في هذه الورقة البحثية، دنيغكون تشانغ وفريقه، إطار عمل جديد للتدريب يسمى DualSpeed. فكر في الأمر كمعسكر تدريبي بمسارين يتنقل بينهما ذهاباً وإياباً بشكل عشوائي لحل مشكلة عدم التوافق.
المسار السريع (الممارسة السريعة):
- معظم الوقت (حوالي 90% من الجلسات)، يتدرب النموذج في "الوضع السريع".
- هنا، يستخدمون تقنية "التقليم" لاستبعاد الرموز البصرية غير المفيدة. يتعلم النموذج بسرعة من الملخصات القصيرة والفعالة.
- ولمساعدة النموذج على تذكر أي نسخة ينظر إليها، يضيفون "علامة تعريف" صغيرة وغير مرئية (تسمى عازل النمط - Mode Isolator) في بداية الملخص القصير. هذا يخبر النموذج: "مهلاً، هذه هي النسخة المختصرة؛ ركز على التفاصيل الرئيسية".
المسار البطيء (مراجعة الكتاب الكامل):
- من حين لآخر (حوالي 10% من الوقت)، ينتقل النموذج إلى "الوضع البطيء".
- هنا، نعرض للنموذج الصورة الكاملة غير المقلمة (جميع الـ 1000 صفحة).
- ولضمان عدم ترهل النموذج أو كَسله خلال هذه الجلسات النادرة، نستخدم حيلة تسمى "التقطير الذاتي" (Self-Distillation). حيث يعمل "الوضع السريع" (الذي تعلم بالفعل الكثير) كمعلم، يهمس بالإجابات لنموذج "الوضع البطيء". هذا يضمن أن يتعلم الطالب النسخة الكاملة بفعالية، رغم أنه يراها في أوقات متباعدة.
النتيجة: أفضل ما في العالمين
من خلال المزج بين هذين الوضعين، يحصل النموذج على سرعة "المسار السريع" ولكنه يحتفظ بالقدرة على التعامل مع العالم الكامل والمعقد في "المسار البطيء".
- السرعة: قاموا بتدريب النماذج بسرعة أكبر بمقدار 2.1 إلى 4.0 مرات من السابق.
- الأداء: رغم هذه السرعة، لم تصبح النماذج أقل ذكاءً؛ فقد حافظت على أكثر من 99% من أدائها الأصلي.
- المرونة: النموذج النهائي ذكي بما يكفي للتعامل مع كل من الملخصات القصيرة (إذا كنت تريد السرعة لاحقاً) والصور الكاملة (إذا كنت تريد أقصى قدر من الدقة).
باخت مختصراً
تزعم الورقة البحثية أنه باستخدام نظام التبديل "السريع-البطيء"، يمكننا تعليم هذه النماذج الضخمة بسرعة أكبر بكثير دون جعلها تنسى كيفية قراءة الكتب الكاملة. لقد وجدوا أن حوالي 90% من الرموز البصرية هي في الواقع زائدة عن الحاجة أثناء التدريب، ومن خلال قصها بذكاء (مع التدرب أحياناً على النسخة الكاملة)، يمكنهم توفير كميات هائلة من الوقت والمال دون فقدان الذكاء.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.