Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
تقترح هذه الورقة DualSpeed، وهو إطار عمل للتدريب السريع-البطيء يجمع بين تقليم الرموز البصرية من أجل الكفاءة مع وضع مساعد للتسلسل الكامل والتقطير الذاتي لمعالجة عدم التطابق بين التدريب والاستدلال، مما يؤدي إلى تسريع تدريب النماذج اللغوية الكبيرة متعددة الوسائط (MLLM) بمقدار يصل إلى 4.0 أضعاف دون المساس بالأداء.