CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model
يُعد CoTinyVLA نموذجاً للرؤية واللغة والعمل (Vision-Language-Action) يقل حجمه عن مليار معلمة، وهو يحقق أداءً فائقاً من حيث المتانة على معيار LIBERO-Plus عبر الاستفيد من تقنيات الإشراف المهيكل — بما في ذلك المدخلات الزمنية ثنائية الرؤية، وتقطير سلسلة الأفكما التسلسلي الهرمي، وتعزيز إعادة الصياغة — بدلاً من زيادة حجم النموذج.