Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
يُعد Mage-VL نموذجاً تأسيسياً للبث المباشر، كفؤاً ومبنياً على نظام ترميز (codec-native)، يستفيد من أداة ترميز مدركة للحركة وبنية ذات نظام مزدوج لتحقيق فهم متعدد الوسائط في الوقت الفعلي مع تقليل استهلاك الرموز (tokens) بشكل كبير وتسريع الاستدلال، مع مضاهاة أو تجاوز النماذج الأكبر والأحدث في مهام الاستدلال الثابت والديناميكي.