VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding
يُعد VEN-VL إطار عمل لخليط الخبراء المعتمد على التجميع البصري، والذي يسد الفجوة بين الأداء والكفاءة في الفهم متعدد الوسائط من خلال إثراء سعة المعلومات البصرية أولاً عبر التوحيد متعدد المنظورات، ثم ضغطها تدريجياً عبر التوجيه التكيفي والإشراف البصري الصريح.