SiLVR: A Simple Language-based Video Reasoning Framework
إن SilVR هو إطار عمل بسيط، ومرن، ولا يتطلب تدريباً، يعزز قدرات النماذج اللغوية الكبيرة متعددة الوسائط في الاستدلال بالفيديو من خلال تفكيك المهام المعقدة إلى مرحلتين: تحويل الفيديو الخام إلى تمثيلات لغوية متعددة الحواس، والاستفادة من النماذج اللغوية الكبيرة القوية مع تقليل السياق التكيفي لتحقيق أداء رائد في مختلف اختبارات قياس الفيديو.