GenVideoLens: Where LVLMs Fall Short in AI-Generated Video Detection?
تقدم هذه الورقة GenVideoLens، وهو معيار مرجعي دقيق يتكون من 500 فيديو مشروح عبر 15 بُعداً من أبعاد الأصالة، ليكشف أن نماذج الرؤية واللغة الكبيرة (LVLMs) تؤدي بشكل جيد في الإشارات الإدراكية، لكنها تعاني بشكل كبير في الاستنتاج البصري والفيزيائي والزمني في كشف الفيديو المُنشأ بواسطة الذكاء الاصطناعي.