VideoVerse: Does Your T2V Generator Have World Model Capability to Synthesize Videos?
تقدم هذه الورقة VideoVerse، وهو معيار شامل مصمم لتقييم قدرات نموذج العالم لنماذج توليد الفيديو من النص عبر تقييم فهمها للسببية الزمنية على مستوى الأحداث والمعرفة بالعالم من خلال مسار تقييم منهجي قائم على الأسئلة والأجوبة ومتوافق مع البشر.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك طباخاً آلياً سحرياً. لفترة طويلة، كنا نختبر هذا الطباخ عبر سؤاله عن صنع شطيرة. إذا بدا الخبز جميلاً وكان الجبن في مكانه الصحيح، نمنحه نجمة ذهبية. هكذا كنا نختبر نماذج الذكاء الاصطناعي لـ تحويل النص إلى فيديو (T2V): كنا نطلب منها صنع فيديو بناءً على وصف ما، ثم نتحقق مما إذا كانت الصور تبدو جميلة وما إذا كانت الأشياء باقية في مكانها الصحيح.
لكن الآن، أصبحت طهاة الذكاء الاصطناعي هذه بارعة جداً في صنع "صور جميلة" لدرجة أن الاختبارات القديمة لم تعد تجدي نفعاً. فجميعهم يحصلون على نجوم ذهبية، حتى لو لم يفهموا حقاً كيف يعمل العالم.
يقدم هذا البحث اختباراً جديداً وأكثر صعوبة يسمى VideoVerse. فكر في الأمر كأننا ننقل الذكاء الاصطناعي من "فصل تعليم الطبخ" إلى "محاكاة للبقاء على قيد الحياة".
المشكلة: فخ "الوضوح"
تخيل أنك تطلب من الذكاء الاصطناعي: "بطة مطاطية تُلقى على الأرض، تظهر ارتداداً حيوياً".
يقوم الذكاء الاصطناعي ببساطة بنسخ كلمات "ارتداد حيوي" ويرسم بطة ترتد. هذا غش! هو لم يعرف أن البط يرتد؛ بل فقط قرأ التعليمات.
VideoVerse يغير القواعد. فهو يسأل: "بطة مطاطية تُلقى على الأرض".
إنه يخفي الجزء المتعلق بالارتداد. يجب أن يعرف الذكاء الاصطناعي الذكي (نموذج العالم - World Model) أنه إذا رميت بطة مطاطية، فإنها سترتد بسبب قوانين الفيزياء. إذا اصطدمت البطة بالأرض وتوقفت تماماً، فقد فشل الذكاء الاصطناعي في الاختبار، حتى لو بدت البطة جميلة.
الاختبار الجديد: 10 طرق لكسر الذكاء الاصطناعي
ابتكر المؤلفون 300 مطالبة (Prompt) مخادعة لمعرفة ما إذا كان الذكاء الاصطناعي يفهم "قواعد الكون". وقد قسموا الاختبار إلى فئتين: ثابت (أشياء لا تتحرك) وديناميكي (أشياء تحدث بمرور الوقت).
1. الاختبار الثابت (فحص "الثانية الواحدة")
هذه بمثابة اختبار مفاجئ للبديهة والعلم.
- البديهة (Common Sense): إذا طلبت "شجرة تمثل الثقافة اليابانية"، يجب أن يرسم الذكاء الاصطناعي شجرة كرز، وليس شجرة صنوبر أو نخلة.
- القيود الطبيعية: إذا طلبت بحيرة عند درجة حرارة -20 مئوية، يجب أن تكون المياه متجمدة. إذا رسم الذكاء الاصطناعي مياهاً سائلة، فقد فشل.
- العمق ثلاثي الأبعاد (3D Depth): إذا قلت "شجرة خلف مقعد"، يجب أن تكون الشجرة مخفية خلف المقعد، وليس عائمة أمامه.
2. الاختبار الديناميكي (فحص "الفيلم")
هنا يحدث السحر الحقيقي. يجب على الذكاء الاصطناعي فهم السبب والنتيجة، مثل مخرج يعرف كيف يجب أن يسير مشهد سينمائي.
- تتابع الأحداث (تأثير الدومينو): إذا قلت: "رجل يرمي كرة، كلب يمسك بها، والرجل يربط الكلب بمقود"، يجب على الذكاء الاصطناعي القيام بها بهذا الترتيب بالضبط. إذا أمسك الكلب بالكرة قبل رميها، فهذا يعني أن الذكاء الاصطناعي مرتبك بشأن الزمن.
- التفاعل (اختبار "اللمس"): إذا قلت: "رجل يحلق لحيته"، يجب أن تصبح اللحية أقصر. إذا أظهر الذكاء الاصطناعي رجلاً يمرر شفرة الحلاقة على وجهه ولكن اللحية بقيت كثيفة، فإن الذكاء الاصطناعي لا يفهم ما الذي "يفعله" الحلاقة فعلياً.
- خصائص المواد (اختبار "الفيزياء"): إذا قلت: "الشوكولاتة تُسخن"، فيجب أن تذوب لتصبح سائلة. إذا ظلت صلبة، فإن الذكاء الاصطناحي لا يعرف كيف تتصرف الشوكولاتة.
النتائج: فجوة "نموذج العالم"
اختبر الباحثون أفضل نماذج الذكاء الاصطناعي (سواء المجانية مثل Wan2.2 أو المكلفة مثل Sora-2 و Veo-3) باستخدام هذا الاختبار الجديد.
- الأخبار الجيدة: نماذج الذكاء الاصطناعي تتحسن في صنع صور جميلة واتباع التعليمات البسيطة.
- الأخبار السيئة: لا تزال هذه النماذج سيئة جداً في فهم "القواعد الخفية" للعالم.
- النماذج مفتوحة المصدر (المجانية) غالباً ما تفشل في اختبارات "نموذج العالم" تماماً. قد يصنعون فيديو رائعاً لقرش، ولكن إذا سبح القرش عبر قارب، فإنهم لا يدركون أن هذا مستحيل.
- النماذج مغلقة المصدر (المكلفة مثل Sora-2) أفضل بكثير، لكنها لا تزال ترتكب الأخطاء. قد يطبقون الفيزياء بشكل صحيح بنسبة 70% من الوقت، لكن نسبة الفشل البالغة 30% تعني أنهم ليسوا "أذكياء" حقاً بعد.
الحكم النهائي
فكر في مولدات فيديو الذكاء الاصطناعي الحالية كأنها ممثلون بارعون يمكنهم حفظ النصوص بدقة ولكنهم لا يفهمون الحبكة. يمكنهم قول "أنا حزين" والبكاء عند الطلب، لكنهم لا يشعرون بالحزن فعلياً ولا يفهمون لماذا الشخصية حزينة.
VideoVerse هو أول اختبار يسأل الذكاء الاصطناعي: "هل تفهم حقاً كيف يعمل العالم، أم أنك مجرد تخمن؟"
يخلص البحث إلى أنه بينما نقترب من ذلك، إلا أن ذكاء اليوم ليس بعد "نموذج عالم" حقيقي. لا يزال يتعلم الفرق بين البطة المطاطية التي ترتد والصخرة التي لا تفعل ذلك.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.