WorldJen: An End-to-End Multi-Dimensional Benchmark for Generative Video Models
تقدم WorldJen معياراً مرجعياً متعدد الأبعاد وشاملاً لنماذج الفيديو التوليدية يستبدل تقييمات الأسئلة والأجوبة المرئية (VQA) الثنائية المعيبة بتقييمات نماذج اللغة البصرية (VLM) عالية الدقة القائمة على مقياس ليكرت، محققةً توافقاً تاماً مع ترتيبات التفضيل البشري من خلال مطالبات منسقة تنافسياً ونظام تقييم ثلاثي المستويات يتسم بالمتانة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك رئيس حكام في مسابقة طبخ ضخمة وعالية المخاطر. ولكن بدلاً من تذوق الطعام، أنت تشاهد فيديوهات تم إنشاؤها بواسطة الذكاء الاصطناعي. مهمتك هي تقرير أي طباخ ذكاء اصطناعي هو الأفضل.
لفترة طويلة، استخدم الحكام الأدوات الخاطئة. كانوا يستخدمون مسطرة لقياس مدى "مثالية البكسل" (مثل التحقق مما إذا كانت حبيبات الملح بالحجم الصحيح) أو محلل تردد لرؤية ما إذا كانت الألوان تطابق صورة مرجعية. لكن هذه الأدوات أغفلت الصورة الكبيرة: هل طهى الطباخ وجبة حقاً؟ هل المكونات منطقية؟ هل غلى الحساء وفاض من القدر؟ أم أن الطباخ صنع فقط فوضى ضبابية مثالية رياضياً ولكنها لا تشبه الطعام في شيء؟
حاولت محاولات أخيرة أخرى سؤال الحكام أسئلة بسيطة من نوع "نعم أو لا" مثل، "هل الفيزياء صحيحة؟" ولكن البشر (والحكام الآليين) يميلون لقول "نعم" ما لم يكن الفيديو معطلاً تماماً. وهذا جعل من المستح المستحيل التمييز بين فيديو "جيد" وفيديو "عظيم".
إليك WORLDJEN. اعتبر هذا نظام تحكيم جديد كلياً ومتطور للغاية صُمم لإصلاح هذه المشكلات. وإليك كيف يعمل، مقسماً إلى خطوات بسيطة:
1. قائمة الطعام: المطالبات المنسقة (Curated Prompts)
بدلاً من طلب "اصنع فيديو لقطة" من الذكاء الاصطناعي، قام الباحثون بإنشاء قائمة طعام محددة من 3,754 "وصفة" معقدة (مطالبات). هذه ليست طلبات بسيطة؛ بل هي مصممة لاختبار الذكاء الاصطنانا على 16 مهارة مختلفة في آن واحد، مثل:
- الحركة: هل تتحرك الشخصية بسلاسة، أم أنها ترتجف؟
- الفيزياء: إذا أُلقيت كرة، هل تسقط وفقاً لقوانين الجاذبية؟
- المنطق: إذا مشى شخص خلف شجرة، هل يختفي ويظهر مجدداً بشكل صحيح؟
- الجماليات: هل الإضاءة والألوان جميلة؟
2. اختبار التذوق البشري (الحقيقة الأرضية - The Ground Truth)
قبل الوثوق بأي كمبيوتر للتحكيم، احتاج الباحثون إلى "معيار ذهبي". لقد استعانوا بـ 7 خبراء بشريين لمشاهدة 300 فيديو (تم إنشاؤها بواسطة 6 نماذج مختلفة من أفضل نماذج الذكاء الاصطناعي) والتصويت على أي منها كان الأفضل.
- النتيجة: اتفق البشر على تصنيف واضح من "ثلاث مستويات":
- المستوى الأعلى: كان النموذجان (Veo 3.1 و Kling) هما الأفضل بوضوح.
- المستوى المتوسط: كانت هناك ثلاثة نماذج جيدة، لكن لا يمكن تمييزها إحصائياً عن بعضها البعض.
- المستوى الأدنى: كان هناك نموذج واحد متأخر بوضوح عن البقية.
هذا التصنيف البشري هو "الحقيقة" التي يُقاس كل شيء آخر بناءً عليها.
3. الحكم الآلي (نموذج VLM)
الآن، سأل الباحثون: "هل يمكن لحكم ذكاء اصطناعي (نموذج لغوي بصري - Vision-Language Model) القيام بهذه الوظيفة بنفس كفاءة البشر؟"
لم يكتفوا بسؤال الذكاء الاصطناعي "هل هذا جيد؟" بل قدموا له استبيان مقياس ليكرت (Likert-scale) (نظام تقييم من 1 إلى 5، مثل تقييمات Yelp) لكل فيديو.
- الخدعة: ينظر الحكم الآلي إلى الفيديو بـ دقة سطحه الأصلية الكاملة (وليس مصغراً إلى صورة مصغرة صغيرة جداً). ثم يسأل نفسه 10 أسئلة محددة لكل فيديو حول تفاصيل معينة (مثل: "هل ومضت يد الشخصية؟" أو "هل تحرك الظل بشكل صحيح؟").
- الدرجة: يعطي درجة لكل سؤال، ويتم دمج هذه الدرجات للوصول إلى الترتيب النهائي.
4. الكشف الكبير
عند مقارنة ترتيب الحكم الآلي مع اختبار التذوق البشري، كانت النتائج مذهلة: لقد تطابقا تماماً.
- حدد الذكاء الاصطناعي المستوى الأعلى، والمستوى المتوسط، والمستوى الأدنى بشكل صحيح.
- وافق البشر بنسبة 100% في ترتيب النماذج.
وهذا يثبت أن الحكم الآلي يمكن أن يكون بديلاً موثوقاً، رخيصاً، وسريعاً للمحكمين البشر المكلفين.
5. لماذا هو أفضل من الطريقة القديمة (VBench)
تقارن الورقة البحثية WORLDJEN بنظام موجود يسمى VBench.
- VBench يشبه حكماً يحدق في فيديو من خلال ثقب مفتاح (دقة منخفضة) ويتحقق فقط مما إذا كانت الألوان صحيحة تقريباً. وغالباً ما يعطي الجميع درجة "مثالية" لأن الاختلافات تكون صغيرة جداً بحيث لا تُرى.
- WORLDJEN يشبه حكماً يستخدم عدسة مكبرة وينظر إلى الفيديو بالكامل. إنه يجد الشقوق الصغيرة في الفيزياء والخلل الدقيق الذي يفوته VBench.
- النتيجة: فشل VBench في ترتيب النماذج بشكل صحيح مقارنة بالبشر، بينما نجح WORLDJEN في ذلك.
6. اكتشاف "فجوة الفيزياء"
أحد أكثر الاكتشافات إثارة للاهتمام في هذا النظام الجديد هو "فجوة الفيزياء".
حتى أفضل نماذج الذكاء الاصطناعي في العالم لا تزال سيئة في فهم الفيزياء الأساسية.
- الاستعارة: تخيل أن طهاة الذكاء الاصطناعي بارعون جداً في تنسيق الأطبم (جعلها تبدو جميلة) وترتيب الطاولة (التكوين). ولكن إذا طلبت منهم طهي الطعام فعلياً (جعل كرة ترتد أو ماء يتدفق)، فإنهم غالباً ما يفشلون.
- وجدت الورقة أنه حتى النماذج الأعلى تقييماً سجلت درجات منخفضة في "الميكانيكا الفيزيائية" و"الاتساق العطالي". إنها تبدو جيدة، لكنها لا تلتزم بقوانين الكون تماماً بعد.
ملخص
WORLDJEN هو طريقة أذكى لاختبار مولدات الفيديو بالذكاء الاصطناعي. يستخدم "وصفات" معقدة لتحدي الذكاء الاصطناعي، وقد وضع البشر المعيار، ثم أثبت أن حكماً ذكياً من الذكاء الاصطناعي يمكنه القيام بالتقييم بنفس كفاءة البشر. وهو يوضح لنا أنه بينما تبدو فيديوهات الذكاء الاصطناعي مذهلة، إلا أنها لا تزال تكافح لفهم كيفية عمل العالم الحقيقي مادياً.
ما لا تدعيه الورقة البحثية:
- لا تدعي أن هذا النظام جاهز للتشخيص الطبي أو الاستخدام السريري.
- لا تدعي أن هذا سيغير طريقة صنع الأفلام في هوليوود غداً.
- لا تدعي أن حكام الذكاء الاصطناعي مثاليون في كل سيناريو، بل فقط أنهم يطابقون ترتيب البشر في هذه المجموعة المحددة من الاختبارات.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.