← أحدث الأبحاث
💻 computer science

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

تقدم هذه الورقة LongAV-Compass، وهو معيار مرجعي منهجي صُمم لتوحيد تقييم التوليد السمعي البصري بمقياس الدقيقة عبر وسائط التكييف النصية والصورية والفيديو من خلال توظيف إطار عمل شامل يقيم أكثر من 20 بُعداً دقيقاً للجودة والاتساق والترابط.

المؤلفون الأصليون: Tengfei Liu, Yang Shi, Xuanyu Zhu, Jiafu Tang, Liu Yang, Qixun Wang, Zhuoran Zhang, Yuqi Tang, Fengxiang Wang, Yuhao Dong, Xinlong Chen, Bozhou Li, Bohan Zeng, Yue Ding, Xiaohan Zhang, Jialu Chen, Hao
نُشر 2026-05-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tengfei Liu, Yang Shi, Xuanyu Zhu, Jiafu Tang, Liu Yang, Qixun Wang, Zhuoran Zhang, Yuqi Tang, Fengxiang Wang, Yuhao Dong, Xinlong Chen, Bozhou Li, Bohan Zeng, Yue Ding, Xiaohan Zhang, Jialu Chen, Haotian Wang, Yuanxing Zhang, Pengfei Wan, Leye Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك مخرج أفلام. لفترة طويلة، كان قطاع صناعة الأفلام يطلب منك فقط صنع إعلات ترويجية مدتها 5 ثوانٍ. كان بإمكانك جعل تلك الثواني تبدو مذهلة، وكان هناك الكثير من الحكام ليخبروك ما إذا كانت الإضاءة جيدة أو إذا ابتسم الممثل في الوقت المناسب.

لكن الآن، يطلب منك قطاع الصناعة صنع أفلام كاملة مدتها 60 دقيقة. فجأة، لم يعد صنع مشهد واحد جيد كافيًا. عليك التأكد من أن الشخصية الرئيسية تبدو كما هي في المشهد الأخير تمامًا كما بدت في المشهد الأول، وأن القصة منطقية من البداية إلى النهاية، وأن المؤثرات الصوتية تتطابق تمامًا مع الحركة.

المشكلة؟ الحكام (أدوات التقييم) لا يزالون مدربين فقط على تقييم الإعلات الترويجية ذات الـ 5 ثوانٍ. إنهم لا يعرفون كيف يكتشفون ثغرة في الحبكة تحدث بعد 40 دقيقة، أو عندما يبدأ وجه الشخصية في الذوبان لأن الفيديو أصبح طويلاً جدًا.

إليك "LongAV-Compass".

تقدم هذه الورقة البحثية "حكمًا" جديدًا ومتخصصًا مصممًا خصيصًا لتقييم مقاطع الفيديو الطويلة التي تصل لدقائق. وإليك كيف يعمل ذلك، مقسمًا ببساطة:

1. أنواع المخرجين الثلاثة (المهام)

يختبر الحكم الجديد ثلاث طرق مختلفة لصنع فيلم:

  • النص إلى فيديو (T2AV): تعطي الحكم نصًا (سيناريو)، وعليه أن يصنع الفيلم بأكصه.
  • الصورة إلى فيديو (I2AV): تعطي الحكم صورة واحدة لشخصية، وعليه أن يجعلها تتحرك وتمثل قصة مع الحفاظ على ملامح وجهها لتطابق الصورة تمامًا.
  • الفيديو إلى فيديو (V2AV): تعطي الحكم أول 15 ثانية من فيلم، وعليه أن يكمل بقية القصة دون تغيير الأسلوب أو الشخصيات.

2. خريطة "البوصلة" (المعيار المرجعي)

بنى الباحثون مكتبة من 284 حالة اختبار محددة. فكر في هذه الحالات كـ 284 "سيناريو" أو "تحديًا" يتراوح من فيديوهات الـ (vlogs) البسيطة إلى الإعلات التجارية المعقدة.

  • قاموا بتنظيمها حسب الصعوبة: بعضها سهل (شخص واحد يتحدث)، بينما البعض الآخر صعب (مطاردة سيارات مع عدة أشخاص وقوانين فيزيائية محددة).
  • تغطي أنواعًا مختلفة: مثل "الإعلانات التجارية" (بيع منتج) أو "صناع المحتوى" (رواية قصة مضحكة).

3. كيف يقيم الحكم (المقاييس)

بدلاً من مجرد إعطاء درجة واحدة مثل "8 من 10"، يعمل LongAV-Compass مثل طبيب تشخيصي. فهو يفحص الفيديو عبر أكثر من 20 "علامة حيوية" مختلفة:

  • هل حدثت القصة؟ (تحقيق الحدث): هل قام الفيديو بالفعل بما طلبه السيناريو؟
  • هل ظل الممثل كما هو؟ (اتساق الهوية): هل تغير وجه الشخصية الرئيسية أو ملابسه بشكل غريب في منت_صف الطريق؟
  • هل القصة سلسة؟ (الاستمرارية): هل قفز الفيديو أو تجمد بين المشاهد؟
  • هل الأصوات متطابقة؟ (التزامن): عندما يُغلق باب في الفيديو، هل يحدث صوت "الخبطة" في نفس اللحظة تمامًا؟
  • هل الفيلم بأكمله قابل للمشاهدة؟ (العرض الشامل): إذا شاهدت العمل بأكمله، هل سيبدو كمنتج كامل ومصقول؟

4. النتائج (من اجتاز الاختبار؟)

اختبر الباحثون 11 نموذجًا مختلفًا لتوليد الفيديو بالذكاء الاصطناعي (مزيج من الشركات التجارية الكبرى والمشاريع مفتوحة المصدر) باستخدام هذه البوصلة الجديدة.

  • الفائزون الكبار: حققت النماذج التجارية الرائدة (مثل "Seedance" و"Kling") أفضل أداء بشكل عام. استطاعت الحفاظ على اتساق الشخصيات وسرد قصة متماسكة لمدة دقيقة كاملة.
  • نقاط الضعف: تمكنت العديد من النماذج مفتوحة المصدر من صنع صورة جميلة لبضع ثوانٍ، ولكن مع طول الفيديو، تدهورت القصص، وتغيرت وجوه الشخصيات، أو أصبح الصوت غريبًا.
  • مشكلة "المنتج": كان الاختبار الأصعب هو "الإعلانات التجارية" (بيع منتج). واجه معظم أنظمة الذكاء الاصطناعي صعوبة هنا؛ حيث لم يتمكنوا من عرض المنتج وهو يُستخدم خطوة بخطوة بشكل موثوق دون إفساد المنطق أو المرئيات.

5. لماذا هذا مهم؟

تجادل الورقة بأننا لا يمكننا الاكتفاء بالنظر إلى "لوحة الصدارة" برقم واحد فقط. قد يكون نظام الذكاء الاصطناعي رائعًا في صنع مقطع مدته 5 ثوانٍ ولكنه سيء جدًا في صنع فيلم مدته 60 دقيقة.

LongAV-Compass هو أداة تساعدنا على رؤية أين بالضبط تفشل أنظمة الذكاء الاصطناعي هذه. إنه يشبه جهاز التشخيص الخاص بالميكانيكي الذي يخبرك: "المحرك يعمل جيدًا لمدة 10 دقائق، لكن المكابح تفشل بعد 20 دقيقة"، بدلاً من مجرد قول: "هذه السيارة معطلة".

باختصار: عالم فيديو الذكاء الاصطناعي يكبر، من صنع مقاطع قصة إلى صنع أفلام كاملة. وهذه الورقة البحثية وضعت أول مسطرة يمكنها حقًا قياس مدى جودة تلك الأفلام.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →