← أحدث الأبحاث
💻 computer science

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

تقدم هذه الورقة البحثية VA-Judger، وهو نموذج مكافأة قائم على تسلسل الأفكار تم تدريبه على مجموعة بيانات تفضيلات بشرية جديدة واسعة النطاق (VAPref-10K) ومعيار مرجعي مبتكر (VA-Judger-Bench) للتغلب على قيود مقاييس الجودة المنفصلة الحالية، مما يوفر مكافآت أكثر تماسكاً وتوافقاً مع البشر تعمل على تحسين توليد الفيديو والصوت المشترك بشكل كبير من خلال التعلم التعزيزي.

المؤلفون الأصليون: Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

نُشر 2026-08-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالماً لا يستطيع فيه الكمبيوتر فقط رسم صورة متحركة، بل يمكنه أيضاً تأليف الأصوات الدقيقة التي تنتمي إليها: حفيف أوراق الشجر، أو طقطقة النار، أو النبرة المحددة لصوت يتحدث في غرفة ما. هذا هو أفق التوليد المشترك للفيديو والصوت، وهو مجال يتعلم فيه الذكاء الاصطناعي كيفية إنشاء مشاهد بصرية ومساحات صوتية متزامنة في آن واحد. لسنوات، كافح الباحثون لتعليم هذه الأنظمة إنتاج محتوى يبدو حقيقياً حقاً للمشاهدين البشر. المشكلة لا تكمن فقط في صنع صورة واضحة أو صوت نقي؛ بل في ضمان عمل العنصرين معاً كجربة واحدة متماسكة تتوافق مع القصة التي يتم سردها. عندما تحاول بقرة في فيديو عزف الجيتار، يجب أن يكون الصوت عبارة عن نقرة خرقاء تشبه الخوار، وليس وتراً موسيقياً مثالياً. إذا ضبط الكمبيوتر التفاصيل البصرية بشكل صحيح ولكن الصوت كان خاطئاً، أو إذا كان الصوت والفيديو غير متزامنين قليلاً، فإن الوهم ينكسر. وحتى الآن، كانت الأدوات المستخدمة لتقييم هذه الابتكارات تشبه لجنة من المفتشين يفحصون الطلاء، والمحرك، والعجلات للسيارة بشكل منفصل، غافلين عن حقيقة أن السيارة نفسها قد لا تسير على الإطلاق.

قدم فريق من الباحثين نهجاً جديداً لحل هذا الانفصال. لقد بنوا نظاماً يسمى "VA-Judger"، صُمم ليكون عيناً وأذناً ناقدة للذكاء الاصطناعي. فبدلاً من الاعتماد على قواعد منفصلة وصارمة لقياس جودة الفيديو، وجودة الصوت، والتوقيت، يتعلم هذا النظام الجديد تقييم الحزمة بأكملها بالطريقة التي يفعلها البشر. بدأ الباحثون بإنشاء مكتبة ضخمة من المقارنات، حيث جمعوا آلاف الأزواج من مقاطع الفيديو والصوت التي تم إنشاؤها بواسطة نماذج حاسوبية مختلفة. ولكل زوج، قام مقيمون بشريون بالمشاهدة والاستماع، ليقرروا أيهما يبدو أفضل ويوضحوا السبب بدقة. لقد سجلوا ما إذا كان أحد المقاطع يتبع القصة المكتوبة بشكل وثيق، أو ما إذا كانت الشفاه تتحرك بالتزامن مع الكلمات، أو ما إذا كانت الضوضاء الخلفية تبدو طبيعية. أصبحت هذه المجموعة من الاختيارات البشرية هي ميدان التدريب لـ "VA-Judger".

لقد تم هيكلة عملية التدريب بعناية لتعليم النظام كيفية التفكير. أولاً، تعلم النموذج على أمثلة سهلة حيث كان الفرق بين مقطع جيد وسيء واضحاً، تماماً مثل طالب يتعلم التمييز بين صورة واضحة وأخرى ضبابية. وبمجرد إتقانه لتنسيق تقديم نقد مهيكل، قدم له الباحثون حالات أصعب بكثير حيث كان المقطعان متطابقين تقريباً في الجودة. هنا، توجب على النموذج تعلم رصد العيوب الدقيقة، مثل تأخير طفيف في تأثير صوتي أو إيماءة لا تتناسب تماماً مع عاطفة الصوت. ولضمان تعلم النموذج من الحقيقة البشرية بدلاً من مجرد محاكاة الأنماط، استخدم الباحثون خطوة تصفية حيث تحقق خبراء بشريون من خيارات النموذج في هذه الأزواج الصعبة، مع الاحتفاظ فقط بالتعليل الذي يتوافق مع الحكم البشري. وأخيراً، تم صقل النظام من خلال عملية قائمة على التجربة والخطأ، حيث تلقى ملاحظات محددة حول كل جزء من استدلاله، مما شجعه على تطوير فهم أعمق لسبب نجاح زوج معين من الفيديو والصوت بينما فشل الآخر.

تظهر نتائج هذا العمل أن النظام الجديد يتوافق بشكل أكبر بكثير مع التفضيل البشري مقارنة بالطرق السابقة. فعند اختباره ضد مجموعة واسعة من الأدوات الموجودة التي تقيس الفيديو والصوت بشكل منفصل، أثبت "VA-Judger" أنه أفضل بكثير في التنبؤ بالمقطع الذي قد يستمتع به الشخص بالفعل. وفي مجموعة من الاختبارات التي تضمنت مئات المقارنات، وافق النظام الجديد على الاختيارات البشرية بشكل أكبر بكماً من المقاييس القديمة، التي غالباً ما كانت ترتبك بسبب مقاطع تبدو جيدة بصرياً ولكن صوتها خاطئ، أو العكس. والأهم من ذلك، عندما استخدم الباحثون "VA-Judger" للمساعدة في تدريب نموذج توليد الفيديو، تحسنت المخرجات بشكل كبير. فقد أنتج النموذج الجديد مقاطع ليست فقط أكثر حدة ووضوحاً، بل بدت أيضاً أكثر اكتمالاً وإخلاصاً للقصة الأصلية. وفي المقارنات المباشرة، اختار المشاهدون البشريون المقاطع التي تم إنتاجها باستخدام هذا التوجيه الجديد أكثر بـست مرات من تلك الناتجة عن النموذج الأساسي غير المدرب، وأكثر من مرتين من تلك الناتجة عن نموذج تم تدريبه باستخدام الطرق القديمة.

يبرهن هذا العمل على أنه لكي يتمكن الذكاء الاصطناعي من إنشاء فيديو وصوت مقنعين حقاً، لا يمكن الحكم عليهما من خلال قائمة مراجعة لميزات معزولة. إن جودة مشهد مُولد تعتمد على التكامل السلس بين الرؤية، والصوت، والقصة. ومن خلال تعليم الكمبيوتر تقييم هذه العناصر معاً، باستخدام الملاحظات الدقيقة للمراقبين البشر، قدم الباحثون مساراً نحو توليد محتوى يبدو أقل شبهاً بالمحاكاة وأكثر شبهاً بلحظة حقيقية تم التقاطها في الزمن. وتشير النتائج إلى أن مستقبل الذكاء الاصطناعي الإبداعي لا يكمن في مستشعرات فردية أفضل، بل في أنظمة تفهم الصورة الكاملة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →