← أحدث الأبحاث
🤖 AI

Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models

تقدم هذه الورقة البحثية شبكة MMHNet، وهي شبكة هرمية متعددة الوسائط تدمج نموذج Mamba غير السببي، مما يمكّن نماذج تحويل الفيديو إلى صوت المدربة على عينات قصيرة من التعميم بنجاح وتوليد صوت عالي الجودة تتجاوز مدته خمس دقائق، متفوقة بذلك على الأساليب السابقة التي تمثل حالة الفن الراهنة.

المؤلفون الأصليون: Christian Simon, Masato Ishii, Wei-Yao Wang, Koichi Saito, Akio Hayakawa, Dongseok Shim, Zhi Zhong, Shuyang Cui, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji

نُشر 2026-04-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Christian Simon, Masato Ishii, Wei-Yao Wang, Koichi Saito, Akio Hayakawa, Dongseok Shim, Zhi Zhong, Shuyang Cui, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك مخرج أفلام. لديك مقطع من فيلم صامت، وعليك إضافة الموسيقى التصويرية المثالية: زئير الحشود، صوت تكسر الخطوات، أو همهمة حركة المرور البعيدة. هذه هي مهمة الذكاء الاصطناعي لتحويل الفيديو إلى صوت (V2A).

لفترة طويلة، كانت نماذج الذكاء الاصطناعي هذه تشبه فنانين ذوي ذاكرة قصيرة المدى. فقد كانت بارعة في صنع صوت لمقطع مدته 10 ثوانٍ لقطة تقفز. ولكن إذا طلبت منها تنسيق مشهد مطاردة سيارات لمدة 5 دقائق، فستصاب بالارتباك، وسيصبح الصوت فوضويًا، أو ستكتفي بتكرار نفس الضجيج مرارًا وتكرارًا.

تقدم ورقة بحثية بعنوان "Echoes Over Time" نموذج ذكاء اصطناٍ جديد يسمى MMHNet الذي يحل هذه المشكلة. إليك كيف يعمل، مشروحًا عبر تشبيهات بسيطة.

1. المشكلة: فخ "الموضع"

تتعلم معظم نماذج الذكاء الاصطناعي اليوم من خلال حفظ ترتيب الأشياء باستخدام نظام صارم يسمى "التضمينات الموضعية" (positional embeddings). فكر في هذا الأمر كأنه قطار بعربات ثابتة.

  • المشكلة: إذا تم تصميم القطار لـ 8 عربات (8 ثوانٍ من الفيديو)، وحاولت إلحاق 60 عربة به (60 ثانية من الفيديو)، فإن القطار سينكسر. سيتوه الذكاء الاصطناعي لأنه لا يعرف أين تقع "العربة رقم 50" في خريطته المحفوظة مسبقًا.
  • النتيجة: عندما تحاول توليد صوت طويل، يبدأ الذكاء الاصطناعي بالهلوسة، أو يخرج الصوت عن التزامن مع الفيديو، أو يكتفي بتكرار نفس الصوت (مثل الأسطوانة المكسورة).

2. الحل: محرك "Mamba غير السببي" (Non-Causal Mamba)

استبدل المؤلفون "القطار" الصارم بمحرك جديد يسمى Mamba-2، وتحديدًا نسخة غير سببية (Non-Causal).

  • التشبيه: تخيل جراحًا في غرفة العمليات بدلاً من قائد قطار.
    • النموذج السببي (مثل القطار القياسي) يمكنه فقط النظر إلى ما حدث قبل اللحظة الحالية. لا يمكنه رؤية المستقبل.
    • أما النموذج غير السببي فيمكنه رؤية المشهد بأكلِه في وقت واحد. إنه يرى البداية والمنتصف والنهاية من الفيديو في آن واحد.
  • لماذا يساعد ذلك؟: لأن الذكاء الاصطناعي يمكنه رؤية سياق الفيديو بالكامل دفعة واحدة، فهو لا يحتاج إلى حفظ "رقم موضع" محدد. إنه يفهم قصة الفيديو. إذا وقع حادث تصادم سيارة في نهاية مقطع مدته 5 دقائق، سيعرف الذكاء الاصطناعي وضع صوت التصادم في النهاية، حتى لو تم تدريبه فقط على مقاطع قصيرة.

3. السر الخفي: "الفلتر الذكي" (التوجيه الهرمي)

الفيديوهات الطويلة مليئة باللحظات المملة والمتكررة. إذا حاولت معالجة فيديو مدته 5 دقائق إطارًا تلو الآخر، فالأمر يشبه محاولة قراءة موسوعة كاملة كلمة بكلمة للعثور على حقيقة واحدة محددة؛ وهذا أمر بطيء وغير فعال.

يستخدم MMHNet شبكة هرمية مع فلتر ذكي.

  • التشبيه: تخيل محررًا في غرفة أخبار مزدحمة.
    • بدلاً من قراءة كل كلمة في كل مقال، يمسح المحرر العناوين بسرعة.
    • إذا كان أحد الفقرات يقول فقط "الشمس مشرقة"، فإن المحرر يتجاهله (لأنه مكرر).
    • أما إذا قالت فقرة "المبنى يحترق"، فإن المحرر يسلط الضوء عليها ويرسلها فورًا إلى الكاتب الرئيسي.
  • كيف يعمل: يقوم الذكاء الاصطناعي بمسح الفيديو والصوت. يحدد الأجزاء "المملة" حيث لا يتغير شيء ويقوم بضغطها. وهو يرسل فقط الأجزاء "المثيرة" (حيث يحدث صوت فعلي) إلى الجزء الذي يبذل الجهد الذهني الأكبر. هذا يوفر كميات هائلة من القدرة الحوسبية ويحافظ على نقاء الصوت.

4. الخدعة السحرية: "تدرب قصيرًا، اختبر طويلًا"

الجزء الأكثر إثارة للإعجاب في هذه الورقة البحثية هو أنهم لم يحتاجوا للتدريب على فيديوهات طويلة.

  • التشبيه: فكر في طالب موسيقى يتدرب على السلالم الموسيقية.
    • عادةً، لتعلم سيمفونية مدتها ساعة، تتدرب على الساعة كاملة.
    • هذا الذكاء الاصطناعي الجديد يشبه طالبًا تدرب فقط على سلالم موسيقية مدتها 10 ثوانٍ، لكنه تعلم قواعد الموسيقى جيدًا لدرجة أنه يستطيع عزف سيمفونية مدتها 5 ساعات فورًا دون أن يكون قد سمع واحدة من قبل.
  • النتيجة: قاموا بتدريب النموذج على مقاطع مدتها 8 ثوانٍ. وعندما اختبروه على فيديوهات مدتها 5 دقائق، عمل بشكل مثالي. وهذا ما يسمى "التعميم الطولي" (Length Generalization).

ملخص النتائج

في اختباراتهم، تفوق هذا النموذج الجديد (MMHNet) على جميع "الأبطال" السابقين (مثل LoVA و HunyuanVideo-Foley).

  • النماذج القديمة: حاولت توليد فيديو مدته 5 دقائق، فكان الصوت ينحرف عن التزامن، أو يبدو آليًا، أو يفقد التزامن مع الفيديو.
  • MMHNet: ولد صوتًا لمدة 5 دقائق ظل متزامنًا تمامًا مع الفيديو، بجودة صوت عالية لم تتراجع بمرور الوقت.

باختًا مختصرًا: بنى المؤلفون نوعًا جديدًا من عقول الذكاء الاصطناعي التي لا تعتمد على مواضع ذاكرة جامدة. بد بدلًا من ذلك، يستخدم "رؤية شاملة" لفهم القصة بأكملها و"فلترًا ذكيًا" لتجاهل الأجزاء المملة. وهذا يسمح له بأخذ دروس تدريبية قصيرة وتطبيقها لتوليد موسيقى تصويرية مثالية لأفلام بأي طول.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →