← أحدث الأبحاث
⚡ electrical engineering

MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation

يُعد MMAudioSep نموذجاً توليدياً يستفيد من نموذج تأسيسي مدرب مسبقاً لتحويل الفيديو إلى صوت لتحقيق فصل صوتي متفوق ومستند إلى استعلامات الفيديو والنصوص بكفاءة مع الحفاظ على قدراته التوليدية الأصلية.

المؤلفون الأصليون: Akira Takahashi, Shusuke Takahashi, Yuki Mitsufuji

نُشر 2026-04-20
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Akira Takahashi, Shusuke Takahashi, Yuki Mitsufuji

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك في حفلة صاخبة. هناك موسيقى تعزف، وأصوات ضحك، وكلب ينبح، وشخص يصطدم بكأس زجاجي. إنه مزيج فوضوي من الأصوات. الآن، تخيل أنك تريد سماع نباح الكلب فقط، أو الموسيقى فقط، دون بقية الضجيج.

هذه هي مشكلة فصل الأصوات (Sound Separation). عادةً ما تكون الحواسيب سيئة في هذا الأمر ما لم تعطها مهمة محددة للغاية وضيقة النطاق.

إليك MMAudioSep، وهو نموذج ذكاء اصطناعي جديد من سوني يعمل كـ "مستمع خارق" يمتلك سماعات رأس سحرية. وإليك كيف يعمل، مشروحاً ببساطة:

1. "الطاهي" الذي تعلم الطبخ قبل تعلم التنظيف

معظم نماذج الذكاء الاصطناعي لفصل الأصوات تشبه المتدربين الذين يبدأون من الصفر؛ فعليهم تعلم ما هو صوت الكلب، وما هو صوت الجيتار، وكيفية فصلهم جميعاً من جديد.

MMAudioSep مختلف. فهو يبدأ كنموذج "توليد الصوت من الفيديو" (Video-to-Audio Generator). فكر في هذا النموذج كـ "طاهٍ سينمائي". هذا الطاهي قد أمضى بالفعل سنوات في مشاهدة آلاف الفيديوهات وتعلم كيفية ابتكار المؤثرات الصوتية المثالية لتناسب الحركة على الشاشة. إذا أظهر الفيديو كلباً يركض، فإن هذا الطاهي يعرف بالضبط كيف يبدو صوت ركض الكلب.

لقد طرح الباحثون سؤالاً ذكياً: "إذا كان هذا الطاهي يعرف تماماً كيف يبدو صوت الكلب، فهل يمكننا فقط أن نطلب منه 'إيجاد' الكلب في تسجيل فوضوي بدلاً من 'ابتكاره'؟"

الإجابة هي نعم. لقد أخذوا هذا "الطاهي السينمائي" المدرب مسبقاً وقاموا بإعطائه تدريباً إضافياً بسيطاً (fine-tuning) لتعليمه كيفية الاستماع إلى مزيج فوضوي واختيار الصوت المحدد الذي طُلب منه.

2. الطلب السحري: "أرني الكلب!"

يمكنك أن تطلب من هذا النموذج صوتاً معيناً بطريقتين، تماماً كما تطلب المساعدة من صديق:

  • الاستعلام بالنص: تكتب "أريد سماع الكلب".
  • الاستعلام بالفيديو: تعرض على النموذج مقطع فيديو لكلب، فيقول: "آه، أنا أرى الكلب. سأقوم بعزل هذا الصوت".

الأمر يشبه امتلاك مساعد ذكي يمكنه النظر إلى فيديو أو قراءة ملاحظتك، ثم ضبط راديو خاص به فوراً ليعمل على هذه المحطة تحديداً، مع كتم كل شيء آخر.

3. تشبيه "الحساء السحري"

تخيل وعاءً من الحساء حيث وضعت فيه جزر وبازلاء ومعكرونة مختلطة معاً.

  • الذكاء الاصطناعي القديم: يحاول تخمين أي القطع هي الجزر عن طريق تذوق الوعاء بأكمله بشكل عشوائي.
  • MMAudioSep: يشبه طاهياً يعرف بالفعل تماماً كيف يكون طعم الجزر لأنه طبخ بها ملايين المرات. عندما تسلمه هذا الحساء المختلط وتقول له "ابحث عن الجزر"، فإنه لا يحتاج للتخمين؛ بل يستخدم معرفته العميقة بالجزر لتحديدها وسحبها فوراً، تاركاً البازلاء والمعكرونة خلفه.

4. الجزء الأفضل: لا يزال بإمكانه الطبخ!

عادةً، عندما تدرب نموذجاً للقيام بمهمة جديدة (مثل فصل الأصوات)، فإنه ينسى مهمته القديمة (صنع الأصوات). الأمر يشبه طاهياً تعلم غسل الأطباق جيداً لدرجة أنه نسي كيف يطبخ.

لكن MMAudioSep مميز. فحتى بعد تعلم فصل الأصوت، لم ينسَ كيف يولد الأصوات.

  • إذا أعطيته فيديو لعزف منفرد على الطبول بدون أي صوت، فإنه لا يزال بإمكانه ابتكار أصوات الطبول من الصفر.
  • إذا أعطيته فيديو لعزف منفرد على الطبول ومعه مزيج صوتي فوضوي، فإنه يستطيع فصل أصوات الطبول.

إنه "سكين سويسري" من الذكاء الاصطناعي. لم يفقد قدرته الأصلية، بل أضاف إليها قدرة جديدة.

لماذا يهم هذا؟

  • جودة أفضل: لأنه تعلم أولاً من كمية هائلة من بيانات الفيديو والصوت، فإنه يفهم "جو" الأصوات بشكل أفضل من النماذج التي تنظر فقط إلى الموجات الصوتية.
  • المرونة: يمكنك طلب الأصوات باستخدام النص أو الفيديو، مما يجعله سهل الاستخدام للغاية.
  • الكفاءة: لم يتم بناؤه من الصفر، بل وقف على أكتاف عملاق (نموذج توليد الصوت من الفيديو الأصلي) للقيام بشيء جديد.

باختصار: MMAudioSep هو ذكاء اصطناعي ذكي تعلم إنشاء الموسي التصويرية للأفلام أولاً، ثم استخدم تلك المعرفة الخبيرة ليصبح أفضل محقق صوت في العالم، القادر على اختيار أي ضجيج محدد من وسط حشد فوضوي بمجرد النظر إلى فيديو أو قراءة ملاحظة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →