InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
تقدم هذه الورقة البحثية InstructAV2AV، وهو أول إطار عمل متكامل (end-to-end) للتحرير المشترك للصوت والفيديو الموجه بالتعليمات، والذي يستفيد من مجموعة بيانات ضخمة تم إنشاؤها حديثاً (InsAVE-80K) واستراتيجية تدريب متخصصة مكونة من مرحلتين للتفوق على الأساليب الحالية في إنشاء محتوى مُحرر عالي الجودة ومتزامن.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك فيديو منزلياً لصديق يلقي خطاباً. الآن، تخيل أنك تريد تغيير ما يقوله، أو حتى استبداله بشخص آخر تماماً، لكنك تريد أن تظل الضوضاء في الخلفية، والإضاءة، والتوقيت طبيعية تماماً.
عادةً ما يكون تحرير الفيديو وتحرير الصوت وظيفتين منفصلتين. إذا قمت بتغيير الفيديو، فغالباً ما يختل التزامن بين الصوت والصورة أو يبدو الصوت غريباً (مثل التعليق الصوتي الذي لا يتطابق مع حركة الشفاه). تقدم هذه الورقة البحثية InstructAV2AV، وهي أداة جديدة تتعامل مع الفيديو والصوت كحزمة واحدة لا تتجزأ. تعطيها أمراً نصياً بسيطاً، فتقوم بإعادة كتابة كل من الصورة والصوت معاً، وبشكل فوري.
إليك كيف يعمل الأمر، مقسماً إلى مفاهيم بسيطة:
1. "الوصفة السحرية" (مشكلة البيانات)
لتعليم الكمبيوتر القيام بذلك، تحتاج إلى آلاف الأمثلة من فيديوهات "قبل" و"بعد". لكن لا أحد يملك مكتبة من الفيديوهات حيث يقول شخص ما "مرحباً" ثم يتحول سحرياً ليقول "وداعاً" بينما تظل الخلفية كما هي.
قام المؤلفون ببناء مصنع بيانات (يسمى InsAVE-80K). فكر في هذا الأمر كأنه مطبخ عالي التقنية:
- أخذوا فيديوهات خام من الإنترنت.
- استخدموا "روبوت طباخ موجه بالأقنعة" لقص أجزاء محددة (مثل وجه شخص أو سيارة).
- استخدموا الذكاء الاصطناعي لتوليد صوت وفيديو جديدين لتلك الأجزاء المحددة بناءً على تعليمات نصية (على سبيل المثال: "غير الرجل إلى امرأة").
- ثم أعادوا هذه الأجزاء الجديدة إلى الفيديو الأصلي، مع ترك الخلفية دون تغيير.
- وأخيراً، جعلوا البشر وأجهزة كمبيوتر ذكية يقومون باختبار تذوق النتائج للتأكد من أنها تبدو وتسمع بشكل واقعي. وقد خلق هذا كتاب طهي ضخم يحتوي على 80,000 مثال للتدريب.
2. "المحرر الذكي" (النموذج)
جوهر النظام هو دماغ ثنائي المسار. تخيل قائد أوركسترا يقود أوركسترين في وقت واحد: واحدة للمشهد البصري (الفيديو) والأخرى للصوت (الصوت).
- المرساة: عندما تطلب تعديلاً، لا يقوم النظام بمجرد التخمين. بل ينظر إلى الفيديو والصوت الأصليين كـ "مرساة أمان" لضمان عدم تغيير السماء أو الأشجار أو ضوضاء الخلفية عن طريق الخطأ.
- التعليمات: تكتب أمراً مثل: "غير الرجل إلى امرأة شابة ذات شعر بني تقول 'أعتقد أننا يجب أن نحاول مرة أخرى'".
- الانتباه المبوب (SIGA): هذا هو السر الخفي للورقة البحثية. تخيل مفتاح خافت للإضاءة أو إشارة مرور لكل لحظة في الفيديو.
- إذا كانت الإشارة حمراء، يقول النظام: "حافظ على الفيديو/الصوت الأصلي تماماً كما هو" (للحفاظ على الخلفية).
- إذا كانت الإشارة خضراء، يقول: "غير هذا الجزء ليتناسب مع التعليمات".
- يضبط هذا المفتاح نفسه تلقائياً، بحيث يعرف النظام بالضبط ما الذي يجب تغييره وما الذي يجب تركه دون تغيير، مما يضمن تطابق الصوت الجديد مع الوجه الجديد تماماً.
3. "الرقصة ذات الخطوتين" (استراتيجية التدريب)
تعليم الكمبيوتر تحرير الفيديو والصوت في آن واحد أمر صعب. إذا حاولت تعليمه كل شيء دفعة واحدة، فسيصاب بالارتباك.
يستخدم المؤلفون استراتيجية تدريب مكونة من مرحلتين:
- الخطوة 1 (التدريب المنفرد): أولاً، يعلمون جزء الفيديو كيفية التحرير، وجزء الصوت كيفية التحرير، بشكل منفصل. يتعلم كل منهما حركاته الخاصة دون القلق بشأن الآخر.
- الخطوة 2 (الدويتو/الثنائي): بمجرد أن يصبحوا جيدين في العزف المنفرد، يتم تعليمهم الرقص معاً. يتعلمون التزامن بشكل مثالي، بحيث عندما يظهر الفيديو محرك سيارة يبدأ بالعمل، يعمل الصوت بضجيج المحرك في نفس الميلي ثانية تماماً.
ماذا يمكنه أن يفعل؟
تستعرض الورقة البحثية أربعة "حركات" رئيسية باستخدام التعليمات النصية فقط:
- تبديل الهوية: تغيير رجل إلى امرأة (أو العكس) مع الحفاظ على الصوت وحركة الشفاه المتزامنة.
- إعادة كتابة الكلام: الحفاظ على وجه الشخص وصوته، ولكن تغيير الكلمات التي يقولها إلى شيء جديد.
- الإدراج: إضافة جسم جديد (مثل سيارة كلاسيكية تمر بجانب الطريق) وتوليد صوت المحرك المطابق لها.
- الإزالة: مسح جسم ما (مثل سنجاب على صخرة) وإسكات صوته، مما يجعله يبدو وكأنه لم يكن موجوداً قط.
الخلاصة
باختصار، InstructAV2AV هو أول نظام يسمح لك بتحرير قصة الفيديو والموسيقى التصويرية الخاصة به في وقت واحد باستخدام مجرد أمر نصي. إنه لا يكتفي بلصق صوت جديد فوق فيديو قديم؛ بل يفهم أنه إذا غيرت المرئي، يجب أن يتغير الصوت أيضاً، وإذا غيرت الصوت، يجب أن يتطابق المرئي معه. يفعل ذلك من خلال التعلم من مكتبة ضخمة صنعها بنفسه، وباستخدام "مفتاح خافت" ذكي لتقرير ما يجب الحفاظ عليه وما يجب تغييره بالضبط.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.