ALIVE: Animate Your World with Lifelike Audio-Video Generation
يُعد ALIVE نموذجاً من الجيل الجديد يعمل على تطويع بنيات "النص إلى الفيديو" سابقة التدريب إلى إطار عمل موحد قادر على توليد فيديو وصوت من النص، وتوليد فيديو وصوت من مرجع (رسوم متحركة) بجودة عالية، وذلك من خلال بنية MMDiT مُعززة ومسار بيانات متخصص.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك قضيت سنوات تشاهد أفلاماً حيث يتناغم فيها الصوت والصورة بشكل مثالي—صوت قرمشة خطوة على الحصى، أو الطريقة التي تتحرك بها شفاه الشخصية تماماً مع كلماتها، أو تصاعد الموسيقى أثناء مشهد الغروب. الآن، تخيل أنك تحاول تعليم كمبيوتر ليس فقط أن "يشاهد" فيلماً، بل أن "يخرجه" من الصفر، حيث يبتكر كلاً من "العينين" (الفيديو) و"الأذنين" (الصوت) في الوقت ذاته وبدقة متناهية.
هذا هو ما حققه فريق ALIVE في شركة ByteDance. إليك تفصيل هذا الإنجاز:
١. المشكلة: معاناة "الفيلم الصامت"
حتى الآن، كانت معظم نماذج توليد الفيديو بالذكاء الاصطناعي تشبه مخرجي الأفلام الصامتة. لقد كانت بارعة في صنع صور جميلة، ولكن إذا أردت صوتاً، كان عليك استئجار "مهندس صوت" آخر (ذكاء اصطناعي منفصل) للقيام بذلك. المشكلة؟ لم يكن هذان الذكاءان يتواصلان مع بعضهما البعض. كنت تحصل على فيديو لشخص يتحدث، لكن الصوت قد يأتي بعد ثانية من الكلام، أو قد يكون الشخص يأكل شطيرة بينما يبدو الصوت وكأنه يصرخ في وادٍ سحيق. كان الأمر يبدو "غير طبيعي" ومزيفاً.
٢. الحل: "المايسترو المايسترو" (ALIVE)
بدلاً من وجود عاملين منفصلين، بنى الباحثون ALIVE، وهو "مايسترو" واحد محترف.
فكر في ALIVE مثل قائد أوركسترا محترف. القائد لا يكتفي فقط بإخبار عازفي الكمان بالعزف وإخبار الطبالين بضرب الطبول؛ بل يضمن أن لحن الكمان يصيب اللحظة التي تلمس فيها عصا الطبل الجلد تماماً. يستخدم ALIVE "إيقاعاً" رياضياً خاصاً (يسمونه UniTemp-RoE) يعمل بمثابة "بندول ضبط" (Metronome) مشترك. وهذا يضمن أن "النبضة البصرية" و"النبضة الصوتية" مقيدتان معاً في الزمن.
٣. السر الخفي: "معسكر التدريب النهائي"
لجعل هذا المايسترو ذكياً، لم يكن بإمكانهم مجرد عرض مقاطع عشوائية من يوتيوب عليه. لقد بنوا "معسكراً تدريبياً" ضخماً وعالي التقنية (خط معالجة البيانات الخاص بهم).
- محقق الهوية: في العديد من الفيديوهات، يتحدث عدة أشخاص في آن واحد. معظم أنظمة الذكاء الاصطناعي ترتبك وتعطي صوت الشخص (أ) للشخص (ب). لذا، بنى فريق ALIVE نظام "محقق" يراقب حركات الشفاه ويستمع إلى الأصوات لضمان تخصيص كل كلمة للوجه الصحيح.
- مدرب الجماليات: لم يكن هدفهم مجرد الحصول على أي فيديو؛ بل أرادوا فيديوهات "سينمائية". لقد غدوا الذكاء الاصطناعي بنظام غذائي خاص من البيانات "عالية الجمالية"—فيديوهات ذات إضاءة رائعة، وألوان مثالية، وزوايا كاميرا احترافية—ليتعلم الذكاء الاصطناعي كيف يكون فناناً، وليس مجرد مصور كاميرا.
٤. "الممثل الرقمي" (Role-Playing Animate)
من أروع الميزات هي ما يسمونه "التمثيل الدورِي المتحرك" (Role-Playing Animate).
تخيل أن لديك صورة واحدة لصديقك. مع ALIVE، يمكنك إعطاء الذكاء الاصطناعي تلك الصورة وتقول له: "اجعل هذا الشخص يمشي عبر غابة ممطرة وهو يتذمر من الطقس".
عادةً، يقوم الذكاء الاصطناعي بمجرد "نسخ ولصق" الوجه على جسد متحرك، مما يجعله يبدو كملصق يتحرك على الشاشة. لكن ALIVE أكثر ذكاءً؛ فهو يفهم "الهوية". الأمر يشبه إعطاء الذكاء الاصطناعي قناعاً يناسب الوجه تماماً، مما يسمح للشخصية بالحركة، والتعبير عن المشاعر، والتحدث بشكل طبيعي مع الحفاظ على مظهر الشخص الموجود في الصورة تماماً.
ملخص: لماذا يهم هذا؟
ينقلنا ALIVE من مرحت "مقاطع الذكاء الاصطناست" إلى مرحلة "عوالم الذكاء الاصطناعي". إنه الفرق بين النظر إلى صورة متحركة وبين الخطو داخل مشهد حي ينبض بالحياة، حيث يمكنك رؤية الضوء يضرب الكأس وسماع صوت ارتطام الثلج في اللحظة ذاتها تماماً.
باخت mel: ALIVE لا يولد الفيديو فحسب؛ بل يبث فيه الحياة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.