MotionWeaver: Holistic 4D-Anchored Framework for Multi-Humanoid Image Animation
يُعد MotionWeaver إطار عمل متكاملًا يتغلب على قيود الأساليب الحالية لتحريك الصور ذات الشخص الواحد من خلال تقديم تمثيلات حركة موحدة ونموذج شمولي مرتكز على البعد الرابع (4D) لتحقيق نتائج رائدة في سيناريوهات متعددة البشر معقدة تتضمن أشكالاً متنوعة وتفاعلات وعوائق.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك مخرج تحاول تصوير فيلم بطاقم من الشخصيات. بعضهم بشر، وبعضهم آليون (روبوتات)، وبعضهم حيوانات كرتونية. لديك صورة لكل شخصية وفيديو يوضح كيف تريدهم أن يتحركوا. هدفك هو جعل الصور تنبض بالحياة لترقص، أو تقاتل، أو تتعانق تماماً مثل الفيديو، حتى عندما يصطدمون ببعضهم البعض أو يختبئ أحدهم خلف الآخر.
لفترة طويلة، كانت الحواسيب بارعة في تحريك شخص واحد. ولكن بمجرد إضافة شخص ثانٍ، أو روبوت، أو كائن فضائي، كان الحاسوب يرتبك؛ فإما أن يخلط بين الهويات، أو يجعلهم يمرون عبر بعضهم البعض كالأشباح.
هنا يأتي دور MotionWeaver. فكر فيه كأنه محرك دمى ماهر يمكنه التعامل مع فرقة كاملة من الشخصيات المختلفة في وقت واحد دون أن تتشابك خيوطه. وإليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:
١. المشكلة: "أزمة الهوية"
تخيل أن لديك راقصين، أليس وبوب. في البرامج الحاسوبية القديمة، إذا قلت للحاسوب "اجعل أليس تؤدي رقصة بوب"، فقد يرتبك الحاسوب لأنه كان يعتمد على شكل الجسد لتحديد من هو الشخص.
- الطريقة القديمة: كانت تشبه محاولة التعرف على صديق من خلال طوله فقط. إذا تبادل شخص طويل وشخص قصير الأماكن، يضيع الحاسوب.
- الطريقة الجديدة (MotionWeaver): هي تفصل بين خطوات الرقص وبين الراقص. فهو يدرك: "أوه، هذه هي الخطوات، وهذا هو وجه أليس. سأعطي وجه أليس هذه الخطوات". لا يهمه ما إذا كانت أليس بشراً، أو روبوتاً، أو تنيناً؛ هو فقط يعرف كيف يحرك الشخصية المحددة.
٢. السر الخفي: "الخريطة رباعية الأبعاد"
معظم مولدات الفيديو تعمل بنظام ثنائي الأبعاد (صور مسطحة) والزمن. وهي لا تفهم العمق حقاً.
- التشبيه: تخيل رسماً ثنائياً الأبعاد لشخصين يتعانقان. من الأمام، لا يمكنك معرفة من في الأمام ومن في الخلف. قد يقوم الحاسوب ثنائي الأبعاد برسمهما ككتلة واحدة مندمجة.
- خدعة MotionWeaver: هو يبني خريطة رباعية الأبعاد (فضاء ثلاثي الأبعاد + زمن). هو يفهم أن "الشخص (أ) موجود خلف الشخص (ب)".
- يستخدم مستشعراً خاصاً للعمق (يسمى Hyper-Scene Integrator) يعمل مثل نظارات ثلاثية الأبعاد للحاسوب.
- عندما يتقاطع مسار شخصيتين، يعرف الحاسوب بالضبط من يجب أن يكون مرئياً ومن يجب أن يكون مخفياً، تماماً كما يحدث في الحياة الواقعية.
٣. التدريب: "مدرسة الرقص"
لتعليم هذا الحاسوب أن يكون بهذا الإتقان، لم يكتفِ المؤلفون باستخدام فيديوهات يوتيوب لأشخاص يرقصون فحسب، بل بنوا مدرسة رقص ضخمة ومخصصة تسمى MultiHuman46.
- مجموعة البيانات: جمعوا ٤٦ ساعة من الفيديوهات التي تظهر أشخاصاً (وشخصيات تم إنشاؤها بالذكاء الاصطناعي) يتفاعلون، ويتقاتلون، ويرقصون معاً.
- الاختبار المعياري: أنشأوا اختباراً يسمى DualDynamics يحتوي على ٣٠٠ فيديو لتفاعل شخصيتين. إنه بمثابة امتحان نهائي حيث يتعين على الحاسوب إثبات قدرته على التعامل مع الحركات المعقدة دون أن تختل الشخصيات أو تتبدل هوياتها.
٤. عملية التعلم: "الدرس ذو المرحلتين"
يتعلم الحاسوب في مرحلتين متمايزتين، تماماً كما يتعلم الإنسان الرسم:
١. الصورة الكبيرة (الضجيج العالي): في بداية التعلم، يركز الحاسوب على الأشكال الكبيرة وترتيب الأشياء. "من يقف أين؟ ومن يحجب من؟" هو يتعلم الاحتجاب (من في المقدمة) أولاً.
٢. التفاصيل (الضجيج المنخفض): لاحقاً، يركز على التفاصيل الدقيقة للحركة. "كيف ينثني الذراع؟ كيف تستقر القدم؟"
لماذا يهمنا هذا؟
قبل MotionWeaver، إذا أردت تحريك مشهد لروبوت يقاتل فارساً، كان عليك القيام بذلك إطاراً تلو الآخر يدوياً، وهو أمر يستغرق وقتاً طويلاً جداً.
- MotionWeaver يسمح لك برفع صورة لروبوت وصورة لفارس، ثم عرض فيديو له، وسيقوم فوراً بإنشاء فيديو حيث يتقاتل الروبوت والفارس بشكل واقعي، مع احترام من يقف خلف من، دون أن يتحول الروبوت إلى إنسان أو يختفي الفارس.
باختصار:
MotionWeaver هو بمثابة مترجم عالمي للحركة. هو يأخذ "لغة" الحركة (كيف تتحرك الأشياء في الفضاء ثلاثي الأبعاد) ويعلمها لأي شخصية، سواء كانت بشراً، أو روبوتاً، أو وحشاً كرتونياً، مما يضمن عدم فقدان هويتهم أبداً ومعرفتهم الدقيقة بمن يقف أمام من. إنه يحول الفوضى العارمة لتحريك الشخصيات المتعددة إلى أداء متناسق وسلس.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.