ViPS: Video-informed Pose Spaces for Auto-Rigged Meshes
يُعد ViPS إطار عمل بنظام التغذية الأمامية يتعلم فضاء وضعيات صالحاً وقابلاً للتحكم للنماذج ثلاثية الأبعاد ذات الهياكل العظمية التلقائية، وذلك عبر استخلاص المعارف الحركية المسبقة من نماذج انتشار الفيديو مسبقة التدريب، مما يتيح تعميماً صفرياً للعمل على أصول متنوعة دون الحاجة إلى بيانات تدريب رباعية الأبعاد نادرة من صنع الفنانين.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك دمية رقمية (شخصية ثلاثية الأبعاد) تريد تحريكها. في الأيام الخوالي، كان على المحركين بناء "هيكل عظمي" داخل الدمية، ثم قضاء ساعات في تحديد أي المفاصل يمكن أن تنثني، وإلى أي مدى يمكن أن تلتوي، وما هي مجموعات الحركات التي تبدو طبيعية. إذا ثنيت الركبة للخلف أكثر من اللازم، فستبدو وكأنها انكسرت مثل غصن جاف. وإذا لويت الرقبة أكثر من اللازم، فقد يخترق الرأس الجسد. كانت عملية مرهقة تعتمد على التجربة والخطأ اليدوي.
ViPS (فضاءات الوضع المستوحاة من الفيديو) تشبه منح تلك الدمية الرقمية "ذاكرة عضلية" وعقلاً يمتلك "حساً عاماً"، بحيث تعرف كيف تتحرك بشكل طبيعي دون الحاجة إلى تدخل بشري لإدارة كل مفصل بدقة.
إليك كيف يعمل ذلك، مقسماً عبر تشبيهات بسيطة:
1. المشكلة: الدمية "الخرقاء"
فكر في هيكل ثلاثي الأبعاد قياسي كأنه دمية متحركة بخيوط مرتخية. يمكنك سحب الخيوط لجعلها تتحرك، ولكن إذا سحبتها بقوة، فقد تتفكك الدمية أو تبدو كأنها لاعب سيرك مشوه في كابوس.
- المشكلة: الحواسيب لا تدرك بطبيعتها أن ركبة الإنسان لا ينبغي أن تنثني للخلف، أو أن ذيل الكلب لا ينبغي أن ينقطع. بدون دليل، تبدو الحركات العشوائية مكسورة وغير طبيعية.
2. الحل: التعلم من فيلم
بدلاً من تعليم الكمبيوتر قواعد مثل "الركب تنثني للأمام فقط"، تقوم ViPS بتعليم الكمبيوتر من خلال إطلاعه على الأفلام.
- التشبيه: تخيل أنك تريد تعليم روبوت كيفية الرقص. بدلاً من إعطائه دليلاً حول التشريح، تعرض عليه 10,000 ساعة من مقاطع الفيديو لأشخاص يرقصون، يركضون، ويقفزون. يشاهد الروبوت ويتعلم: "أوه، عندما يرفع الشخص ساقه، تتحرك وركه بهذه الطريقة، وتتحرك ذراعه بتلك الطريقة".
- السحر: تستخدم ViPS مولداً قوياً للفيديو يعمل بالذكاء الاصطناعي (مثل تلك التي تصنع أفلام الذكاء الاصطناعي) كمعلم. يشاهد مقاطع فيديو لحيوانات وأشياء تتحرك ويسأل نفسه: "ما هو الشكل الواقعي للوضعية؟".
3. "فضاء الوضع": ملعب آمن
بمجرد أن يشاهد الذكاء الاصطناعي كل تلك الفيديوهات، فإنه يبني "فضاء وضع" (Pose Space).
- التشبيه: تخيل ملعباً ضخماً غير مرئي لدميتك.
- الأرض: هي "المنطقة الآمنة". إذا وقفت الدمية في أي مكان على هذه الأرض، فستبدو طبيعية وسليمة تشريحياً.
- المنحدر: إذا حاولت تحريك الدمية إلى وضعية مستحيلة (مثل دوران الرأس 360 درجة)، فستسقط من المنحدر إلى "منطقة العبث".
- كيف تساعد ViPS: إن ViPS هي خريطة هذا الملعب. فهي تخبرك بالضبط أين توجد الأرض الآمنة لأي شخصية تعطيها إياها، سواء كانت بشراً، أو تنيناً، أو كائناً فضائياً غريباً لم تره من قبل.
4. كيف يعمل (عملية "التقطير")
يسمي البحث هذه العملية "تقطير المعرفة المسبقة من الفيديو" (distilling video priors).
- التشبيه: فكر في طاهٍ ماهر (ذكاء اصطناٍء اصطناعي للفيديو) يصنع حساءً مثالياً. لا يمكنك مجرد إعطاء الحساء للطالب؛ بل يجب عليك تعليمه "الوصفة". تأخذ ViS "نكهة" معرفة ذكاء الفيديو الاصطناعي وتقطرها في وصفة بسيطة وموجزة (نموذج رياضي) يتناسب مع هيكل ثلاثي الأبعاد قياسي.
- النتيجة: لا تحتاج إلى قاعدة بيانات ضخمة من الرسوم المتحركة ثلاثية الأبعاد (التي يصعب صنعها). أنت فقط بحاجة إلى "الحس العام" لذكاء الفيديو حول كيفية تحرك الأشياء.
5. لماذا يعد أمراً بالغ الأهمية
- التعلم من الصفر (تأثير الحرباء): عادةً، إذا دربت روبوتاً على المشي، فسيتمكن من المشي فقط. إذا أعطيته حيواناً جديداً (مثل الزرافة)، فسيفشل. ViPS تشبه الحرباء؛ يمكنك تزويدها بنموذج ثلاثي الأبعاد لمخلوق لم يره في بيانات تدريبه من قبل (مثل تنين خيالي)، وسوف يستنتج فوراً كيف يجب أن يتحرك ذلك التنين بناءً على أنماط الفيديو التي تعلمها.
- زر "التعديل": تخيل أنك تريد تحريك يد شخصية لتلوح. في الأنظمة القديمة، قد يؤدي تحريك اليد إلى التواء المرفق بشكل غريب. مع ViPS، ما عليك سوى تحريك اليد، وسيقوم الذكاء الاصطناعي تلقائياً بتعديل الكتف والجذع لجعل الحركة بأكملها تبدو سلسة وطبيعية، تماماً كما يفعل البشر. إنه يشبه امتلاك مساعد ذكي يصلح أخطاءك فوراً.
- إغلاق الحلقة: يمكنها أيضاً العمل بشكل عكسي. يمكنك أن تطلب من الذكاء الاصطناعي: "اصنع فيديو لدب يركض"، وستقوم ViPS بإنشاء حركات الهيكل العظمي ثلاثية الأبعاد المثالية أولاً، ثم تستخدم تلك الحركات لتوجيه مولد الفيديو. هذا يضمن أن يبدو الفيديو واقعياً من الناحية الفيزيائية.
ملخص
ViS P هي أداة تأخذ "الحس العام" لكيفية تحرك الأشياء من خلال مشاهدة ملايين الفيديوهات، وتضعها في دليل بسيط للشخصيات ثلاثية الأبعاد. إنها تسمح للمحركين والمبدعين بجعل الشخصيات تتحرك بشكل طبيعي، وإصلاح الوضعيات المكسورة تلقائياً، وتحريك مخلوقات لم يروها من قبل، كل ذلك دون الحاجة إلى رسم كل إطار يدوياً أو كتابة قواعد معقدة. إنها تحول الدمية المتصلبة والخرقاء إلى ممثل رقمي حي ينبض بالحياة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.