PhyCo: Learning Controllable Physical Priors for Generative Motion
إن PhyCo هو إطار عمل يوسع نماذج انتشار الفيديو بحركات قابلة للتحكم ومتسقة فيزيائياً من خلال مجموعة بيانات محاكاة ضخمة، والضبط الدقيق الخاضع للإشراف الفيزيائي باستخدام ControlNet، وتحسين المكافأة الموجه بواسطة نماذج اللغة والرؤية (VLM) لتوليد سلوكيات فيزيائية واقعية دون الحاجة إلى أجهزة محاكاة أو إعادة بناء هندسي أثناء الاستنتاج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تشاهد فيلماً تظهر فيه كرة ترتد، أو صندوق ينزلق، أو شخص يقفز على ترامبولين. في معظم الفيديوهات التي ينتجها الذكاء الاصطناعي اليوم، غالباً ما تبدو هذه الحركات "خاطئة". قد تطفو الكرة كأنها شبح، أو ترتد بطاقة خاطئة، أو تنزلق فوق الأرض كما لو كانت مصنوعة من الجليد، رغم أنه ينبغي أن تكون مطاطية. الذكاء الاصطناعي بارع جداً في جعل الأشياء "تبدو" صحيحة (الألوان، الإضاءة)، لكنه لا يفهم تماماً كيف تتحرك الأشياء وفقاً لقوانين الفيزياء.
PhyCo هو نظام جديد تم تطويره لإصلاح ذلك. فكر فيه كأنه إعطاء الذكاء الاصطناعي "ورقة غش فيزيائية" لتمكينه من إنتاج فيديوهات تتصرف فيها الأشياء تماماً كما ينبغي لها في العالم الحقيقي.
إليك كيف يعمل PhyCo، مقسماً إلى ثلاث خطوات بسيطة:
1. معسكر التدريب (مجموعة البيانات)
قبل أن يتمكن PhyCo من تعليم أي شيء للذكاء الاصطناعي، يجب أن يتعلم أولاً قواعد اللعبة نفسها. قام الباحثون بإنشاء مكتبة ضخمة من 100,000 فيديو محاكى.
- التشبيه: تخيل صالة ألعاب رياضية ضخمة حيث تتدرب الروبوتات على السقوط، والقفز، والانزلاق. في هذه القاعة، يمكن للباحثين تعديل "مقابض" كل كائن. يمكنهم جعل الكرة شديدة الارتداد، أو الأرضية شديدة الانزلاق، أو الجدار شديد النعومة.
- النتيجة: يشاهد الذكاء الاصطناعي هذه الفيديوهات ويتعلم أن "إذا رفعت مقبض 'الاحتكاك'، فإن الكائن سينزلق بشكل أقل" أو "إذا رفعت مقبض 'التشوه'، فإن الكائن سينضغط أكثر". هذا يخلق قاعدة بيانات ضخمة من علاقات السبب والنتيجة.
2. لوحة التحكم (ControlNet)
بمجرد أن يشاهد الذكاء الاصطناي فيديوهات التدريب، يمنحه الباحثون لوحة تحكم خاصة.
- التشبيه: فكر في لعبة فيديو حيث يمكنك رسم خريطة على الشاشة لتخبر الشخصية إلى أين تذهب. مع PhyCo، يمكنك رسم "خريطة" للخصائص الفيزيائية. يمكنك تلوين بقعة على الشاشة لتقول: "هذه المنطقة لزجة" أو "هذا الكائن ثقيل".
- كيف يعمل: يأخذ الذكاء الاصطناعي هذه الخرائط ويستخدمها لإنشاء الفيديو. بدلاً من مجرد التخمين حول كيفية حركة الكائن، فإنه ينظر إلى خريطتك ويقول: "حسناً، لقد أخبرتني أن الاحتكاك هنا عالٍ، لذا سأجعل الكائن ينزلق ببطء". هذا يتيح التحكم المستمر، مما يعني أنه يمكنك رفع الاحتكاك أو خفضه بسلاسة، وليس فقط تشغيله أو إيقافه.
3. المدرب الصارم (تحسين المكافأة عبر نموذج الرؤية واللغة - VLM)
حتى مع وجود لوحة التحكم، قد يرتكب الذكاء الاصطناعي بعض الأخطاء الصغيرة. ولإصلاح ذلك، أضاف الباحثون "مدرباً صارماً".
- التشبيه: تخيل مدرباً يراقب فيديوهات تدريب الذكاء الاصطناعي ويوجه أسئلة محددة: "هل قفزت هذه الكرة عالياً بما يكفي؟" "هل انزلق هذا الصندوق مسافة كافية؟" إذا أجاب الذكاء الاصطناعي بشكل غير صحيح، يمنحه المدرب "عقاباً" (جزاءً رياضياً) لتصحيح سلوكه.
- السحر: هذا المدرب هو نموذج رؤية ولغة (VLM). هو لا ينظر فقط إلى البكسلات؛ بل يفهم "مفهوم" الفيزياء. إنه يقرأ الفيديو ويتحقق مما إذا كانت الحركة تطابق القواعد التي وضعتها. إذا قفزت الكرة منخفضة جداً رغم أنك طلبت قفزة عالية، يخبر المدرب الذكاء الاصطناعي أن يحاول مرة أخرى. مع مرور الوقت، يتعلم الذكاء الاصطناعي كيفية إرضاء المدرب، مما يؤدي إلى إنتاج فيديوهات ليست جميلة بصرياً فحسب، بل صحيحة فيزيائياً أيضاً.
ماذا يمكن لـ PhyCo أن يفعل؟
يُظهر العمل أن PhyCo يمكنه التعامل مع ما يلي:
- الاحتكاك: جعل الأشياء تنزلق بسهولة أو تلتصق بالأرض.
- الارتداد (المرونة): جعل الأشياء ترتد مثل كرة مطاطية أو تسقط بثقل مثل حجر.
- التشوه: جعل الأشياء اللينة تنضغط وتعود لشكلها، بينما تظل الأشياء الصلبة صلبة.
- القوة: دفع الأشياء في اتجاهات محددة بقوة محددة.
الفوز الكبير
الأمر الأكثر إثارة للإعجاب هو أن PhyCo تعلم كل هذا في عالم محاكى (صالة الألعاب الرياضية)، ومع ذلك فهو يعمل بنفس الكفاءة في العالم الحقيقي. يمكنك أن تطلب منه إنشاء فيديو لشخص يقفز على ترامبولين، ورغم أنه لم يرَ ترامبولين حقيقية أثناء التدريب، إلا أنه يعرف بالضبط كيف يجب أن يتشوه الترامبولين وكيف يجب أن يقفز الشخص لأنه تعلم مبادئ الفيزياء.
باختختصار، يعلم PhyCo الذكاء الاصطناعي التوقف عن التخمين حول كيفية تحرك العالم والبدء في فهم القواعد التي تحكمه، حتى نتمكن من إنشاء فيديوهات تكون فيها الفيزياء واقعية بقدر واقعية الصور.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.