← أحدث الأبحاث
💻 computer science

DeformMaster: An Interactive Physics-Neural World Model for Deformable Objects from Videos

إن DeformMaster هو نموذج عالم فيزيائي-عصبي تفاعلي يتعلم من فيديوهات العالم الحقيقي لمحاكاة الأجسام القابلة للتشوه عبر توحيد الديناميكيات الفيزيائية والمظهر عالي الدقة، مما يتيح التنبؤ المستقبلي الدقيق، وتوليد استجابات حركية جديدة، وتخليق مشاهد ديناميكية من زوايا رؤية مختلفة.

المؤلفون الأصليون: Can Li, Zhoujian Li, Ren Li, Jie Gu, Lei Lei, Jingmin Chen, Lei Sun

نُشر 2026-05-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Can Li, Zhoujian Li, Ren Li, Jie Gu, Lei Lei, Jingmin Chen, Lei Sun

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مقطع فيديو ليد تضغط على كرة ضغط إسفنجية، أو تسحب قطعة من القماش، أو تلتوي بلعبة مطاطية. والآن، تخيل أنك تريد تعليم الكمبيوتر ليس فقط "مشاهدة" ذلك الفيديو، بل "فهم" كيفية عمل هذا الجسم حتى تتمكن من سؤاله: "ماذا يحدث إذا سحبته بقوة أكبر؟" أو "ماذا لو ضغطت عليه من الجانب؟" أو حتى "أرني كيف يبدو من الخلف".

هذا هو بالضبط ما يفعله DeformMaster. إنه يحول فيديو بسيطًا إلى "توأم رقمي" تفاعلي لجسم مرن وقابل للتمدد يمكنك اللعب به في الوقت الفعلي.

إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: لماذا يعد هذا صعباً؟

معظم البرامج الحاسوبية التي تحاول محاكاة الأجسام اللينة (مثل القماش، الحبال، أو الهلام) تشبه الروبوتات الصلبة. فهي تتبع قواعد فيزيائية صارمة، لكن الحياة الواقعية فوضوية. قد يكون لقطعة قماش حقيقية طية غريبة، أو قد تكون لعبة مطاطية أكثر صلابة قليلاً في نقطة معينة من غيرها. إذا حاولت محاكاة هذا باستخدام رياضيات مثالية، فقد يبدو الأمر مزيفاً أو يتفكك. وإذا حاولت تعلمه من البيانات فقط (مثل ذكاء اصطناعي للألعاب)، فقد يرتبك ويبدأ في القيام بأشياء مستحيلة، مثل الطفو في الهواء.

2. الحل: فريق "الفيزياء + الذكاء الاصطناعي"

يحل DeformMaster هذه المشكلة باستخدام فريق مكون من شخصين لإدارة المحاكاة:

  • خبير الفيزياء (الأساس): هذا هو محرك فيزيائي قياسي وموثوق (مثل النوع المستخدم في ألعاب الفيديو) يعرف القواعد الأساسية لكيفية حركة الأشياء وتمددها وارتدادها. وهو يوفر أساساً مستقراً.
  • مساعد الذكاء الاصطناعي (المتبقي/التصحيحي): هذا عبارة عن شبكة عصبية (نوع من أنواع الذكاء الاصطناعي) تعمل كـ "طبقة تصحيحية". تراقب خبير الفيزياء وتقول له: "مهلاً، الفيديو الحقيقي يظهر التواء القماش بشكل مختلف قليلاً عما تتوقعه رياضياتك. دعني أضيف دفعة صغيرة هنا لإصلاح الأمر".

تخيل الأمر مثل نظام GPS. خبير الفيزياء هو الخريطة التي توضح الطرق الرئيسية، أما مساعد الذكاء الاصطناعي فهو السائق المحلي الذي يعرف الحفر، وأعمال البناء، والطرق المختصرة التي لا تظهرها الخريطة. معاً، يوصلانك إلى وجهتك بشكل مثالي.

3. التعامل مع "اليد" (المتحكم)

في الفيديو، هناك يد تلمس الجسم. لكن الكاميرات ليست مثالية؛ فتتبع اليد قد يكون مهتزاً أو متذبذباً.

  • الطريقة القديمة: إذا أخبرت المحاكاة أن تتحرك تماماً حيث توجد اليد المهتزة، فقد يهتز الجسم بعنف أو يتفكك.
  • طريقة DeformMaster: يستخدم شيئاً يسمى المشغلات الموزعة المتوافقة (Distributed Compliant Actuators). تخيل بدلاً من إصبع صلب واحد يدفع الجسم، أن لديك قفازاً ناعماً ووبرياً يوزع القوة بلطف على مساحة أوسع. هذا يقلل من حدة بيانات الكاميرا المهتزة ويدفع الجسم بشكل طبيعي، تماماً كما تفعل اليد الحقيقية.

4. التعامل مع المواد المختلفة (الخليط)

الأجسام الحقيقية ليست مصنوعة من مادة واحدة متجانسة. فقد يكون للدمية بطن ناعم ولكن أنف صلب.

  • الطريقة القديمة: تفترض العديد من النماذج أن الجسم بأكمله مصنوع من نفس المادة تماماً (مثل كتلة ضخمة من الجيلي).
  • طريقة DeformMaster: يستخدم خليطاً من الخبراء التكوينيين (Mixture of Constitutive Experts). فكر في هذا كـ "خلاط النكهات". يدرك أن جزءاً من الجسم قد يكون "Neo-Hookean" (مطاطي جداً)، بينما جزء آخر قد يكون "St. Venant-Kirchhoff" (أكثر صلابة). إنه يمزج هذه "النكهات" المختلفة من الفيزياء عبر سطح الجسم ليتطابق مع الفيديو الحقيقي تماماً.

5. النتيجة: ساحة لعب تفاعلية

بمجرد أن يتعلم DeformMaster من الفيديو، فإنه لا يقوم فقط بإعادة تشغيل الفيديو. بل ينشئ نموذج عالم (World Model).

  • أفعال جديدة: يمكنك أن تطلب منه سحب الجسم في اتجاه لم يظهره الفيديو الأصلي، وسيتنبأ بالنتيجة بشكل واقعي.
  • مواد جديدة: يمكنك أن تقول له: "اجعل هذا الجسم أنعم بـ 3 مرات"، وسيقوم بمحاكاة كيفية تصرف النسخة الأنعم (حتى لو أظهر تمزقاً أو تكسراً إذا سحبته بقوة).
  • زوايا رؤية جديدة: يمكنك أن تطلب رؤية الجسم من زاوية كاميرا لم تكن موجودة في الفيديو الأصلي، وسيقوم بعرض صورة عالية الجودة له.

ملخص

DeformMaster يشبه أخذ فيديو للعبة مطاطية وتحويله إلى مستوى لعبة فيديو تفاعلي ودقيق فيزيائياً. إنه يجمع بين موثوقية قواعد الفيزياء ومرونة الذكاء الاصطناعي للتعامل مع تفاصيل العالم الحقيقي الفوضوية، مما يسمح لك بالتفاعل مع الجسم بطرق لم ترها من قبل.

ما تدعيه الورقة البحثية فعلياً:

  • يعمل على فيديوهات حقيقية للحبال، الأقمشة، والألعاب اللينة.
  • أكثر دقة في التنبؤ بالحركات المستقبلية وعرض الصور من الطرق السابقة (مثل PhysTwin أو Spring-Gaus).
  • يسمح بـ "عمليات تشغيل طويلة الأمد" (long-horizon rollouts)، مما يعني أنه يمكنك محاكاة حركة الجسم لفترة طويلة دون أن ينحرف عن مساره الصحيح ويصبح غير منطقي.
  • يدعم تغيير خصائص المادة (مثل جعل الأشياء أنعم) ومشاهدتها من زوايا جديدة.
  • يعمل بسرعات تفاعلية (أكثر من 15 إطاراً في الثانية)، مما يسمح بالتحكم في الوقت الفعلي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →