← أحدث الأبحاث
💻 computer science

Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transfer

تقدم هذه الورقة بحث FlexiMMT، وهو أول إطار عمل ضمني لتحويل الصور إلى فيديو يتيح نقلًا دقيقًا للأجسام المتعددة والحركات المتعددة من خلال توظيف انتباه القناع المنفصل للحركة ونشر القناع المتمايز لمعالجة تشابك الحركة بين الأجسام بفعالية.

المؤلفون الأصليون: Yuze Li, Dong Gong, Xiao Cao, Junchao Yuan, Dongsheng Li, Lei Zhou, Yun Sing Koh, Cheng Yan, Xinyu Zhang

نُشر 2026-03-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuze Li, Dong Gong, Xiao Cao, Junchao Yuan, Dongsheng Li, Lei Zhou, Yun Sing Koh, Cheng Yan, Xinyu Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك صورة ثابتة لمشهد حديقة مزدحم: كلب يجلس، وشخص واقف، وقطة نائمة. الآن، تخيل أنك تريد تحويل هذه الصورة إلى فيديو حيث يبدأ الكلب في الركض، والشخص يبدأ في ممارسة اليوجا، والقطة تبدأ في القفز.

هذه هي المشكلة التي يحلها FlexiMMT.

قبل ظهور هذه التقنية الجديدة، كانت مولدات الفيديو بالذكاء الاصطناعي تشبه قادة الأوركسترا المرتبكين. إذا قلت لهم "اجعل الكلب يركض"، فإن المشهد بأكمله (الشخص، القطة، الأشجار) كان غالباً ما يبدأ في الركض أيضاً، أو يظل الكلب واقفاً بينما يقوم الشخص بممارسة اليوجا. لقد كانوا يعانون من أجل إعطاء تعليمات مختلفة لأشياء مختلفة في نفس الصورة.

FlexiMMM هو بمثابة مخرج فائق الدقة يمكنه النظر إلى صورتك، وتحديد شخصيات معينة منها، ومنح كل واحدة منها نصاً مختلفاً.

إليك كيف يعمل، مقسماً عبر تشبيهات بسيطة:

1. المشكلة: الفوضى "المتشابكة"

تخيل أنك تحاول تعليم ثلاثة أشخاص مختلفين (كلب، إنسان، وقطة) كيف يرقصون.

  • الذكاء الاصطناعي القديم: تصرخ "ارقصوا!"، فيمسك الثلاثة بأيدي بعضهم البعض ويبدأون في الدوران في دائرة كبيرة ومربكة. يحاول الكلب ممارسة اليوجا، والإنسان يحاول القفز، والقطة تحاول الركض. إنهم "متشابكون" — لا يستطيعون فصل حركاتهم.
  • الهدف: تريد أن يركض الكلب، وأن يمارس الإنسان اليوجا، وأن تقفز القطة، جميعهم في نفس الوقت، دون أن يصطدموا ببعضهم البعض.

2. الحل: "الأقنعة السحرية غير المرئية"

يقدم FlexiMMT خدعة ذكية تسمى Motion Decoupled Mask Attention (انتباه القناع المنفصل للحركة). فكر في هذا كمنح كل كائن في صورتك زوجاً من النظارات السحرية غير المرئية.

  • النظارات: عندما ينظر الذكاء الاصطناعي إلى "الكلب"، فإنه يرتدي نظارات تسمح له فقط برؤية فيديو "الركض" المرجعي. إنه يتجاهل فيديو "اليوجا" تماماً.
  • النتيجة: يرى الكلب فيديو الركض ويقلده. ويرى الإنسان فيديو اليوجا ويقلده. لا يرى كل منهم تعليمات الآخر، لذا لا يحدث ارتباك بينهم.

3. كيف يحدد الأجسام ( "كشاف الضوء")

للتأكد من أن الذكاء الاصطناعي يعرف أي جزء من الصورة هو الكلب وأي جزء هو الإنسان، فإنه يستخدم أداتين خاصتين:

  • الأداة أ: "كشاف التدريب" (DMEM): خلال مرحلة التعلم، يتعلم الذكاء الاصطناعي العثور على الأجسام من خلال النظر إلى "أفكاره" الداخلية (خرائط الانتباه). الأمر يشبه سؤال الذكاء الاصطناعي لنفسه: "مهلاً، أي البكسلات تتحدث عن الكلب؟" ثم يرسم مخططاً ذهنياً حولها. لا يحتاج إلى مساعد خارجي للقيام بذلك؛ بل يستنتج ذلك بنفسه.
  • الأداة ب: "الكشاف المطارد" (RMPM): بمجرد أن يبدأ الفيديو في الحركة، تتغير الأجسام وتتغير أشكالها. إذا نظر الذكاء الاصطناعي فقط إلى الإطار الأول، فقد يفقد تتبع الكلب عندما يقف. لذا، يستخدم FlexiMMM آلية Regressive Mask Propagation (انتشار القناع التراجعي).
    • التشبيه: تخيل أن الذكاء الاصطناعي يضع ملصقاً (Sticky Note) على الكلب في الإطار الأول. ومع بدء الفيديو، لا يكتفي بمجرد التخمين أين يذهب الكلب؛ بل "يطارد" سمات الكلب من إطار إلى إطار، ويقوم بتحديث الملصق باستمرار ليبقى ملتصقاً بالكلب، حتى أثناء ركضه أو قفزه أو دورانه.

4. دفعة السرعة "الديناميكية"

الذكاء الاصطناعي ذكي بما يكفي ليعرف متى لا يحتاج إلى بذل مجهود كبير.

  • التشبيه: تخيل أنك تقوم بطلاء جدار. في البالب، تحتاج إلى التحقق من عملك كل ثانية للتأكد من أن الخطوط مستقيمة. ولكن بمجرد أن يجف الطلاء ويتضح الشكل، لا تحتاج إلى التحقق كل ثانية بعد الآن.
  • يقوم FlexiMMM بهذا عبر وضع ديناميكي (Dynamic). بمجرد أن تصبح "الأقنعة" (مخططات الأجسام) مستقرة، يتوقف عن إعادة حسابها لكل إطار على حدة. هذا يجعل توليد الفيديو أسرع بكثير دون فقدان الجودة.

لماذا هذا مهم؟

  • سحر التركيب: يمكنك المزج والمطابقة. يمكنك أخذ فيديو "قفز" وفيديو "رقص" وتقول للذكاء الاصطناعي: "اجعل الكلب يقفز والقطة ترقص". أو اعكسهما: "اجعل القطة تقفز والكلب يرقص".
  • لا عمل يدوي: لست بحاجة إلى رسم الخطوط العريضة أو تتبع الأجسام بنفسك. الذكاء الاصطناعي يقوم بكل ذلك تلقائياً.
  • الواقعية: لأن الذكاء الاصطناعي يحافظ على استقلالية الأجسام، فإن الكلب لن يتحول بالخطأ إلى إنسان يمارس اليوجا. تظل الحركات وفية للشخصية المحددة.

باختصار

FlexiMMT هو أول ذكاء اصطناعي يمكنه النظر إلى صورة ثابتة تحتوي على شخصيات متعددة، ومنح كل شخصية نص فيديو مختلف، وتوجيههم لأداء حركاتهم الفريدة في وقت واحد، وكل ذلك دون أن يتعثروا ببعضهم البعض. إنه يحول رقصة جماعية فوضوية إلى عرض مصمم بدقة متناهية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →