← أحدث الأبحاث
💻 computer science

DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding

يقدم DiMo إطار عمل انتشار منفصل موحد يوسع النمذجة المقنعة لتشمل فهم وتوليد الحركة والنص ثنائي الاتجاه، مما يتيح مقايضات مرنة بين الجودة وزمن الاستجابة ومهام حركة متنوعة من خلال صقل الرموز التكراري، وتكميم المتجهات المتبقية، وتحسين السياسة النسبية للمجموعات.

المؤلفون الأصليون: Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

نُشر 2026-02-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك دفتر رسم سحري وعملاق. في الماضي، إذا أردت رسم شخص يرقص بناءً على وصف، أو كتابة قصة بناءً على فيديو رقص، كان عليك استخدام دفترين مختلفين، أو دفتر واحد صارم للغاية لا يمكنه إلا الرسم بضربة واحدة في كل مرة، من اليسار إلى اليمين. وإذا ارتكبت خطأً في الضربة الأولى، فإن الصورة بأكملها ستكون محكومة بالفشل، ولم يكن بإمكانك العودة بسهولة لإصلاح الخطأ دون البدء من جديد.

DiMo هو نوع جديد من "دفاتر الرسم الذكية" التي تغير القواعد. إنه نظام واحد يمكنه القيام بشيئين في وقت واحد:

  1. يقرأ وصفاً ويرسم الحركة (من النص إلى الحركة - Text-to-Motion).
  2. يشاهد حركة ويكتب وصفاً (من الحركة إلى النص - Motion-to-Text).

إليك كيف يعمل، باستخدام بعض التشبيهات من الحياة اليومية:

1. لعبة "الصورة الضبابية" (كيف يقوم بالتوليد)

معظم الطرق القديمة تعمل مثل شخص يكتب جملة كلمة بكلمة. بمجرد أن يكتب كلمة، لا يمكنه تغييرها. إذا كتب "الكلب ركض"، فلا يمكنه بسهولة العودة وتغيير "ركض" إلى "قفز" دون إعادة كتابة الجملة بأكملها.

يعمل DiMo بشكل مختلف. تخيل أن لديك صورة لراقصة، لكنها مغطاة تماماً بضجيج ساكن (مثل شاشة تلفاز مشوشة).

  • العملية: لا يقوم DiMo برسم الراقصة ضربة تلو الأخرى. بدلاً من ذلك، ينظر إلى الصورة الضبابية بأكملها دفعة واحدة. يخمن كيف تبدو الراقصة، ثم يخمن كيف يجب أن تبدو النسخة "التالية"، ويستمر في تحسين الصورة مراراً وتكراراً.
  • السحر: يمكنه إصلاح الأخطاء في أي مكان في الصورة فوراً. إذا بدا الذراع الأيسر غريباً، يمكنه إصلاح الذراع الأيسر فقط دون إفساد الساق اليمنى. يفعل ذلك عن طريق "إزالة الضجيج" (denoising) من الصورة في خطوات متوازية، مثل جعل الصورة الضبابية حادة وواضحة تماماً.

2. قرص "السرعة مقابل الجودة"

لأن DiMo يقوم بتحسين الصورة عبر خطوات، يمكنك اختيار مدى سرعة النتيجة.

  • تحتاج للسرعة؟ يمكنك إيقاف العملية مبكراً (مثلاً بعد 5 خطوات). ستبدو الراقصة خشنة قليلاً، لكنك ستحصل على النتيجة فوراً.
  • تحتاج للكمال؟ تترك العملية تعمل لخطوات أكثر (مثلاً 30 خطوة). ستبدو الراقصة واقعية وسلسة للغاية.
    إنه يشبه الكاميرا المزودة بقرص "السرعة مقابل الجودة". يمكنك تحريكه للحصول على ما تحتاجه بالضبط في تلك اللحظة.

3. المترجم "عالي الدقة" (RVQ)

لجعل حركة الراقص تبدو حقيقية، يستخدم DiMo أداة خاصة تسمى الكمية المتجهة المتبقية (Residual Vector Quantization - RVQ).

  • التشبيه: تخيل أنك تحاول وصف لوحة معقدة باستخدام 10 ألوان فقط. ستبدو مربعة وقبيحة. الآن تخيل أن لديك لوحة بها 1000 لون، ولكنك تستخدمها في طبقات. أولاً، تضع الأشكال الكبيرة (الجسم)، ثم تضيف العضلات، ثم التفاصيل الصغيرة مثل خصلات الشعر.
  • النتيجة: يقوم DiMo بتفكيك الحركة إلى هذه الطبقات. هذا يسمح له بالتقاط الحركات "الخشنة" (مثل المشي) والتفاصيل "الدقيقة" (مثل حركة الإصبع) بشكل منفصل، مما يؤدي إلى رسوم متحركة أكثر سلاسة وواقعية.

4. "المدرب الذكي" (GRPO)

أحياناً، حتى لو كانت الحركة تبدو جيدة، فقد لا تتطابق مع القصة التي أخبرته بها (على سبيل المثال، النص يقول "قفز"، لكن الشخصية "تمشي").

  • التشبيه: لدى DiMo "مدرب" مدمج (يسمى GRPO). بعد أن يقوم DiMo بحركة ما، يتحقق المدرب: "هل هذا يطابق النص؟" إذا لم يكن كذلك، يعطي المدرب دفعة لطيفة للنظام ليحاول مرة أخرى. بمرور الوقت، يتعلم DiMo الاستماع للمدرب بشكل أفضل، مما يضمن أن الرقص يتطابق مع القصة تماماً.

ماذا يمكنه أن يفعل فعلياً؟

وفقاً للورقة البحثية، فإن DiMo هو بمثابة "سكين سويسري" للحركة والنص:

  • من النص إلى الحركة: تكتب "شخص يقوم بشقلبة خلفية"، وهو يولد الفيديو.
  • من الحركة إلى النص: ترفع فيديو لرقصة، وهو يكتب وصفاً مثل "الراقص يدور ويقفز".
  • إصلاح الأخطاء: إذا كان لديك فيديو به جزء مفقود (مثل انقطاع في المنتصف)، يمكن لـ DiMo ملء الفجوة دون الحاجة إلى تعليمات جديدة.
  • تصحيح الأوصاف: إذا كان لديك فيديو ووصف لا يتطابق تماماً مع ما يحدث، يمكن لـ DiMo تصحيح الوصف ليصف ما يحدث بالفعل.

الخلاصة

تدعي الورقة أن DiMo أفضل من الطرق السابقة لأنه لا يعلق في ارتكاب خطأ واحد في البداية. يمكنه النظر إلى الصورة بأكملها، وإصلاح الأخطاء في أي مكان، ويسمح لك باختيار مدى السرعة أو الجودة التي تريدها. لقد تم اختباره على مجموعات بيانات قياسية (HumanML3D و KIT-ML) وأظهر قدرته على إنشاء رقصات عالية الجودة وكتابة أوصاف دقيقة، كل ذلك ضمن إطار عمل موحد واحد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →