← أحدث الأبحاث
💻 computer science

DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation

تقترح هذه الورقة البحثية إطار عمل DCDM، وهو إطار انتشار قائم على مبدأ "فرق تسد" يعزز اتساق توليد الفيديو من خلال دمج التحليل الدلالي المدفوع بالنماذج اللغوية الكبيرة لضمان التماسك داخل المقطع الواحد، وتمثيلات كاميرا زمنية في فضاء الضجيج للتحكم بين المقاطع، ونموذج توليد مشاهد شامل مع انتباه متفرق لضمان الاستمرارية السردية بين اللقطات.

المؤلفون الأصليون: Haoyu Zhao, Yuang Zhang, Junqi Cheng, Jiaxi Gu, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

نُشر 2026-02-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Haoyu Zhao, Yuang Zhang, Junqi Cheng, Jiaxi Gu, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك مخرج تحاول صنع فيلم باستخدام كاميرا سحرية تعمل بالذكاء الاصطناعي. تريد أن يبدو الفيلم مذهلاً، لكنك واجهت ثلاثة كوابيس محددة تحدث عندما تطلب من الذكاء الاصطناعي إنشاء فيديوهات:

  1. مشكلة "الممثل النسيّان": في مشهد واحد، قد يجعل الذكاء الاصطناعي الشخصية فجأة بثلاث عيون، أو يجعل كوب قهوة يطفو مقلوباً بلا سبب. إنه يفقد تتبع القواعد الأساسية للعالم.
  2. مشكلة "اليد المترنحة": تطلب من الكاميرا "التقريب بسلاسة"، لكن الذكاء الاصطناعي يجعل الكاميرا تهتز، أو تتشنج، أو تتحرك بطريقة تجعلك تشعر وكأن شخصاً مخموراً يمسك بها.
  3. مشكلة "فقدان الذاكرة": تطلب منه قصة مدتها 10 دقائق. في الدقيقة الأولى، يرتدي البطل قبعة حمراء. وبحلول الدقيقة الخامسة، أصبحت القبعة زرقاء. وبحلول الدقيقة العاشرة، أصبح البطل شخصاً مختلفاً تماماً. لقد نسي الذكاء الاصطناعي القصة التي بدأ يرويها للتو.

قدمت الورقة البحثية التي شاركتها نظاماً جديداً يسمى DCDM (نموذج الانتشار القائم على فرق تسد - Divide-and-Conquer Diffusion Model). بدلاً من محاولة إصلاح كل هذه المشاكل بعقل واحد ضخم ومشوش، قرر المؤلفون تقسيم المهمة إلى ثلاثة فرق متخصصة، تعمل جميعها تحت سقف واحد.

إليك كيف فعلوا ذلك، باستخدام تشبيهات بسيطة:

1. طبيب السيناريو (الاتساق داخل اللقطة الواحدة)

المشكلة: عندما تعطي أمراً بسيطاً مثل "قط يطارد فأراً"، يتعين على الذكاء الاصطناعي تخمين الكثير من التفاصيل. هل الفأر يركض؟ هل القط غاضب؟ أين هم؟ إذا خمن الذككاء الاصطناعي بشكل خاطئ، سيبدو المشهد غريباً.
الحل: قبل أن يبدأ الذكاء الاصطناعي في رسم الفيديو، يستخدمون "طبيب سيناريو ذكي" (نموذج لغوي كبير).

  • التشبيه: تخيل أنك تقول لرسام: "ارسم كلباً". قد يرسم الرسام كلباً بأجنحة. ولكن إذا قلت له: "ارسم كلب جولدن ريتريفر يركض بسعادة في حديقة مشمسة، وهو يطارد كرة حمراء"، سيعرف الرسام تماماً ما يجب فعله.
  • كيف يعمل: يأخذ النظام طلبك القصير ويطلب من "طبيب السيناريو" توسيعه إلى وصف مفصل للغاية. إنه يملأ التفاصيل المنطقية المفقودة حتى يعرف الذكاء الاصطناعي تماماً كيف يبدو العالم قبل أن يبدأ في إنشاء الفيديو. هذا يوقف مشكلة "القط ذو العيون الثلاث".

2. مشغل مثبت الكاميرا (اتساق حركة الكاميرا بين اللقطات)

المشكلة: إخبار الذكاء الاصطناعي بـ "تحريك الكاميرا لليسار" غالباً ما يؤدي إلى فوضى مهتزة وغير متوقعة لأن الذكاق الاصطناعي لا يفهم الهندسة أو الفيزياء حقاً.
الحل: أنشأوا "مشغل كاميرا متخصصاً" يعمل مع "مخطط" للحركة.

  • التشبيه: بدلاً من مجرد الصراخ "تحرك يساراً!" في وجه حشد فوضوي، أنت تعطي مصوراً محترفاً مساراً محدداً على الأرض وجهاز تحكم عن بعد. أنت تقول له: "تحرك مترين بالضبط إلى اليسار، بسلاسة".
  • كيف يعمل: يقوم النظام بترجمة نصك (مثل "تقريب") إلى "نمط ضجيج" رياضي يعمل كمسار صلب للكاميرا. كما يبدأ بصورة مرجعية مثالية (مثل رسم تخطي لقصة مصورة) لضمان تحرك الكاميرا تماماً كما هو مخطط لها، دون اهتزاز أو انحراف.

3. حافظ الذاكرة (اتساق العناصر بين المشاهد)

المشكلة: عند صنع فيديو طويل يتكون من لقطات عديدة، عادة ما ينسى الذكاء الاصطناعي كيف كان شكل الشخصيات في اللقطة الأولى بحلول وصوله إلى اللقطة الأخيرة.
الحل: بنوا "حافظ ذاكرة" يشاهد الفيلم بأكمله دفعة واحدة، لكنه ينتبه فقط للأجزاء المهمة.

  • التشبيه: تخيل كتابة رواية. إذا كتبت كل كلمة من كل فصل في كتلة نصية واحدة ضخمة، سيتعب عقلك وتنسى اسم شخصيتك الرئيسية. بدلاً من ذلك، تكتب فصلاً فصلاً، لكنك تحتفظ بـ "ورقة بيانات الشخصية" على مكتبك لتلقي نظرة عليها في كل مرة تبدأ فيها فصلاً جديداً.
  • كيف يعمل: يقوم الذكاء الاصطناعي بإنشاء الفيديو في "لقطات" (مشاهد). يستخدم خدعة خاصة تسمى "الانتباه المتفرق" (Sparse Attention). إنه ينظر إلى كل إطار داخل لقطة واحدة بدقة (لجعل الحركة سلسة)، ولكن عندما ينتقل إلى اللقطة التالية، فإنه يتحقق فقط من بعض "الملاحظات الملخصة" من اللقطات السابقة. هذا يحافظ على وجه الشخصية، والأسلوب، والقصة متسقين دون الحاجة إلى إعادة حساب الفيديو بأكمله في كل مرة، مما يوفر كميات هائلة من قدرة الكمبيوتر.

الصورة الكبيرة: "فرق تسد"

عبقرية هذه الورقة البحثية تكم-ن في اسمها: "فرق تسد" (Divide and Conquer).

بدلاً من بناء روبوت واحد ضخم ومعقد للغاية يحاول أن يكون كاتب سيناريو، ومصور كاميرا، ومخزن ذاكرة في آن واحد (وهو ما يفشل عادة في كل شيء)، قاموا ببناء "محرك مركزي" (مولد الفيديو) وأعطوه ثلاثة مساعدين متخصصين:

  1. واحد لإصلاح منطق المشهد.
  2. واحد لإصلاح حركة الكاميرا.
  3. واحد لإصلاح الذاكرة طويلة المدى.

النتيجة

اختبر الفريق هذا النظام في مسابقة كبرى (AAAI'26) وفاز بها. فيديوهاتهم هي:

  • منطقية: الأشياء تتصرف مثل الأشياء الحقيقية.
  • مستقرة: تتحرك الكاميرا بسلاسة مثل طاقم تصوير محترف.
  • متسقة: تبدو الشخصيات متشابهة من الثانية الأولى وحتى الأخيرة.

باختصار، لقد توقفوا عن محاولة إجبار الذكاء الاصطناعي على القيام بكل شيء في وقت واحد، وبدلاً من ذلك منحوه سير عمل واضح ومنظم، مما أدى إلى أفلام أفضل بكثير وأكثر موثوقية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →