← أحدث الأبحاث
💻 computer science

Bernini: Latent Semantic Planning for Video Diffusion

يُعد "بيرنيني" (Bernini) إطار عمل موحداً لتوليد وتحرير الفيديو يستفيد من تقسيم العمل حيث يقوم مخطط يعتمد على نموذج لغوي متعدد الوسائط (MLLM) بإجراء الاستدلال الدلالي في فضاء تضمين المحولات البصرية (ViT)، وذلك لتوجيه مُصيّر يعتمد على محول الانتشار (DiT)، محققاً أداءً هو الأفضل في فئته من خلال تدريب منفصل وفعال ومكونات مبتكرة مثل التضمين الموضعي الدوراني ثلاثي الأبعاد الواعي للتقطيع (Segment-Aware 3D Rotary Positional Embedding).

المؤلفون الأصليون: Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

نُشر 2026-05-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحث Bernini، مترجم إلى لغة يومية باستخدام التشبيهات.

الفكرة الكبرى: المهندس المعماري والبناء

تخيل أنك تريد بناء منزل مخصص. لديك خبيران:

  1. المهندس المعماري (نموذج MLLM): هذا الشخص بارع في فهم أفكارك الغامضة، وقراءة المخططات المعقدة، ومعرفة كيف يجب أن يبدو المنزل. إنه رائع في التفكير والاستنتاج، لكنه سيء جداً في وضع الطوب فعلياً.
  2. البناء (نموذج Diffusion): هذا الشخص حرفي ماهر. يمكنه وضع الطوب، وطلاء الجدران، وتركيب النوافذ بدقة واقعية مذهلة. ومع ذلك، إذا قلت له فقط "اجعل الأمر جميلاً"، فقد يبني قلعة بينما كنت تريد كوخاً. إنه يحتاج إلى تعليمات محددة للغاية.

Bernini هو نظام يجمع هذين الخبيرين. بدلاً من محاولة إجبار المهندس المعماري على وضع الطوب أو إجبار البناء على القيام بالتفكير المعقد، يمنح Bernini كلاهما لغة متخصصة للتحدث مع بعضهما البعض.

كيف يعمل: "المخطط السري"

في الماضي، كان محاولة دمج هذين النوعين من الذكاء الاصطناوي أمراً فوضوياً. يحل Bernini هذه المشكلة عن طريق إنشاء "تقسيم للعمل":

  1. مرحلة التخطيط (المهندس المعماري):
    عندما تعطيه أمراً لـ Bernini (مثل "غيّر الطقس إلى ليلة عاصفة واجعل الكلب سعيداً")، فإن مخطط MLLM لا يحاول رسم الفيديو. بدلاً من ذلك، يعمل مثل مهندس معماري يرسم مخططاً بيانياً رفيع المستوى.

    • السر المذهل: هذا المخطط ليس صورة أو جملة. إنه مجموعة من الأكواد الرياضية (تسمى "ViT embeddings") التي تمثل معنى المشهد. إنه يشبه تسليم المهندس المعماري للبناء قائمة بالإحداثيات والنبرات العاطفية بدلاً من مجرد رسم.
  2. مرحلة الرندرة/التنفيذ (البناء):
    يتلقى مُنفذ DiT (البناء) هذا المخطط. كما ينظر أيضاً إلى الفيديو الأصلي (إذا كنت تقوم بالتعديل) للحفاظ على اتساق الخلفية. باستخدام المخطط كدليل، يقوم بإنشاء البكسلات الفعلية، إطاراً تلو الآخر، لإنتاج فيديو واقعي للغاية.

لماذا هذا رائع؟ لأن المهندس المعماري والبناء يمكن تدريبهما بشكل منفصل. يستمر المهندس المعماري في أن يصبح أكثر ذكاءً في فهم اللغة البشرية، ويستمر البناء في أن يصبح أفضل في صنع صور جميلة. يحتاجان فقط إلى تعلم كيفية قراءة لغة "المخطط السري" الخاصة ببعضهما البعض، وهو أمر أسهل بكثير من إعادة تدريب النظام بأكمله من الصفر.

الأدوات الجديدة: "بطاقات الأسماء" و"خطوات التفكير"

لجعل هذا يعمل بشكل مثالي، أضاف الباحثون حيلتين ذكيتين:

  • نظام "بطاقات الأسماء" (SA-3D RoPE):
    تخيل أنك في غرفة مزدحمة حيث يرتدي الجميع نفس الزي. إذا صرخت "انظر إلى الشخص الذي يرتدي قبعة حمراء"، فسيكون الأمر مربكاً إذا كان هناك ثلاثة أشخاص يرتدون قبعات حمراء.
    في تعديل الفيديو، غالباً ما يحتاج الذكاء الاصطناعي إلى النظر في الفيديو الأصلي، وصورة مرجعية، والفيديو الجديد جميعها في وقت واحد. أحياناً، يكون البكسل في الفيديو الأصلي في نفس الموقع تماماً مع بكسل في الفيديو الجديد.
    يمنح Bernini كل قطعة من اللغز "بطاقة اسم" (مؤشر الجزء). هذا يخبر الذكاء الاصطناعي: "هذه القبعة الحمراء تنتمي إلى الفيديو الأصلي، وتلك القبعة الحمراء تنتمي إلى الفيديو الجديد". هذا يمنع الذكاء الاصطناوي من الارتباك والخلط بين المصدر والنتيجة.

  • خطوة "التفكير بصوت عالٍ" (Chain-of-Thought):
    أحياناً، لا يكفي أمر بسيط. إذا قلت "اجعله يبدو كرسوم متحركة"، فقد يقوم الذكاء الاصطناعي بتغيير الألوان فقط.
    تم تعليم مخطط Bernini أن يفكر بصوت عالٍ قبل رسم المخطط. إنه يفكك المهمة: "أولاً، أحتاج إلى فهم الإضاءة. ثانياً، أحتاج إلى تغيير ملمس الجلد. ثالثاً، أحتاج إلى ضبط الحركة". يساعد هذا التفكير خطوة بخطوة الذكاء الاصطناعي على التعامل مع المهام المعقدة، مثل تغيير الطقس بحيث تنطفئ النار في الفيديو بشكل طبيعي (الاستنتاج السببي).

ماذا يمكنه أن يفعل؟

تظهر الورقة البحثية أن Bernini هو "سكين سويسري" للفيديو. يمكنه:

  • تحويل النص إلى فيديو (Text-to-Video): إنشاء فيديو من الصفر بناءً على وصف.
  • تعديل الفيديو إلى فيديو (Video-to-Video Editing): تغيير النمط، إضافة أو إزالة أشياء، أو تغيير الطقس في فيديو موجود.
  • التعديل الموجه بمرجع (Reference-Guided Editing): "اجعل الشخص في هذا الفيديو يبدو مثل الشخص في هذه الصورة".
  • نقل الحركة (Motion Transfer): "اجعل الشخص في هذه الصورة يرقص مثل الشخص في هذا الفيديو".

النتائج: الفوز في السباق

اختبر الباحثون Bernini ضد نماذج ذكاء اصطناعي رائدة أخرى (مثل Kling و Wan وغيرها) في اختبار جديد أنشأوه يسمى Bernini-Bench.

  • النتيجة: فاز Bernini في "لوحة صدارة تعديل الفيديو"، متفوقاً على المنافسين في الاتساق واتباع التعليمات.
  • الانتصار الرئيسي: كان بارعاً بشكل خاص في الحفاظ على اتساق الفيديو. عندما تقوم بتعديل جزء من الفيديو، لا يتشوه الجزء الآخر أو يحدث فيه خلل، بل يظل وفياً للمشهد الأصلي مع تغيير ما طلبته فقط.

الملخص

Berni est مثل توظيف مهندس معماري عبقري لكتابة مجموعة مثالية من التعليمات لبناء ماهر. من خلال السماك بترك لغة "مخطط" متخصصة ومنحهم أدوات لتتبع أي جزء من الفيديو هو أي جزء، يصنع Bernini فيديوهات ليست جميلة فحسب، بل ذكية بما يكفي لفهم التغييرات المنطقية المعقدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →