← أحدث الأبحاث
💻 computer science

MUSE: A Multi-agent Framework for Unconstrained Story Envisioning via Closed-Loop Cognitive Orchestration

تقدم هذه الورقة MUSE، وهو إطار عمل متعدد الوكلاء يعالج تحديات توليد القصص السمعية البصرية طويلة التنسيق من خلال توظيف عملية تنظيم معرفي مغلقة الحلقة للتخطيط والتنفيذ والتحقق والمراجعة بشكل تكراري، مما يضمن تماسك السرد واتساق الهوية عبر التسلسلات الممتدة.

المؤلفون الأصليون: Wenzhang Sun, Zhenyu Wang, Zhangchi Hu, Chunfeng Wang, Hao Li, Wei Chen

نُشر 2026-02-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Wenzhang Sun, Zhenyu Wang, Zhangchi Hu, Chunfeng Wang, Hao Li, Wei Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد أن تروي قصة طويلة ومعقدة لصديق، ولكن ليس لديك سوى جملة واحدة لتبدأ بها: "ولد يذهب في مغامرة في غابة."

إذا طلبت من ذكاء اصطناعي قياسي أن يحول هذه الجملة إلى فيلم، فقد يصنع مشهداً أولياً رائعاً. ولكن بحلول الوقت الذي يصل فيه إلى المشهد الخامس أو العاشر، قد يبدو وجه الولد وكأنه شخص آخر، أو قد تتحول الغابة فجأة إلى صحراء، أو قد ينسى الذكاء الاصطناعي ما حدث في المشهد الأول. يصبح الذكاء الاصطناعي "ثملًا" بالمهمة الفورية المتمثلة في صنع الصورة التالية، ويفقد الرؤية الشاملة للقصة بأكملها.

نظام MUSE هو نظام جديد صُمم لإصلاح هذا الأمر. فكر في MUSE ليس كفنان واحد، بل كـ طاقم إنتاج سينمائي عالي التنظيم يعمل معاً لضمان استمرارية القصة من الإطار الأول وحتى الأخير.

إليك كيف يعمل MUSE، مقسماً إلى أجزاء بسيطة:

1. المشكلة: "الفنان الثمل"

مولدات الفيديو الحالية بالذكاء الاصطناعي تشبه فناناً موهوباً ولكنه قصير النظر. فهي بارعة في رسم لوحة واحدة جميلة بناءً على وصف معين. ولكن إذا طلبت منها رسم فيلم كامل، فإنها تنسى القواعد. قد يغير البطل ملابسه، أو قد يتغير الإضاءة من النهار إلى الليل بشكل عشوائي، أو قد يبدو صوت الشخصية مختلفاً عن الشخص الآخر في المشهد التالي. يُسمى هذا "الانحراف الدلالي" (Semantic Drift).

2. الحل: "طاقم تصوير ذو حلقة مغلقة"

يحل MUSE هذه المشكلة من خلال التعامل مع سرد القصص كـ مصنع ذي حلقة مغلقة بدلاً من كونه طريقاً باتجاه واحد. فهو يستخدم فريقاً من الوكلاء المتخصصين في الذكاء الاصطناعي (عمال رقميين) الذين يتحققون ويصححون لبعضهم البعض باستمرار.

تتم العملية في ثلاث مراحل رئيسية، مثل إنتاج فيلم حقيقي:

  • ما قبل الإنتاج (مدير الكاستينغ وكاتب السيناريو):
    قبل صنع أي فيديو، ينشئ MUSE "كتاب الشخصية" (Character Bible). يقوم بتثبيت مظهر الشخصية الرئيسية بدقة (العمر، الملابس، الأسلوب) وكيفية نبرة صوتها (طبقة الصوت، النغمة). إنه ينشئ "بطاقة هوية رقمية" للشخصية. بطاقة الهوية هذه هي كتاب القواعد الذي يجب اتباعه طوال الفيلم.

    • التشبيه: تخيل مدير كاستينغ يأخذ صورة مثالية وتسجيلاً صوتياً لممثل ويقول: "هذا هو الشخص الذي سنستخدمه. لا تغير شيئاً".
  • الإنتاج (المخرج ومصمم الديكور):
    الآن، يبدأ النظام في توليد المشاهد. لكنه لا يخمن فقط؛ بل يستخدم "بطاقة الهوية" لضمان بقاء الشخصية كما هي. إذا ذكر السيناريو أن الشخصية تمسك بسيف، يتحقق MUSE من التخطيط للتأكد من أن السيف موجود بالفعل وليس طافياً في الهواء.

    • التشبيه: المخرج يصرخ باستمرار: "انتظر! هذا الممثل يبدو مختلفاً! أصلحه!" قبل أن تبدأ الكاميرا في التصوير حتى.
  • ما بعد الإنتاج (المحرر ومشرف الاستمرارية):
    بمجرد صنع المشاهد، يتحقق MUSE من "الوصلات" بينها. هل تحركت يد الشخصية بسلاسة من اللقطة الأخيرة إلى هذه اللقطة؟ هل تدفق السرد بشكل منطقي؟ إذا جعل الذكذا الاصطناعي الشخصية تمشي عبر جدار بالخطأ، أو إذا بدا الصوت سعيداً جداً لمشهد حزين، فإن MUSE يكتشف ذلك.

    • التشبيه: محرر يشاهد الفيلم ويقول: "هذا المشهد لا يتطابق مع المشهد السابق. دعونا نصلح الانتقال قبل أن نعرضه للجمهور".

3. حلقة "التخطيط - التنفيذ - التحقق - المراجعة"

السر وراء MUSE هو أنه لا يقوم بمجرد التوليد والأمل في الحصول على أفضل نتيجة. بل يتبع دورة صارمة:

  1. التخطيط: تحديد ما يجب أن يحدث تالياً.
  2. التنفيذ: توليد الفيديو/الصوت.
  3. التحقق: يقوم وكيل "ناقد" بالتحقق مما إذا كانت النتيجة تطابق الخطة وبطاقة هوية الشخصية.
  4. المراجعة: إذا كان هناك خطأ (مثلاً، قبعة الشخصية مفقودة)، يقوم MUSE بإصلاح هذا الجزء المحدد فقط، بدلاً من رمي المشهد بأكمله والبدء من جديد.

4. الاختبار الجديد: MUSEBench

كيف تعرف ما إذا كانت القصة جيدة إذا لم يكن هناك "إجابة صحيحة"؟ ابتكر المؤلفون ساحة اختبار جديدة تسمى MUSEBench.
بدلاً من مقارنة مخرجات الذكاء الاصطناعي بفيديو مرجعي مثالي (الذي لا وجود له للقصص الإبداعية)، يستخدم MUSEBench حكماً ذكياً من الذكاء الاصطناعي لتقييم القصة بناءً على أمور مثل:

  • الاستمرارية: هل ظلت الشخصية ثابتة؟
  • تدفق القصة: هل كان الحبكة منطقية؟
  • التناغم السمعي البصري: هل تطابق الصوت مع مزاج المشهد؟

النتيجة

تظهر الورقة البحثية أن MUSE أفضل بكثير في الحفاظ على تماسك القصص الطويلة مقارنة بالطرق السابقة. فهو يحافظ على بقاء الشخصيات بنفس المظهر والصوت، ويحافظ على المزاج الصحيح، ويضمن عدم انهيار القصة كلما طالت مدتها.

باختصار: MUSE هو مثل طاقم تصوير فائق التنظيم يرفض ترك القصة تصبح فوضوية. إنه يخطط مسبقاً، ويتحقق من عمله باستمرار، ويصلح الأخطاء فوراً، مما يضمن أن وصفاً بسيطاً يمكن أن يتحول إلى فيلم طويل وغامر ومتماسك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →