← أحدث الأبحاث
🤖 AI

InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation

يقدم InstructMoLE إطار عمل لخليط من الخبراء منخفضة الرتبة بتوجيه تعليماتي يستبدل التوجيه على مستوى الرمز بإشارة عالمية مشتقة من التعليمات لحل مشكلات التداخل بين المهام والتجزئة المكانية في توليد الصور متعدد الشروط، مما يحقق تحكماً تركيبياً وفاءً دلالياً فائقين مقارنة بالطرق الحالية.

المؤلفون الأصليون: Jinqi Xiao, Qing Yan, Liming Jiang, Zichuan Liu, Hao Kang, Shen Sang, Tiancheng Zhi, Jing Liu, Cheng Yang, Xin Lu, Bo Yuan

نُشر 2026-05-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jinqi Xiao, Qing Yan, Liming Jiang, Zichuan Liu, Hao Kang, Shen Sang, Tiancheng Zhi, Jing Liu, Cheng Yang, Xin Lu, Bo Yuan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فناناً فائق الذكاء (ذكاء اصطناعي) يمكنه رسم أي شيء تصفه. ولكن في بعض الأحيان، عندما تعطيه تعليمات معقدة مثل: "ارسم طفلاً يحبو على العشب، وحصاناً أبيض يرعى في مكان قريب، وخوذة كرة قدم"، يصاب الفنان بالارتباك.

إذا حاول الفنان أن يقرر ما سيرسمه لكل بكسل صغير في الصورة بشكل مستقل (بكسل تلو الآخر)، فقد يرسم رأس الطفل بشكل صحيح ولكنه يعطي جسمه ساق حصان، أو يجعل الخوذة تطفو في مكان خاطئ. النتيجة هي صورة مشتتة وغير متسقة حيث لا تتناسب الأجزاء المختلفة مع بعضها البعض منطقياً.

تقدم هذه الورقة البحثية طريقة جديدة لتعليم هذا الفنان، تسمى InstructMoLE. وإليك كيف تعمل، باستخدام تشبيهات بسيية:

1. المشكلة: الارتباك "بكسل تلو الآخر"

الطرق التقليدية (مثل LoRA) تشبه إعطاء تعليمات مختلفة لكل بكسل منفرد في الصورة.

  • التشبيه: تخيل جوقة موسيقية حيث يقرأ كل مغنٍ نوتة موسيقية مختلفة. أحد المغنيين يعتقد أنه يغني عن حصان، والآخر يعتقد أنه يغني عن خوذة. النتيجة هي ضجيج، وليست أغنية.
  • المشكلة: في توليد الصور، يتسبب هذا في "تجزؤ مكاني". قد يبدو الطفل كأنه حصان، أو قد تكون الخوذة داخل العشب. يفقد الفنان القدرة على رؤية "الصورة الكبيرة" لطلبك.

2. الحل: "مجلس الخبراء"

يقترح المؤلفون نظاماً يسمى خليط من الخبراء منخفض الرتبة (Mixture of Low-rank Experts - MoLE).

  • التشبيه: بدلاً من فنان عام واحد، تخيل فريقاً من 8 خبراء متخصصين.
    • الخبير (أ) بارع في رسم الحيوانات.
    • الخبير (ب) بارع في رسم الملابس.
    • الخبير (ج) بارع في الإضاءة والظلال.
  • الطريقة القديمة: كان النظام القديم يطلب من كل بكسل اختيار خبيره الخاص. بكسل العشب قد يختار "الخبير أ"، بينما بكسل الحصان يختار "الخبير ب"، مما يؤدي إلى مزيج فوضوي.
  • طريقة InstructMoLE: ينظر النظام إلى تعليماتك الكاملة أولاً. ويقول: "حسناً، هذا الطلب يتعلق بمشهد يحتوي على حيوانات وأشياء. أحتاج أن يتفق الفريق بأكمله على خطة واحدة".

3. السر الكامن: "التوجيه الموجه بالتعليمات" (Instruction-Guided Routing - IGR)

هذا هو الابتكار الجوههري. بدلاً من ترك البكسلات تختار الخبراء، يقرأ النظام جملتك الكاملة ويختار "مجلس خبراء" واحداً لطبقة الصورة بأكملها.

  • التشبيه: فكر في مخرج سينمائي. قبل تصوير مشهد ما، يجمع المخرج طاقم العمل ويقول: "اليوم سنصور مشهداً يحتوي على طفل وحصان. الجميع، ركزوا على هذا الأسلوب وهذه العلاقة المحددة".
  • كيف يساعد ذلك: يضمن المخرج (نظام التوجيه) أن يتبع كل جزء من الصورة نفس الخطة. يظل الطفل طفلاً، ويظل الحصان حصاناً، ويظلان في العلاقة الصحيحة مع بعضهما البعض. هذا يمنع المظهر "المجزأ".

4. الحفاظ على تنوع الفريق: "خسارة التعامد" (Orthogonality Loss)

هناك خطر من أنه إذا كان لديك فريق من الخبراء، فقد يبدأ الجميع في فعل الشيء نفسه تماماً (على سبيل المثال، جميع الخبراء الثمانية يتعلمون رسم الخيول فقط). وهذا ما يسمى "انهيار الخبير".

  • التشبيه: تخيل فريقاً رياضياً حيث يقرر حارس المرمى والمهاجم والمدافع جميعاً الوقوف في منطقة المرمى فقط. سيفشل الفريق لأن لا أحد يقوم بوظيفته المحددة.
  • الحل: أضاف المؤلفون قاعدة خاصة (عقوبة رياضية) تجبر الخبراء على أن يكونوا مختلفين عن بعضهم البعض. الأمر يشبه مدرباً يقول: "أنت، يجب أن تكون حارس المرمى. وأنت، يجب أن تكون المهاجم. لا يمكنك القيام بنفس وظيفة زميلك".
  • النتيجة: يضمن هذا أنه عندما يختار النظام "مجلس خبراء"، فإنه يحصل على مجموعة من الخبراء الذين يقدمون بالفعل مهارات مختلفة، مما يجعل الصورة النهائية أغنى وأكثر دقة.

الخلاصة

تزعم الورقة البحثية أنه باستخدام نهج "المخرج العالمي" (التوجيه الموجه بالتعليمات) وإجبار "الفريق المتخصص" على البقاء متنوعاً، يمكن للذكاء الاصطناعي اتباع التعليمات المعقدة بشكل أفضل بكثير من ذي قبل.

  • قبل: كان بإمكان الذكاء الاصطناعي رسم طفل برأس حصان أو وضع خوذة على الشخصية الخطأ لأنه كان يفكر بشكل محلي للغاية.
  • الآن: يفهم الذكاء الاصطناعي القصة الكاملة التي أخبرته بها ويطبق تلك القصة باستمرار عبر الصورة بأكملها، مما ينتج صوراً متماسكة وعالية الجودة تطابق قصدك بدقة.

اختبر المؤلفون ذلك على نموذج ذكاء اصطناعي قوي (Flux.1) ووجدوا أنه يعمل بشكل أفضل بكثير في التعامل مع المواضيع المتعددة، وتغيير الأساليب، واتباع التعليمات المكانية المعقدة مقارنة بالطرق السابقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →