← أحدث الأبحاث
💬 NLP

OmniGen2: Towards Instruction-Aligned Multimodal Generation

يُعد OmniGen2 نموذجاً مفتوح المصدر، متوافقاً مع التعليمات ومتعدد الوسائط، يستخدم بنية ذات مسارين بمعلمات منفصلة لتحقيق أداء رائد في مهام تحويل النص إلى صورة، وتحرير الصور، والتوليد السياقي القائم على الموضوع، مع الحفاظ على القدرات النصية الحالية.

المؤلفون الأصليون: Chenyuan Wu, Pengfei Zheng, Ruiran Yan, Shitao Xiao, Xin Luo, Yueze Wang, Wanli Li, Xiyan Jiang, Yexin Liu, Junjie Zhou, Ze Liu, Ziyi Xia, Chaofan Li, Haoge Deng, Jiahao Wang, Kun Luo, Bo Zhang, Defu
نُشر 2026-04-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chenyuan Wu, Pengfei Zheng, Ruiran Yan, Shitao Xiao, Xin Luo, Yueze Wang, Wanli Li, Xiyan Jiang, Yexin Liu, Junjie Zhou, Ze Liu, Ziyi Xia, Chaofan Li, Haoge Deng, Jiahao Wang, Kun Luo, Bo Zhang, Defu Lian, Xinlong Wang, Zhongyuan Wang, Tiejun Huang, Zheng Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فناناً موهوباً جداً يمكنه رسم أي شيء تصفه له. لكن هناك عقبة: أحياناً يسيء فهم تعليماتك، أو ينسى كيف يبدو شكل "دراجة حمراء"، أو يرتبك عندما تطلب منه تعديل صورة موجودة بالفعل.

OmniGen2 يشبه منح هذا الفنان ترقية هائلة. إنه نموذج ذكاء اصطناعي جديد مصمم ليكون الآلة المثالية في "تنفيذ التعليمات" للصور. إليك كيف يعمل، مقسماً إلى مفاهيم بسيية:

1. التدريب على مرحلتين: "المدرسة" ثم "التلمذة"

لم يقم الباحثون بمجرد إلقاء الذكاء الاصطناعي في أعماق التجربة. بل استخدموا عملية تدريب ذكية مكونة من خطوتين:

  • المرحلة الأولى: بناء الأساس (مرحلة "المدرسة")
    أولاً، علموا الذكاء الاصطناعي قدراً هائلاً من المعرفة العامة. فكر في الأمر كإرسال الفنان إلى مدرسة الفنون. لقد تعلموا عن العالم، وكيف تبدو الأشياء، وكيف يعمل الضوء، وكيف يرسم أي شيء من "بروكلي أصفر" إلى "مدينة سايبربانك".

    • السر الخفي: قاموا ببناء "عقل" خاص (نموذج لغوي بصري) يفهم النصوص والصور بعمق. يعمل هذا العقل كمعلم، يوجه عملية الرسم حتى لا يقوم الذكاء الاصطناعي بمجرد التخمين، بل يفهم ما تريده حقاً.
  • المرحلة الثانية: التلمذة (مرحلة "محاذاة التعليمات")
    بمجرد أن يتعلم الفنان كيفية الرسم، يحتاج إلى تعلم كيفية الاستماع. هنا يتم تدريب الذكاء الاصطناعي على تعليمات محددة مثل "غيّر الخلفية إلى حديقة" أو "أزل البط".

    • المدرب: بدلاً من مجرد عرض الأمثلة، يلعب الذكاء الاصطناعي لعبة "حاول، احصل على ملاحظات، حاول مرة أخرى". إذا رسم بروكلي أخضر بينما طلبت أنت لوناً أصفر، فإن "المدرب" (نظام المكافأة) يخبره: "لا، حاول مرة أخرى!". يتعلم الذكاء الاصطناعي من هذه الأخطاء حتى ينجح في كل مرة. وهذا ما يسمى بـ التعلم التعزيزي (Reinforcement Learning).

2. نظام "GPS" خاص للصور (Omni-RoPE)

أحد أصعب الأمور على الذكاء الاصطناعي هو تتبع أين توجد الأشياء في الصورة، خاصة عندما تقوم بتعديل صورة موجودة.

  • المشكلة: تخيل أن لديك صورة لقطة على سجادة. إذا قلت للذكاء الاصطناعي "انقل القطة إلى الأريكة"، فقد يرتبك الذكاء الاصطناعي العادي بشأن أي بكسلات تنتمي للقطة وأيها تنتمي للسجادة.
  • الحل (Omni-RoPE): منح الباحثون الذكاء الاصطناعي نظام GPS خاصاً. إنه يضع علامة على كل جزء من الصورة بمعرف فريد (مثل بطاقة الاسم) وموقع (مثل عنوان الشارع). بهذه الطريقة، عندما تقول "انقل القطة"، يعرف الذكاء الاصطناعي بالضبط أي "بطاقة اسم" تنتمي للقطة ويمكنه نقلها دون إفساد بقية الصورة.

3. اختبار "OmniContext": الامتحان النهائي الجديد

أدرك الباحثون أن الاختبارات الحالية للذكاء الاصطناعي ليست جيدة بما يكفي. كانت تشبه سؤال طباخ "اصنع شطيرة" دون التحقق مما إذا كان الخبز طازجاً أو إذا كان الجبن ذائباً.

  • الاختبار الجديد: أنشأوا اختباراً أصعب يسمى OmniContext. يختبر ما إذا كان بإمكان الذكاء الاصطناعي النظر إلى صورة لشخص أو شيء معين ووضعه في مشاهد جديدة بشكل مثالي.
    • مثال: "خذ هذه الصورة لكلبي وضعه على شاطئ في هاواي".
    • يجب على الذكاء الاصطناعي الحفاظ على الكلب ليبدو تماماً مثل كلبك، وليس كلباً عشوائياً، مع جعل الشاطئ يبدو حقيقياً. وقد تفوق OmniGen2 في هذا الاختبار، متفوقاً على معظم النماذج الأخرى.

4. ما الذي يمكنه فعله حقاً؟

OmniGen2 هو "سكين سويسري" للصور. يمكنه القيام بثلاثة أشياء رئيسية في خطوة واحدة:

  • تحويل النص إلى صورة (Text-to-Image): تكتب "قطة ترتدي قبعة"، وهو يرسمها.
  • تعديل الصور (Image Editing): ترفع صورة وتقول "غيّر السماء إلى وقت الغروب"، وهو يفعل ذلك دون إفساد بقية الصورة.
  • التوليد في السياق (In-Context Generation): ترفع صورة لشخصية وتقول "ضع هذه الشخصية في غابة"، وهو ينشئ مشهداً جديداً بنفس تلك الشخصية تماماً.

لماذا يعد هذا أمراً مهماً؟

قبل هذا، كنت غالباً بحاجة إلى أدوات ذكاء اصطناعي مختلفة لمهام مختلفة (واحدة للرسم، واحدة لتعديل الصور، وواحدة لتغيير الخلفيات). يجمع OmniGen2 كل هذه الميزات في نموذج واحد ذكي ومطيع. إنه يشبه امتلاك مساعد واحد يمكنه الرسم، وتعديل الصور، واتباع التعليمات المعقدة بشكل أفضل من فريق من المتخصصين.

باخت-القول: OmniGen2 هو فنان رقمي فائق الذكاء تم تعليمه معرفة العالم أولاً، ثم تدريبه على الاستماع لتعليماتك بشكل مثالي، وأخيراً اختباره في أصعب التحديات لإثبات قدرته على التعامل مع أي شيء تلقيه عليه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →