MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation
تقدم هذه الورقة MultiBanana، وهو معيار مفتوح شامل مصمم لتقييم وتطوير نماذج توليد الصور من النصوص متعددة المراجع من خلال تقييم قدراتها عبر تحديات متنوعة مثل تباين أعداد المراجع، وعدم تطابق النطاق والمجال، والمفاهيم النادرة، والمدخلات متعددة اللغات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك شيف ماهر في مطبخ. حتى وقت قريب، كانت مهمتك بسيطة: خذ صورة واحدة لفراولة ووصفة واحدة، واخبز كعكة تشبه تلك الفراولة تماماً. لقد كنت بارعاً جداً في ذلك.
لكن الآن، أصبح الزبائن أكثر تطلباً. هم لا يريدون مجرد كعكة فراولة فحسب، بل يريدون كعكة تستخدم:
- الفراولة من الصورة (أ).
- كريمة الشوكولاتة من الصورة (ب).
- التوت الأزرق من الصورة (ج).
- السكاكر الملونة (Sprinkles) من الصورة (د).
- شكل الطبق من الصورة (هـ).
- الإضاءة من الصورة (و).
- نمط مفرش الطاولة من الصورة (ز).
- النص الموجود في القائمة من الصورة (ح).
ويريدونها أن تبدو وكأنها تنتمي إلى نفس الغرفة، وليس كمجرد تجميع عشوائي لصور مشتتة.
هذه هي المشكلة التي تحاول ورقة "MultiBanana" البحثية حلها.
المشكلة: أزمة "كثرة المكونات"
مولدات الصور الحالية بالذكاء الاصطناعي (مثل تلك التي تصنع صوراً للإعلات أو وسائل التواصل الاجتماعي) رائعة في استخدام صورة أو صورتين مرجعيتين. لكن عندما تعطيهم "قائمة تسوق" مكونة من 8 صور مختلفة لدمجها، يبدأون في الارتباك. قد ينسون التوت الأزرق، أو يخلطون بين الشوكولاتة والسكاكر، أو يجعلون الكعكة تبدو وكأنها تطفو في الهواء.
أدرك الباحثون أن الاختبارات القديمة (المعايير المرجعية) كانت تشبه اختبار الشيف بمكون واحد فقط. لم تكن تخبرنا ما إذا كان بإمكان الشيف حقاً التعامل مع مأدبة ضخمة ومعقدة.
الحل: تقديم "MultiBanana"
قام الفريق من جامعة طوكيو وGoogle DeepMind بابتكار اختبار جديد فائق الصعوبة يسمى MultiBanana.
تخيل MultiBanana كأنها "أولمبياد الطهي" لطهاة الذكاء الاصطناعي. بدلاً من مطالبتهم بخبز بسكويتة بسيطة، يلقون عليهم تحدياً هائلاً:
- تحدي الكمية: هل يمكنك دمج 3 أو 4 أو حتى 8 صور مختلفة في وقت واحد؟
- صراع الأنماط: هل يمكنك دمج صورة واقعية لكلب مع قط كرتوني ولوحة مائية للخلفية، وجعلهم يبدون وكأنهم ينتمون لنفس المشهد؟
- مشكلة الحجم: هل يمكنك أخذ نملة صغيرة من صورة وجبل ضخم من صورة أخرى، وجعلهم يتناسبون في نفس المشهد دون أن تبدو النملة كأنها لعبة؟
- المكون النادر: هل يمكنك خبز كعكة باستخدام صورة لـ "موزة حمراء" (التي لا توجد حقاً في الطبيعة)؟
- حاجز اللغة: هل يمكنك قراءة لافتة باليابانية، وقائمة بالصينية، ووصفة بالإنجليزية، ووضعها جميعاً في نفس الصورة بشكل صحيح؟
كيف اختبروا الطهاة؟
لم يكتفوا بطلب من البشر النظر إلى الصور (لأن ذلك يستغرق وقتاً طويلاً ويكلف الكثير)، بل استخدموا نماذج ذكاء اصطناعي أخرى فائقة الذكاء (مثل GPT-5 وGemini) لتعمل كـ حكام. نظر هؤلاء الحكام إلى النتائج وأعطوها درجة من 10 بناءً على خمسة أشياء:
- هل اتبعوا الوصفة؟ (هل استخدموا جميع المكونات؟)
- هل بدت المكونات صحيحة؟ (هل بدت الموزة الحمراء مثل الموزة الحمراء في الصورة؟)
- هل يبدو المشهد طبيعياً؟ (هل الكلب يجلس على الأرض، أم يطفو في الهواء؟)
- هل الإضاءة صحيحة؟
- هل هو جميل؟
ماذا وجدوا: "المفرط في التفكير" مقابل "المقصر في التفكير"
عندما طبقوا الاختبار على أفضل نماذج الذكاء الاصطناعي، وجدوا نوعين مختلفين تماماً من الإخفاقات:
1. "المفرط في التفكير" (النماذج مغلقة المصدر مثل Nano Banana وGPT-Image-1)
هذه النماذج تشبه الطهاة الذين يحاولون جاهدين استخدام كل مكون لدرجة أنهم يفسدون الطبق.
- ما يفعلونه: ينجحون في جلب جميع العناصر الثمانية.
- العيب: لأنهم يحاولون نسخ كل تفصيل صغير، تبدو الصورة النهائية غريبة. قد تبدو الشخصيات مضغوطة مع بعضها، أو تكون الإضاءة مربكة، أو يبدو المشهد "عجيناً" ومشوهًا. هم مخلصون للمكونات لكنهم سيئون في تكوين المشهد.
2. "المقصر في التفكير" (النماذج مفتوحة المصدر مثل Qwen وDreamOmni2)
هذه النماذج تشبه الطهاة الذين يشعرون بالارتباك أمام قائمة الطلبات فيستسلمون لبعض المكونات.
- ما يفعلونه: يصنعون صورة نظيفة وجميلة جداً.
- العيب: ينسون نصف الطلبات. إذا طلبت منهم 8 عناصر، فقد يضعون 3 فقط في الصورة. إنهم يتجاهلون التعليمات للحفاظ على الصورة "آمنة" وجميلة.
لماذا يهم هذا؟
هذه الورقة البحثية هي بمثابة جرس إنذار. فهي تخبرنا أنه بينما أصبح الذكاء الاصطناعي مذهلاً في جعل شيء واحد يبدو واقعياً، إلا أنه لا يزال يكافح ليكون مخرجاً يمكنه إدارة طاقم كامل من الشخصيات من أفلام مختلفة ووضعهم في مشهد واحد.
MultiBanana هي الآن المعيار الجديد. إنها ساحة لعب عامة حيث يمكن لأي شخص اختبار ذكائه الاصطناعي ليرى ما إذا كان قادراً حقاً على التعامل مع فوضى الإبداع في العالم الحقيقي. إنها تدفع المطورين للتوقف عن مجرد صنع صور جميلة والبدء في تعليم ذكائهم الاصطناعي كيفية اتباع تعليمات معقدة متعددة الخطوات دون أن يفقد صوابه.
باختاً مختصراً: MultiBanana هي الاختبار النهائي للضغط لمعرفة ما إذا كان بإمكان الذكاء الاصطناعي أخيراً التوقف عن كونه "لاعباً بمهارة واحدة" ليصبح "شيفاً ماهراً" حقيقياً في العالم البصري.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.