CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions
تقدم هذه الورقة CREval، وهو مسار تقييم آلي وقابل للتفسير قائم على الأسئلة والأجوبة، وCREval-Bench، وهو معيار شامل يضم أكثر من 800 عينة، لتقييم وكشف القيود الحالية لنماذج تحرير الصور المتطورة في التعامل مع مهام التلاعب المعقدة والإبداعية بشكل منهجي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك استوديو فنون سحرياً حيث يمكنك أن تقول للكمبيوتر: "حوّل هذه الصورة لكلبي إلى بطل خارق يرتدي عباءة مصنوعة من السحب"، وسيحاول الكمبيوتر فعل ذلك بالضبط. هذا هو جوهر "تحرير الصور القائم على التعليمات" (Instruction-Based Image Editing).
ولكن هنا تكمن المشكلة: كيف تعرف ما إذا كان الكمبيوتر قد أدى مهمته بشكل جيد حقاً؟ هل استمع لتعليماتك؟ هل حافظ على شكل كلبك كما هو؟ هل الصورة مشوشة أو غريبة؟
حالياً، عملية فحص هذه النتائج تشبه محاولة تقييم مقال طالب بمجرد النظر إلى الدرجة النهائية دون قراءة ملاحظات المعلم. الأمر غامض، وأحياناً يكون "المعلم" (المُقيّم الذكي) منحازاً أو لا يشرح لماذا أعطى درجة سيئة.
تقدم هذه الورقة البحثية CREval، وهي طريقة ذكية جداً لتقييم مشاريع الفن بالذكاء الاصطناعي هذه. فكر في الأمر كأنك توظف محققاً بدلاً من مجرد قاضٍ.
المشكلة: القضاة "الصناديق السوداء"
قبل هذه الورقة، كان الباحثون يستخدمون نماذج ذكاء اصطناعي ضخمة للنظر في الصورة المعدلة وقول: "الدرجة: 7/10".
- المشكلة: لم نكن نعرف لماذا حصلت على 7. هل أغفل الذكاء الاصطناعي العباءة؟ هل تحول الكلب إلى قطة؟ كانت الدرجة عبارة عن "صندوق أسود" — لغز غامض.
- الفجوة: كانت الاختبارات الموجودة مخصصة في الغالب لمهام بسيطة مثل "أزل الشخص" أو "غير السماء إلى اللون الأزرق". لم تكن مصممة لـ الأفكار الإبداعية الجامحة مثل "حول المحارب إلى دمية سمكة استوائية محشوة" أو "اصنع قصة مصورة عن حصان رعاة بقر".
الحل: CREval (المحقق)
ابتكر المؤلفون CREval، وهو اختصار لـ Creative Review Evaluation (تقييم المراجعة الإبداعية). بدلاً من سؤال الذكاء الاصطناعي "ما مدى جودة هذا؟"، يسأل CREval الذكاء الاصطناعي سلسلة من أسئلة (نعم/لا) (مثل الاختبار القصير).
تخيل أنك معلم تصحح رسمة طالب. بدلاً من مجرد إعطاء درجة، تسأل:
- "هل رسم الطالب القبعة؟" (نعم/لا)
- "هل القبعة زرقاء، كما هو مطلوب؟" (نعم/لا)
- "هل حافظوا على وجه الطالب الأصلي؟" (نعم/لا)
- "هل الخطوط مهتزة وغير مرتبة؟" (نعم/لا)
يفعل CREval الشيء نفسه تماماً، ولكن بالنسبة لصور الذكاء الاصطناعي. فهو يقسم التقييم إلى ثلاث فئات رئيسية:
- اتباع التعليمات (Instruction Following - IF): هل قام الذكاء الاصطناعي بما طلبته منه فعلياً؟ (مثلاً: "هل حول الروبوت إلى كعكة؟")
- الاتساق البصري (Visual Consistency - VC): هل حافظ الذكاء الاصطناعي على الأجزاء المهمة من الصورة الأصلية؟ (مثلاً: "هل لا يزال نفس الروبوت، لكنه روبوت كعكة، أم تحول إلى شخصية مختلفة تماماً؟")
- الجودة البصرية (Visual Quality - VQ): هل تبدو الصورة جيدة؟ (مثلاً: "هل الأيدي غريبة؟ هل الملمس مشوش؟")
ساحة اللعب: CREval-Bench
لاختبار نظام المحقق الجديد هذا، بنى المؤلفون ساحة لعب ضخمة تسمى CREval-Bench.
- تحتوي على أكثر من 800 تحدٍ إبداعي معقد.
- ليست هذه مهاماً بسيطة؛ بل هي أشياء مثل: "حول صورة زفاف هذه إلى رسوم متحية صينية تقليدية"، أو "اجعل هذا الجبل يبدو وكأنه عملاق صخري يرتفع من الأرض".
- إنها تشبه "الامتحان النهائي" لنماذج فن الذكاء الاصطناعي، وهي مصممة لتكون أصعب بكثير من الاختبارات السابقة.
ماذا وجدوا؟ (التقرير المدرسي)
قاموا بتشغيل أفضل نماذج الذكاء الاصطناعي (سواء المجانية/مفتوحة المصدر أو المدفوعة/مغلقة المصدر) عبر هذا الاختبار الجديد. وإليك النتيجة:
- الأخبار الجيدة: النماذج المدفوعة "مغلقة المصدر" (مثل Seedream 4.0 و Gemini 2.5) هي الأفضل حالياً في اتباع هذه التعليمات الجامحة. إنها تشبه طلاب الفن المتفوقين الذين يمكنهم التعامل مع الطلبات المعقدة.
- الأخبار السيئة: حتى أفضل النماذج تعاني. فهي غالباً ما تفشل في الحفاظ على هوية الشخصية الأصلية (الاتساق البصري). على سبيل المثال، قد يحولون شخصاً إلى كعكة، لكن الكعكة لا تشبه الشخص على الإطلاق.
- الأمل في المصادر المفتوحة: النماذج المجانية تلحق بالركب بسرعة! نماذج مثل Qwen-Image-Edit تؤدي بشكل جيد بشكل مفاجئ، مما يظهر أن الفجوة بين الأدوات المجانية والمدفوعة تتقلص.
لماذا يهم هذا؟
فكر في CREval كمترجم عالمي بين الإبداع البشري وقدرة الذكاء الاصطناعي.
- للمطورين: يخبرهم بالضبط أين يخفق الذكاء الاصطناعي الخاص بهم (مثلاً: "أنت رائع في اتباع التعليمات، لكنك تستمر في إفساد الوجوه").
- للمستخدمين: يمنحنا طريقة موثوقة لمعرفة أي أداة ذكاء اصطنا induced فعلياً في التعامل مع أفكارنا الإبداعية، الغريبة، والرائعة.
باختصار، CREval يوقفنا عن التخمين فيما إذا كان فن الذكاء الاصطناعي جيداً أم لا. إنه يعطينا تقريراً مدرسياً واضحاً وخطوة بخطوة يشرح بالضبط ما فعله الذكاء الاصطناعي بشكل صحيح وما أخطأ فيه، مما يساعدنا على بناء أدوات أفضل للتعبير الإبداعي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.