SCHEMA for Gemini 3 Pro Image: A Structured Methodology for Controlled AI Image Generation on Google's Native Multimodal Model
تقدم هذه الورقة SCHEMA، وهي منهجية هندسة أوامر مهيكلة لنموذج Gemini 3 Pro Image من Google، والتي تستخدم نظاماً تصاعدياً ثلاثي المستويات وبنية نمطية لتحقيق معدلات امتثال عالية واتساق فائق عبر ستة مجالات احترافية بناءً على اختبارات تجريبية مكثفة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً فنياً موهوباً للغاية، ولكنه فوضوي بعض الشيء، يدعى Gemini. يمكن لهذا المساعد أن يرسم أي شيء تطلبه منه، ولكن إذا قلت له ببساطة، "ارسم غرفة معيشة جميلة"، فقد يعطيك غرفة بأريكة عائمة، أو سقف مصنوع من الجيلي، أو مخطط ألوان يتنافر مع علامتك التجارية.
لفترة طويلة، كان الأشخاص الذين يحاولون استخدام أدوات الفن بالذكاء الاصطناي مثل السياح الذين يصرخون بتوجيهات غامضة لسائق تاكسي: "خذني إلى مكان جميل!" (السائق هنا هو الذكاء الاصطناعي)، وسيقوم السائق بالتخمين، وغالباً ما ينتهي بك الأمر في الحي الخطأ.
هذه الورقة البحثية، التي كتبها الباحث لوكا كازانيجا (Luca Cazzaniga)، تقدم طريقة جديدة للتحدث مع هذا المساعد الفني تسمى SCHEMA. فكر في SCHEMA ليس كـ "أمر نصي" (Prompt)، بل كـ مخطط معماري صارم أو عقد قانوني للصورة التي تريدها.
إليك تفصيل الورقة البحثية بكلمات بسيطة، باستخدام بعض التشبيهات الإبداعية:
1. المشكلة: "الأمنية الغامضة" مقابل "المخطط الهندسي"
قبل SCHEMA، كان الناس يعاملون الذكاء الاصطناعي كجني سحري. كنت تتمنى أمنية، وهو يبذل قصارى جهده. لكن في العالم الحقيقي (مثل صنع إعلانات لسيارة أو صور لعرض عقار)، لا يمكنك الاعتماد على "بذل قصارى الجهد". أنت بحاجة إلى الدقة.
- الطريقة القديمة: "اصنع صورة رائعة لسيارة". (النتيجة: ربما شاحنة، أو ربما سيارة حمراء، أو زرقاء، أو ربما العجلات تذوب).
- طريقة SCHEMA: "اصنع صورة لسيارة حمراء محددة، مركونة بزاوية 45 درجة، تحت ضوء شمس دافئ (3000 كلفن)، بدون أي انعكاسات على غطاء المحرك".
2. المستويات الثلاثة للتحكم (تشبيه ألعاب الفيديو)
تقترح SCHEMA ألا تقفز مباشرة إلى المستوى الأصعب. فهي تحتوي على ثلاثة "أنماط" لمساعدتك على التعلم والحصول على نتائج أفضل:
- المستوى 1: BASE (نمط الاستكشاف)
- التشبيه: أنت تدخل غرفة مظلمة وتضغط على مفتاح الضوء لترى ما يوجد بداخلها.
- ماذا يفعل: تطلب من الذكاء الاصطناعي أن "يرينا ما يعتقده" فقط. هذا يساعدك على رؤية انحيازاته الطبيعية (مثلاً: "أوه، إنه دائماً يجعل السماء زرقاء"). الأمر يتعلق بالاكتشاف، وليس بالنتائج النهائية.
- المستوى 2: MEDIO (نمط المخرج)
- التشبيه: أنت الآن مخرج في موقع تصوير فيلم. أنت لا تمثل، لكنك تخبر الطاقم بالضبط أين يضعون الأضواء والكاميرا.
- ماذا يفعل: تستخدم قائمة مراجعة منظمة (7 صناديق محددة لتعبئتها) لتوجيه الذكاء الاصطناعي. تحصل هنا على مسودات احترافية.
- المستوى 3: AVANZATO (نمط المهندس المعماري)
- التشبيه: أنت مهندس بارع يبني جسراً. كل مسمار، كل قياس، وكل مادة يتم تحديدها بدقة الملليمتر.
- ماذا يفعل: هذا مخصص للمنتج النهائي. تستخدم الأرقام (مثل الألوان الدقيقة بأكواد Hex أو درجة حرارة الضوء بالكلفن) بدلاً من كلمات مثل "ساطع" أو "دافئ". هذا يمنحك تحكماً بنسبة 95%.
3. السر الخفي: "النواهي" تعمل بشكل أفضل من "الأوامر"
أحد أكبر الاكتشافات في الورقة البحثية هو سمة غريبة في كيفية عمل عقول الذكاء الاصطناعي.
- الاكتشاف: من الأسهل بكثير على الذكاء الاصطناعي اتباع أمر "لا تفعل" مقارنة بأمر "افعل".
- التشبيه: تخيل أنك تطلب من طفل أن ينظف غرفته.
- الأمر (أ): "اجعل الغرفة مثالية". (سيصاب الطفل بالارتباك: ما هي المثالية؟ قد يترك لعبة على السرير).
- الأمر (ب): "لا تترك ألعاباً على السرير. لا تترك ملابس على الأرض". (سيعرف الطفل تماماً ما يجب تجنبه، وستصبح الغرفة أنظف).
- النتيجة: وجدت الورقة أنه إذا قلت للذكاء الاصطناعي "لا حواف ضبابية" (نهي)، فإنه يتبع ذلك بنسبة 94% من المرات. أما إذا قلت له "اجعل الحواف حادة" (أمر)، فإنه يتبع ذلك بنسبة 91% فقط. الذكاء الاصطناعي أفضل في تجنب الأخطاء منه في تحقيق المثالية.
4. قاعدة "المرة الواحدة" (لا تعيد كتابة التاريخ)
تحذر الورقة من عادة شائعة: أخذ صورة من الذكاء الاصطناعي، ثم طلب "إصلاح" العينين، ثم أخذ تلك الصورة الجديدة وطلب "إصلاح" اليدين.
- المشكلة: الذكاء الاصطناعي لا "يصلح" الصورة؛ بل يعيد تفسيرها. في كل مرة تطلب فيها إصلاحاً، يصبح الذكاء الاصطناعي أكثر ارتباكاً، وتبدأ الصورة في التدهور (مثل نسخة ضوئية من نسخة ضوئية).
- قاعدة SCHEMA: إذا لم تعجبك النتيجة، ابدأ من جديد بمخطط أفضل. لا تحاول تعديل الصورة السيئة. عامل كل عملية توليد كبداية جديدة من المخطط الأصلي.
5. "استراتيجية الخروج" (معرفة متى تتوقف)
تتضمن SCHEMA "شجرة قرار". هذا يشبه نظام GPS يخبرك متى تغير السيارة.
- إذا كنت بحاجة لتعديل جزء صغير جداً من الصورة (مثل إزالة شخص)، تقول الورقة: "لا تستخدم هذه الأداة. اذهب واستخدم Adobe Firefly".
- إذا كنت بحاجة لشبكة هندسية مثالية، تقول الورقة: "اذهب واستخدم Midjourney".
- هي تعترف بأن أي أداة بمفردها ليست مثالية لكل شيء، وتمنحك خريطة للتبديل بين الأدوات عندما تصل الأداة الحالية إلى طريق مسدود.
6. "سحر" النصوص داخل الصور
اختبرت الورقة شيئاً صعباً للغاية على الذكاء الاصطماعي: كتابة نص داخل الصورة (مثل لافتة على متجر أو ملصق على زجاجة).
- النتيجة: باستخدام نمط "المهندس المعماري" الصارم (المستوى 3)، حصل الذكاء الاصطناعي على الهجاء والتموضع الصحيح بنسبة 95% من المحاولة الأولى.
- لماذا هذا مهم: عادةً ما يكتب الذكاء الاصطناعي كلمات غير مفهومة. هذا يثبت أنه إذا عاملت الذكاء الاصطناعي كمهندس صارم بدلاً من فنان مبدع، فيمكنه فعلياً القيام بأعمال التصميم الجرافيكي الاحترافية.
الملخص: ما هي الخلاصة الكبرى؟
تجادل الورقة بأن فن الذكاء الاصطناعي لم يعد يتعلق بـ "السحر" بعد الآن؛ بل يتعلق بالهندسة.
للحصول على نتائج احترافية، عليك التوقف عن التحدث إلى الذكاء الاصطناعي كصديق والبدء في التحدث إليه كبرنامج كمبيوتر. يجب أن تكون محدداً، وتستخدم "النواهي" بدلاً من "الأوامر"، وتستخدم الأرقام بدلاً من الصفات، وتعرف متى تتوقف عن التعديل وتبدأ من جديد.
SCHEMA هي كتيب التعليمات الذي يعلمك كيفية التحدث بهذه اللغة الجديدة، محولاً خدعة سحرية فوضوية إلى آلة صناعية موثوقة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.