← أحدث الأبحاث
💻 computer science

Orthogonal Negative Guidance in Attention Feature Space for Text-to-Image Generation

تقترح هذه الورقة "التوجيه السلبي المتعامد" (Orthogonal Negative Guidance)، وهي طريقة خالية من التدريب لتوليد الصور من النصوص، تعمل على كبح المفاهيم غير المرغوب فيها عن طريق تعميم ميزات انتباه المطالبة السلبية لتكون متعامدة بالنسبة للمطالب الإيجابية، مما يحقق إزالة فائقة للمفاهيم مع الحفاظ على جودة الصورة ومطابقة المطالبة.

المؤلفون الأصليون: Jungmin Ko, Jungwon Park, Jimyeong Kim, Changin Choi, Wonseok Lee, Wonjong Rhee

نُشر 2026-05-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jungmin Ko, Jungwon Park, Jimyeong Kim, Changin Choi, Wonseok Lee, Wonjong Rhee

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك شيف ماهر (الذكاء الاصطناعي) موهوب للغاية في طهي الأطباق بناءً على وصفة معينة (النص المكتوب). يمكنك جعل "وعاء من الرامين" يبدو شهياً، ولكن هناك مشكلة: في كل مرة تصنع فيها الرامين، تضع تلقائياً بيضة مسلوقة، حتى لو لم يطلبها الزبون.

إذا قلت للشيف ببساطة، "لا بيض!" (أمر سلبي/Negative Prompt)، فقد يرتبك الشيف وقد يضع المزيد من البيض بالخطأ، أو قد يفسد الطبق بالكامل وهو يحاول تجنب البيض. هذا هو الصراع الحالي مع مولدات الصور بالذكاء الاصطناعي: إخبارهم بما لا يجب تضمينه هو أمر صعب بشكل مفاجئ.

تقدم هذه الورقة البحثية تقنية ذكية جديدة تسمى التوجيه السلبي المتعامد (Orthogonal Negative Guidance). وإليك كيف تعمل باستخدام تشبيهات بسيطة:

١. المشكلة: "الممحاة الخرقاء"

الأساليب الحالية لإزالة الأشياء غير المرغوب فيها (مثل "البيض" من "الرامين") تشبه استخدام ممحاة ضخمة وخرقاء على رسمة.

  • نهج "نفي الوصف" (Prompt Negation): أنت تقول فقط "لا بيض". غالباً ما يتجاهلك الذكاء الاصطناعي أو يرتبك.
  • نهج "الطرح" (Subtraction): تحاول بعض الأساليب طرح فكرة "البيض" من فكرة "الرامين". ولكن تخيل لو أن كلمة "البيض" وكلمة "الرامين" مكتوبتان بنفس الحبر. إذا حاولت مسح كلمة "البيض"، فقد تمسح بالخطأ أجزاءً من كلمة "الرامين" أيضاً، مما يتركك بصورة باهتة ومكسورة.

٢. الحل: "الفلتر الذكي" (التوجيه السلبي المتعامد)

الأسلوب الذي يقترحه المؤلفون يعمل مثل فلتر ذكي أو منخل متخصص. بدلاً من المسح العشوائي، فإنه ينظر إلى "المكونات" (الميزات الرياضية) التي يستخدمها الذكاء الاصطناعي لبناء الصورة.

  • الإعداد: يقوم الذكاء الاصطناعي ببناء الصورة باستخدام مسارين من المعلومات:

    1. المسار الإيجابي: "اصنع وعاء من الرامين".
    2. المسار السلبي: "لا تصنع بيضة".
  • الخدعة السحرية (التعامد - Orthogonalization):
    تخيل أن "الرامين" هو متجه (سهم) يشير إلى اتجاه معين. وسهم "لا بيض" هو سهم آخر.

    • أحياناً، يشير سهم "لا بيض" في اتجاه يتداخل مع سهم "الرامين". إذا قمت فقط بطرح سهم "لا بيض"، فستفسد "الرامين".
    • هذه الطريقة الجديدة تحسب سهم "لا بيض" وتقوم بتدويره بحيث يكون متعامداً تماماً (بزاوية 90 درجة) مع سهم "الرامين".
    • بعد ذلك، تقوم فقط بإزالة الجزء من سهم "لا بيض" الذي يبرز جانباً (الجزء الذي لا يتداخل مع الرامين).

التشبيه: فكر في "الرامين" كشعاع ضوء أحمر، و"البيض" كشعاع ضوء أزرق. كلاهما يسلط الضوء على نفس الجدار.

  • الأساليب القديمة تحاول إطفاء الضوء الأز_، ولكن أثناء القيام بذلك، تجعل الضوء الأحمر خافتاً أيضاً.
  • هذه الطريقة الجديدة تجد الجزء من الضوء الأزرق الذي لا يسلط الضوء على الأحمر، وتقوم بحجب ذلك الجزء المحدد فقط. يبقى الضوء الأحمر (الرامين) ساطعاً وواضحاً، بينما يتم حجب الضوء الأز_ (البيض) تماماً.

٣. ما الذي يحققه هذا؟

بسبب دقة هذه الطريقة، يمكنها القيام بأشياء لا تستطيع الأساليب الأخرى القيام بها:

  • كبح المفاهيم المتعددة (Multi-Concept Suppression): يمكنك أن تطلب من الذكاء الاصطناعي إزالة "البيض" و"عيدان الأكل" في نفس الوقت، وسيتعامل مع كليهما دون إفساد وعاء الرامين.
  • القابلية للضبط (Adjustable Strength): يمكنك تدوير "مقبض" لتحديد مقدار رغبتك في كبح البيض. يمكنك الانتقة من "ربما لا يوجد بيض" إلى "بالتأكيد لا يوجد بيض" دون أن تتحول الصورة إلى شيء مشوه.
  • لا حاجة لإعادة التدريب: الجزء الأفضل هو أن هذا لا يتطلب إعادة تعليم الذكاء الاصطناعي. إنها خدعة "وصل وشغل" (Plug-and-play) تُطبق أثناء صنع الصورة.

٤. النتائج

اختبر المؤلفون هذا على اختبار مرجعي يسمى DCS-Bench (اختبار كبح المفاهيم المتنوعة)، وهو بمثابة اختبار يحتوي على 200 سيناريو مختلف (على سبيل المثال، "طبيب" بدون "سماعة طبية"، أو "غرفة معيشة" بدون "أريكة").

  • النتيجة: في الاختبارات البشرية، فضل الناس هذه الطة الجديدة على أفضل الخيارات الأخرى بنسبة تقارب 19%.
  • الجودة: لم تكن الصور باهتة أو غريبة. ظل "الرامين" يبدو كالرامين، ولكن بدون "البيض" غير المرغوب فيه.

ملخص

باختصار، تحل هذه الورقة البحثية مشكلة "إخبار الذكاء الاصطناعي بما لا يجب رسمه" باستخدام خدعة رياضية لفصل الأفكار "السيئة" عن الأفكار "الجيدة" قبل أن تختلط معاً. الأمر يشبه وجود حارس عند ملهى ليلي يعرف تماماً كيف يمنع الضيف غير المرغوب فيه (البيضة) من الدخول دون أن يطرد بالخطأ كبار الشخصيات (الرامين).

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →