GLEaN: A Text-to-image Bias Detection Approach for Public Comprehension
تقدم هذه الورقة GLEaN، وهي مسار عمل قابل للتوسع ومستقل عن النماذج، يقوم بتوليد صور بورتريه مركبة تمثيلية من نماذج تحويل النص إلى صورة لجعل التحيزات الخوارزمية مقروءة بصرياً ومفهومة بسرعة للجمهور العام دون الحاجة إلى خبرة إحصائية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك فناناً سحرياً، فائق الذكاء، يمكنه رسم أي صورة تصفها له بمجرد قراءة كلماتك. إذا قلت له "طبيب"، سيرسم طبيباً. إذا قلت له "مجرم"، سيرسم مجرماً. هذا الفنان هو ذكاء اصطناعي، وقد أصبح بارعاً جداً في عمله.
لكن هناك مشكلة: هذا الفنان لديه تحيز سري. لقد تعلم الرسم من خلال النظر إلى ملايين الصور والأفلام القديمة على الإنترنت. ولأن تلك المصادر القديمة كانت غالباً ما تحتوي على صور نمطية (مثل "الأطباء رجال" أو "المجرمون يبدون بشكل معين")، فقد تعلم الفنان تلك الصور النمطية بالخطأ أيضاً.
المشكلة هي أن معظم طرق إثبات هذا التحيز تشبه قراءة جدول بيانات معقد وممل مليء بالرياضيات. إذا أظهرت ذلك الجدول للشخص العادي، فقد يشعر بالملل ويفقد التركيز ويفوت عليه الأمر.
تقدم هذه الورقة البحثية أداة جديدة تسمى GLEaN (والتي تبدو مثل كلمة "glean" بالإنجليزية، وتعني جمع المعلومات). تم تصميم GLEaN لإظهار التحيز بطريقة يمكن لأي شخص فهمها فوراً، دون الحاجة إلى شهادة في الإحصاء.
الوصفة السحرية: كيف تعمل GLEaN؟
تخيل GLEaN كوسيلة لإنشاء "بورتريه المتوسط الفائق". إليك العملية خطوة بختلو، مشروحة ببساطة:
- مرحلة "الحشد" (التوليد):
تخيل أنك تطلب من الذكاء الاصطناعي رسم "طبيب" 1,000 مرة. سيرسم 1,000 طبيب مختلف. بعضهم سيبدو كرجال، وبعضهم نساء، بعضهم بشرتهم داكنة، وبعضهم بشرتهم فاتحة.
- التشبيه: الأمر يشبه طلب من 1,000 شخص أن يرسموا "كلباً نموذجياً". ستحصل على 1,000 رسم تخطيطي مختلف.
- مرحلة "المحاذاة" (التصفية):
يأخذ الذكاء الاصطناعي تلك الرسومات الـ 1,000 ويقوم بمحاذاتها بدقة. يتأكد من أن كل وجه ينظر مباشرة إلى الكاميرا، وبنفس الحجم، وفي نفس الموقع. ويستبعد أي رسومات يظهر فيها الشخص وهو ينظر بعيداً أو مقلوب رأساً على عقب.
- التشبيه: تخيل أنك تأخذ 1,000 صورة لأشخاص وتستخدم برنامج تحرير صور لقص جميع الصور بحيث تكون أعينهم في نفس المكان تماماً على الشاشة.
- مرحلة "الشبح" (التركيب):
هذه هي الخدعة السحرية. يأخذ الذكاء الاصطنا\ال تلك الصور الـ 1,000 المحاذية ويمزجها في صورة واحدة فقط. هو لا يكتفي بمتوسط الألوان فحسب؛ بل يجد "البكسل الأوسط" لكل نقطة.
- النتي نتيجة: ستحصل على وجه واحد، ضبابي قليلاً وشبيه بالشبح. هذا الوجه يمثل بالضبط ما يعتقده الذكاء الاصطناعي أن الطبيب يبدو عليه عندما تجرد منه التفاصيل الفردية.
ماذا وجدوا؟
استخدم الباحثون هذه الطريقة على 40 أمراً مختلفاً (مثل "مصرفي"، "لاجئ"، "ممرض"، "مدان"). والبورتريهات "الشبحية" الناتجة حكت قصة صادمة:
- "النموذج الافتراضي" هو الذكر: عندما طلبوا "مديراً تنفيذياً" أو "قائداً"، كان البورتريه الشبح للرجل دائماً تقريباً. وعندما طلبوا "ممرضة" أو "موظفة استقبال"، كان الشبح امرأة.
- لون البشرة والمكانة الاجتماعية: "الأشباح" ذات الوظائف رفيعة المستوى (مثل الرؤساء التنفيذيين أو القضاة) بدت ذات بشرة فاتحة جداً. أما "أشباح" الأدوار المهمشة أو الإجرامية (مثل "مدان" أو "لاجئ") فقد بدت داكنة البشرة بشكل ملحوظ.
- الغضب ولون البشرة: بدا أن الذكاء الاصطناعي يربط بين البشرة الداكنة وعاطفة "الغضب" أكثر من البشرة الفاتحة.
لماذا هذا أفضل من جدول البيانات؟
اختبر الباحثون هذا الأسلوب مقابل جدول بيانات تقليدي (قائمة من النسب المئوية). عرضوا النتائج على 291 شخصاً عادياً، وطلبوا منهم النظر إما إلى البورتريهات الشبحية أو إلى جدول البيانات.
- النتيجة: كلا المجموعتين فهمتا التحيز بنفس القدر. كلاهما أدرك: "مهلاً، هذا الذكاء الاصطناعي عنصري وجنسي".
- الفائز: الأشخاص الذين نظروا إلى البورتريهات استوعبوا الرسالة بسرعة أكبر بنسبة 32%.
- التشبيه: إنه الفرق بين قراءة تقرير طويل عن "الطقس" وبين مجرد النظر من النافذة لترى أنها تمطر. الصورة تصيبك بالمعنى فوراً؛ أما البيانات فتتطلب منك القيام بالعمليات الحسابية في رأسك.
الصورة الكبيرة
بنى المؤلفون معرضاً رقمياً بعنوان "النظرة الكامنة" (The Latent Gaze) لعرض هذه البورتريهات على الجمهور.
لماذا يهم هذا الأمر؟
بما أن الذكاء الاصطنا يعمل على صنع الصور التي نراها في الأخبار، والإعلانات، ووسائل التواصل الاجتماعي، فنحن بحاجة لمعرفة ما الذي "يفكر" فيه. إذا عرضنا الرياضيات للخبراء فقط، سيبقى الجمهور في الظلام. GLEaN هو مثل الكشاف الذي يحول التحيزات غير المرئية إلى صورة يمكنك رؤيتها بلمحة بصر.
باختصار: GLEaN يأخذ تحيزات الذكاء الاصطناعي الخفية، ويمزجها في وجه واحد، ويضعها أمام المرآة حتى نتمكن جميعاً من رؤية ما يتخيله الآلة بالضبط.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.