Where Do Images Come From? Analyzing Captions to Geographically Profile Datasets
تتقصى هذه الورقة البحثية التحيز الجغرافي في مجموعات البيانات متعددة الوسائط واسعة النطاق عبر استخدام النماذج اللغوية الكبيرة لربط أزواج الصور والتعليقات بالدول، مما يكشف أن بيانات التدريب منحازة بشدة نحو الدول ذات الناتج المحلي الإجمالي المرتفع والناطقة باللغة الإنجليزية وتفتقر إلى تمثيل كبير من دول الجنوب العالمي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
مشكلة "المرآة العالمية": لماذا يرى الذكاء الاصطيائي العالم من منظور غربي؟
تخيل أنك تقوم ببناء ألبوم صور سحري وعملاق، من المفترض أن يحتوي على صورة لكل شيء في العالم. تسأل الألبوم: "أرني صورة لمنزل"، فيريك منزلاً في ضاحية سكنية مع سياج أبيض في أمريكا. تسأله: "أرني طريقاً"، فيريك طريقاً سريعاً واسعاً ومعبداً في أوروبا.
قد تفكر: "مهلاً، ماذا عن المنازل الملونة في المغرب؟ ماذا عن المسارات الترابية المتعرجة في جبال الأنديز؟ ماذا عن الشوارع الصاخبة في مومباي؟"
هذه الورقة البحثية، "من أين تأتي الصور؟"، هي استقصاء علمي حول سبب امتلاك هذه "الألبومات السحرية للصور" (والتي نسميها نماذج الذكاء الاصطناعي مثل Stable Diffusion) رؤية منحازة ومتحيزة لكوكبنا.
١. انحياز "الجار الغني" (الاكتشاف الجوهري)
بحث الباحثون في المجموعات الضخمة من الصور والنصوص المستخدمة لتدريب الذكاء الاصطناعي. أرادوا معرفة: من أين تأتي هذه الصور حقاً؟
للقيام بذلك، استخدموا ذكاءً اصطناعياً ذكياً (نموذج لغة كبير - LLM) لقراءة التعليقات التوضيحية لملايين الصور. إذا قال التعليمان: "غروب شمس جميل في باريس"، عرف الذكاء الاصطناعي أن يصنف تلك الصورة على أنها من فرنسا.
النتيجة: البيانات غير متوازنة بشكل هائل. الأمر يشبه إقامة حفلة ضخمة حيث ٨٠٪ من الضيوف من الولايات المتحدة والمملكة المتحدة وكندا، بينما يكاد لا يُدعى أشخاص من أفريقيا أو أمريكا الجنوبية.
وجد الباحثون رابطاً مباشداً بين المال والظهور: كلما كانت الدولة أكثر ثراءً (مقاسة بالناتج المحلي الإجمالي)، زاد احتمال وجود صورها في "عقل" الذكاء الاصطناعي. إذا كانت الدولة قوية اقتصادياً، فإن الذكاء الاصطناعي "يراها"؛ وإذا لم تكن كذلك، فإن الذكاء الاصطناعي يكون "أعمى" عنها فعلياً.
٢. "فخ الصور النمطية" (التنوع مقابل التكرار)
قد تعتقد: "حسناً، الولايات المتحدة لديها صور أكثر. ولكن بالتأكيد، ستكون صور الهند أو المكسيك متنوعة وملونة!"
اختبر الباحثون هذا باستخدام "درجة التنوع". ووجدوا أنه مجرد امتلاك بلد ما لعدد أكبر من الصور لا يعني بالضرورة أن تلك الصور متنوعة.
القياس التشبيهي: تخيل مسافرين.
- المسافر (أ) من النرويج: يلتقط ١٠٠٠ صورة، لكنها جميعاً لنفس الجبل الثلجي من زوايا مختلفة قلياً.
- المسافر (ب) من المكسيك: لا يلتقط سوى ١٠٠ صورة، لكنها تشمل سوقاً شعبياً، وحفل زفاف، وسيارة شرطة، وجبلاً.
على الرغم من أن المسافر (أ) التقط صوراً أكثر، إلا أن مجموعة المسافر (ب) أكثر "تنوعاً". وجد الباحثون أن بيانات تدريب الذكاء الاصطناعي غالباً ما تعاني من هذه المشكلة. قد يحتوي على العديد من الصور لبلد ما، لكنها جميعاً تبدو متشابهة، مما يؤدي إلى النمطية.
٣. "الوادي الغريب" للنماذج المولدة
أخيراً، اختبر الباحثون الذكاء الاصطناعي نفسه. طلبوا منه توليد صور لأشياء محددة في أماكن محددة، مثل "سيارة في الهند".
النتيجة: أنتج الذكاء الاصطناعي صوراً بدت "واقعية" (لم تبدُ كرسوم كرتونية مزيفة)، لكنها كانت تعاني من تغطية رديئة للغاية.
عندما طُلب منه إنتاج صورة لسيارة هندية، مال الذكاء الاصطناعي لتوليد مركبات قديمة أو متهالكة أو متهدمة. لقد التقط "فكرة" السيارة في الهند، لكنه أغفل الواقع المتمثل في السيارات الحديثة والمتنوعة واللامعة التي تسير بالفعل على الطرق الهندية اليوم. إنه يشبه فناناً لم يرَ سوى بطاقة بريدية واحدة لمدينة ما، ويعتقد أن المدينة بأكملها تبدو تماماً مثل تلك البطاقة.
لماذا يهم هذا؟
إذا استخدمنا نماذج الذكاء الاصطنا هذه لتصميم المدن، أو كتابة كتب التاريخ، أو إنشاء الأفلام، فإننا نعلم العالم دون قصد أن يرى من خلال نافذة ضيقة جداً وذات مركزية غربية.
الخلاصة: لجعل الذكاء الاصطناعي "ذكياً" و"عالمياً" حقاً، لا يمكننا مجرد كشط محتوى الإنترنت وتوقع الأفضل. يجب علينا أن نخرج عمداً للبحث عن القصص، والألوان، والمناظر الطبيعية للعالم أجمع — وليس فقط الأجزاء التي يسهل العثور عليها عبر الإنترنت.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.