← أحدث الأبحاث
💻 computer science

GeoDiv: Framework For Measuring Geographical Diversity In Text-To-Image Models

تقدم الورقة البحثية GeoDiv، وهو إطار عمل مبتكر يسخر النماذج اللغوية الكبيرة ونماذج اللغة والرؤية، لقياس وكشف التحيزات الجغرافية والأنماط الاجتماعية والاقتصادية السائدة في توليد الصور من النصوص بشكل منهجي، مما يوضح كيف تصور النماذج الحالية دولاً مثل الهند ونيجيريا وكولومبيا بطرق توحي بالفقر بشكل غير متناسب.

المؤلفون الأصليون: Abhipsa Basu, Mohana Singh, Shashank Agnihotri, Margret Keuper, R. Venkatesh Babu

نُشر 2026-02-26
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Abhipsa Basu, Mohana Singh, Shashank Agnihotri, Margret Keuper, R. Venkatesh Babu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك كاميرا سحرية يمكنها التقاط صورة لأي شيء تصفه. تقول: "التقطي صورة لمنزل في نيجيريا"، وكليك! تنشئ واحدة. تقول: "التقطي صورة لمنزل في اليابان"، وكليك! تنشئ أخرى.

هكذا تعمل نماذج تحويل النص إلى صورة (T2I) اليوم. إنها تحظى بشعبية هائلة، ولكن هناك مشكلة: فهي متحيزة.

إذا طلبت من هذه الكاميرا السحرية أن تظهر لك منزلاً في نيجيريا، فقد تظهر لك دائماً كوخاً متهالكاً ومغطى بالتراب. وإذا طلبت منها منزلاً في اليابان، فقد تظهر لك دائماً شقة عصرية وفائقة الحداثة. الأمر كما لو أن الكاميرا لديها عدسة مكسورة لا ترى العالم إلا من خلال مرشح ضيق للغاية ومليء بالصور النمطية. إنها تنسى أن نيجيريا تمتلك أيضاً ناطحات سحاب حديثة، وأن اليابان تضم أيضاً قرى ريفية قديمة.

تقدم هذه الورقة البحثية أداة جديدة تسمى GeoDiv (التنوع الجغرافي) لإصلاح هذا الأمر. فكر في GeoDiv كـ "مفتش فحص العالم".

الأداتان الرئيسيتان في حقيبة المفتش

بنى الباحثون GeoDiv لقياس التنوع بطريقتين محددتين، مثل فحص سيارة للتأكد من المحرك وطلاء الهيكل معاً.

1. "المؤشر البصري للوضع الاجتماعي والاقتصادي" (SEVI) – فحص "الثراء والحالة"

هذا الجزء من المفتش ينظر إلى طابع الصورة. وهو يطرح سؤالين كبيرين:

  • الرخاء: هل يبدو هذا غنياً أم فقيراً؟ (هل هو قصر أم كوخ؟)
  • الصيانة: هل يبدو جديداً تماماً ومعتنى به جيداً، أم أنه متهالك ومتهدم؟

التشبيه: تخيل أنك تحكم على حي سكني.

  • التحيز: إذا كانت الكاميرا تظهر نيجيريا دائماً كـ "حي فقير ومتهالك" والولايات المتحدة كـ "ضاحية مثالية ولامعة"، فإن درجة SEVI ستكون سيئة للغاية. هذا يكشف أن الذكاء الاصطناعي يعزز الصورة النمطية بأن بعض الدول فقيرة دائماً وأخرى غنية دائماً.
  • النتيجة: وجدت الورقة أن النماذج مثل FLUX.1 بارعة في جعل الأشياء تبدو "لامعة وغنية" (صيانة عالية)، لكنها تجعل كل البلدان تبدو متشابهة. وفي الوقت نفسه، غالباً ما تجعل النماذج الأقدم البلدان النامية تبدو "متهالكة وفقيرة" بشكل تلقائي.

2. "مؤشر التنوع البصري" (VDI) – فحص "التنوع"

هذا الجزء من المفتش ينظر إلى التفاصيل. ويسأل: "هل جميع المنازل لها نفس اللون؟ هل جميع الطرق من النوع نفسه؟"

  • مظهر الكيان: كيف يبدو الشيء؟ (هل السيارة سيارة سيدان حمراء أم شاحنة زرقاء؟ هل المنزل مبني من الطوب أم من الطين؟)
  • مظهر الخلفية: ماذا يوجد حوله؟ (هل الطريق مرصوف بالأسفلت، أم هو طريق ترابي؟ هل هناك جبال أم مجرد حقول مسطحة؟)

التشبيه: تخيل علبة ألوان خشبية.

  • تنوع منخفض: إذا طلبت "سيارة في 10 دول مختلفة" وأعطاك الذكاء الاصطناعي 10 سيارات سيدان حمراء متطابقة على طريق مرصوف، فهذا يشبه امتلاك علبة بها قلم تلوين أحمر واحد فقط. إنه أمر ممل وزائف.
  • تنوع عالٍ: يجب أن يعطيك الذكاء الاصطناعي الجيد سيارة سيدان حمراء في أمريكا، و"توك توك" في الهند، ودراجة نارية في كينيا، وسيارة كلاسيكية في إيطاليا. هذه هي علبة الألوان الكاملة!
  • النتيجة: وجدت الورقة أنه بينما تتحسن نماذج الذكاء الاصطناعي الجديدة في جعل الأشياء تبدو "واقعية"، إلا أنها في الواقع تصبح أسوأ في إظهار التنوع. إنها تصبح موحدة للغاية.

كيف يعمل GeoDiv في الواقع؟

بدلاً من أن يقوم إنسان بمراجعة 160,000 صورة (وهو أمر سيستغرق وقتاً طويلاً جداً)، يستخدم GeoDiv مساعدين ذكاء اصطناعي (نماذج لغوية كبيرة ونماذج رؤية ولغة) للقيام بالعمل الشاق.

  1. المحاور: يعمل الذكاء الاصطناعي كمراسل. ينظر إلى صورة منزل في نيجيريا ويسأل: "هل السقف مسطح أم مائل؟ هل الطريق ترابي أم مرصوف؟ هل يبدو هذا غنياً أم فقيراً؟"
  2. مسجل النقاط: يقوم بعدّ الإجابات. إذا كانت 90% من المنازل في نيجيريا ذات طرق ترابية و90% من المنازل في المملكة المتحدة ذات طرق مرصوفة، فإن الذكاء الاصطناعي يعرف أن هناك تحيزاً.
  3. تقرير الدرجات: يعطي تقريراً للنموذج. الدرجة العالية تعني أن الذكاء الاصطناعي يظهر العالم كما هو في الحقيقة (متنوع ومتنوع الخيارات). الدرجة المنخفضة تعني أن الذكاء الاصطناعي عالق في صورة نمطية.

ماذا اكتشفوا؟

وجد "مفتش فحص العالم" أشياء صادمة:

  • فخ "الدولة الفقيرة": عند طلب إنشاء صور لدول مثل الهند ونيجيريا وكولومبيا، كان الذكاء الاصطناعي يجعلها دائماً تبدو فقيرة ومتهالكة. نادراً ما أظهرها كدول حديثة أو غنية.
  • مرشح "الدولة الغنية": عند طلب صور لـ الولايات المتحدة أو المملكة المتحدة أو اليابان، كان الذكاء الاصطناعي يجعلها دائماً تبدو ميسورة الحال، نظيفة، ومثالية.
  • مشكلة "المقاس الواحد للجميع": النماذج الأحدث (مثل FLUX.1) بارعة جداً في جعل الأشياء تبدو "جميلة"، لدرجة أنها تجعل كل بلد يبدو كضاحية غربية غنية. لقد فقدت النكهات الثقافية الفريدة لمختلف الأماكن.

لماذا يهم هذا؟

إذا تركنا نماذج الذكاء الاصطناعي هذه تستمر في صنع هذه الصور المتحيزة، فستبدأ في تشكيل كيفية رؤيتنا للعالم. إذا أظهر الذكاء الاصطناعي دائماً نيجيريا كمكان للفقر، فقد يبدأ الناس في الاعتقاد أن هذا هو كل ما يوجد في نيجيريا.

GeoDiv هو أول أداة تمنحنا "تقرير درجات" لهذه النماذج. فهو لا يكتفي بالقول "هذا يبدو سيئاً"؛ بل يخبرنا بالضبط أين يكمن التحيز (على سبيل المثال: "أنت تجعل كل الطرق في نيجيريا تبدو ترابية").

الخلاصة

هذه الورقة البحثية تشبه مرآة موضوعة أمام الذكاء الاصطناعي. إنها تظهر لنا أنه بينما يعد الذكاء الاصطناعي مذهلاً في ابتكار الفن، إلا أنه حالياً مسافر سيء للغاية. إنه لا يعرف سوى الصور النمطية.

GeoDiv هو البوصلة التي تساعد المطورين على إصلاح الخريطة، لضمان أنه عندما نطلب من الذكاء الاصطناعي أن يرينا العالم، فإنه يرينا العالم الحقيقي—بفوضويته، وتنوعه، وجماله، ومفاجآته، وليس مجرد مجموعة من الصور النمطية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →