← أحدث الأبحاث
💬 NLP

General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level

تقدم هذه الورقة البحثية "مُزيل الانحياز العباراتي العام" (General Phrase Debiaser)، وهو مسار آلي متعدد الرموز يعمل على التخفيف من الانحيازات على مستوى العبارات في نماذج اللغة المقنعة عبر توليد عبارات نمطية من ويكيبيديا واستخدامها لتحديد وإزالة انحياز المحفزات المسببة للانحياز، محققاً بذلك تخفيضات كبيرة في الصور النمطية الجندرية عبر مختلف المجالات وأحجام النماذج.

المؤلفون الأصليون: Bingkang Shi, Xiaodan Zhang, Dehan Kong, Yulei Wu, Zongzhen Liu, Honglei Lyu, Longtao Huang

نُشر 2026-09-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bingkang Shi, Xiaodan Zhang, Dehan Kong, Yulei Wu, Zongzhen Liu, Honglei Lyu, Longtao Huang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

أصبحت الحواسيب التي تقرأ وتكتب اللغة ماهرة بشكل ملحوظ، حيث باتت قادرة على تلخيص الأخبار، وترجمة المستندات، وحتى تأليف الشعر. هذه الأنظمة، المعروفة باسم النماذج اللغوية، تتعلم من خلال دراسة كميات هائلة من النصوص من الإنترنت، فتمتص الأنماط والحقائق والآراء الواردة فيها. ومع ذلك، نظرًا لأن اللغة البشرية مليئة بالتحيزات التاريخية والقوالب النمطية الثقافية، فإن هذه النماذج غالبًا ما تتعلم تكرارها. فقد يفترض الحاسوب أن الممرضة هي دائمًا امرأة أو أن عالم الرياضيات هو دائمًا رجل، ببساطة لأن هذا هو ما رآه أكثر من غيره في بيانات التدريب الخاصة به. وهذه مشكلة كبيرة لأي شخص يحاول استخدام هذه الأدوات بشكل عادل، حيث يمكن للآلات أن تعزز دون قصد التحيزات الضارة المتعلقة بالجنس أو العرق أو المهنة. وبينما حاول الباحثون لفترة طويلة إصلاح هذه المشكلات، ركزت معظم المحاولات السابقة على تصحيح كلمات مفردة، ومعاملة التحيز كمسألة بسيطة تتمثل في استبدال بعض المصطلحات الإشكالية. ومع ذلك، نادرًا ما يعيش التحيز في العالم الحقيقي في عزلة؛ بل يختبئ في الطريقة التي تتحد بها الكلمات لتشكل عبارات وجملًا، حيث يتغير المعنى بطرق خفية وخطيرة.

قام فريق من الباحثين من الأكاديمية الصينية للعلوم، ومجموعة علي بابا، وجامعة بريستول، بتطوير طريقة جديدة لمعالة هذا الطبقة الأعمق من التحيز. أطلقوا على نهجهم اسم "مزيل التحيز العباراتي العام" (General Phrase Debiaser)، وهو نظام مصمم لتنقية النماذج اللغوية من خلال النظر إلى مجموعات من الكلمات بدلاً من الكلمات الفردية فقط. أدرك الباحثون أنه لكي يتم إصلاح المشكلة حقًا، كان عليهم العثوف إلى العبارات المحددة التي يكون فيها تحيز النموذج في أقوى حالاته ثم تعليم النموذج تجاهل تلك الارتباطات. تبدأ عمليتهم بطريقة ذكية لجمع الأدلة اللازمة للتصحيح. فبدلاً من الطلب من البشر كتابة كل عبارة متحيزة محتملة يدويًا، وهو أمر سيكون بطيئًا وغير مكتمل، يقوم النظام بمسح صفحات ويكيبيديا. إنه يبحث عن الروابط التشعبية التي تربط بمواضيع مثل المهن، والرياضيات، والفن، والعلوم، ويستخدم هذه الروابط لتحديد العبارات النمطية التي قد يكون النموذج قد تعلمها. على سبيل المثال، قد يجد أن النموذج يربط بقوة بين كلمة "رجل" و"النظرية الرياضية" وبين كلمة "امرأة" و"فن الرقص".

بمجرد أن يحدد النظام هذه العبارات المتحيزة، ينتقل إلى المرحلة الثانية: وهي إيجاد الأسئلة أو "المحفزات" (prompts) الدقيقة التي تثير تحيز النموذج. تخيل أنك تسأل الحاسوب عن إكمال جملة مثل: "الشخص [فلان] هو خبير في [فراغ]". ترك الباحثون الحاسوب يبحث عبر ملايين الجمل الممكنة ليجد الجمل التي من المرجح أن يقدم فيها تخمينًا متحيزًا. هم لا يبحثون فقط عن إجابات مكونة من كلمة واحدة؛ بل يبحثون عن إجابات متعددة الكلمات، مثل "النظرية الرياضية" مقابل "فن الرقص"، لأن هذا هو المكان الذي يختبئ فيه التحيز الحقيقي غالبًا. ومن خلال قياس مدى اختلاف استجابة النموذج لهذه العبارات عندما يكون الموضوع رجلًا مقابل امرأة، يحسب النظام درجة تمثل قوة التحيز. ثم يستخدم الباحثون هذه الدرجة لتوجيه عملية "الضبط الدقيق" (fine-tuning). إنهم يغذون هذه الجمل المحددة التي تثير التحيز مرة أخرى في النموذج، ولكن هذه المرة، يقومون بتعديل الإعدادات الداخلية للنموذج لتقليل الفرق في استجاباته. والهدف ليس محو معرفة النموذج بالرياضيات أو الفن، بل التأكد من أنه لم يعد يربط تلك المجالات بجنس معين.

تظهر نتائج هذا العمل أن استهداف العبارات أكثر فعالية بكثير من استهداف الكلمات المفردة. اختبر الباحثون طريقتهم على ثلاثة نماذج لغوية معروفة ذات أحجام مختلفة، ووجدوا أنها قللت بشكل كبير من التحيز الجنسي عبر كل من التخصصات المهنية والأكاديمية. وفي الاختبارات القياسية المصممة لقياس التحيز، تحسنت النماذج بشكل كبير. على سبيل المثال، شهد أحد النماذج، وهو BERT، انخفاض درجة تحيزه من 0.35 إلى 0.12، بينما انخفض نموذج آخر، وهو ALBERT، من 0.72 إلى 0.16. تشير هذه الأرقام إلى أن النماذج أصبحت أقل عرضة لربط مهن أو مجالات معينة بجنس واحد دون الآخر. والأهم من ذلك، تحقق الباحثون مما إذا كانت عملية التنظيف هذه قد أضرت بقدرة النماذج على فهم اللغة بشكل عام. فقد أخضعوا النماذج التي تمت إزالة التحيز منها لسلسلة من اختبارات اللغة القياسية التي تغطي القواعد، والمشاعر، والمنطق، ووجدوا أن النماذج احتفظت بمعظم مهاراتها الأصلية. ظلت القدرة على فهم اللغة سليمة، مما يثبت أنه من الممكن إزالة الصور النمطية الضارة دون كسر ذكاء الآلة.

يمثل هذا النهج تحولًا في كيفية تفكير الباحثين في إصلاح الذكاء الاصطناعي. فقد اعتمدت الطرق السابقة غالبًا على قوائم كلمات خارجية كتبها البشر أو حاولت تصحيح المفردات الكاملة للنموذج دفعة واحدة، وهو ما قد يكون غير فعال أو يفتقر إلى الدقة في كيفية عمل التحيز فعليًا. وبالمقابل، يقوم "مزيل التحيز العباراتي العام"، من خلال أتمتة اكتشاف العبارات المتحيزة واستهداف تركيبات الكلمات المحددة حيث توجد المشكلة. ويرى الباحثون أن التصحيح على مستوى "متعدد الرموز" (multi-token) ضروري لأن التحيز البشري نادرًا ما يكون كلمة واحدة؛ بل هو نمط من الارتباط يمتد عبر العبارات. وبينما ركزت الدراسة على نماذج "المشفر فقط" (encoder-only)، وهي نوع محدد من النماذج اللغوية، فإن المبادئ التي كشف عنها الباحثون يمكن تطبيقها أيضًا على أنواع أخرى من الأنظمة. يوضح هذا العمل أنه من خلال النظر بعمق في بنية اللغة، يمكننا بناء أدوات ليست فقط أكثر ذكاءً، بل وأكثر عدلاً أيضًا، مما يضمن أن حواسيب المستقبل ستعكس تنوع العالم الذي تخدمه بدلاً من حدود بيانات التدريب الخاصة بها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →