MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment
تقدم هذه الورقة MM-SCALE، وهي مجموعة بيانات وإطار عمل واسع النطاق يعزز الاستدلال الأخلاقي لنماذج الرؤية واللغة عبر استبدال الإشراف الثنائي المنفصل بتقييمات عددية مستمرة مكونة من 5 درجات ومحاذاة قائمة قائمة على التأسيس، وذلك لالتقاط الطبيعة المتعددة والمتنوعة للأحكام الأخلاقية البشرية بشكل أفضل.
المؤلفون الأصليون:Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim
المؤلفون الأصليون: Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim
تخيل أنك تعلم روبوتاً كيف يكون "شخصاً جيداً" عندما ينظر إلى الصور ويقرأ القصص.
المشكلة: الروبوت يرى العالم باللونين الأبيض والأسود فقط في الوقت الحالي، يتم تدريب معظم الروبوتات (التي تسمى نماذج الرؤية واللغة) على رؤية العالم في صناديق صارمة من "جيد مقابل سيئ". إذا أظهرت لها صورة لشخص يساعد غريباً، فستقول "جيد". وإذا أظهرت لها شخصاً يدفع غريباً، فستقول "سيئ".
لكن الحياة الواقعية ليست فيلماً بالأبيض والأسود؛ إنها طيف كامل الألوان. أحياناً، تكون "مساعدة الغريب" أمراً رائعاً (مثل إعطاء شخص ما توصيلة في المطر). ولكن في أحيان أخرى، تكون مخاطرة (مثل إعطاء توصيلة لغريب في وقت متأخر من الليل في حي مشبوه). الروبوت يعاني من رؤية هذه الظلال الرمادية الدقيقة؛ فهو يعامل كل "مساعدة" على أنها جيدة بالتساوي، متجاهلاً السياق الذي يجعل الموقف خطيراً أو مقبولاً.
الحل: MM–SCALE ابتكر الباحثون أداة جديدة تسمى MM–SCALE (المقياس الأخلاقي متعدد الوسائط). فكر في هذا كدليل تدريب ضخم وعالي الدقة للروبوتات، ولكن مع ميزتين خاصتين:
تقييم النجوم من 1 إلى 5 (الحكم القياسي): بدلاً من مجرد السؤال "هل هذا جيد أم سيئ؟"، طلبوا من البشر تقييم السيناريوهات على مقيلة من 1 إلى 5.
تشبيه: تخيل مراجعة لمطعم. النظام الثنائي يسمح لك فقط بالقول "كُلْه" أو "لا تأكله". أما نظام MM–SCALE فيسمح لك بالقول: "إنه جيد، لكن الحساء كان بارداً"، أو "إنه رائع، لكنه حار قليلاً". هذا يعلم الروبوت أن بعض الأفعال هي "جيدة غالباً"، وبعضها "سيئة غالباً"، وبعضها يقع في المنتصف.
وسم "لماذا" (الاستدلال المرتكز): طلب الباحثون أيضاً من البشر الإشارة إلى لماذا أعطوا تقييماً معيناً. هل اتخذوا قرارهم بناءً على النص (القصة)، أم الصورة (ما يرونه)، أم كليهما؟
تشبيه: تخيل أنك تحكم على خدعة سحرية. إذا قلت "كانت مزيفة"، فهل تقول ذلك لأن القصة قالت إنها خدعة، أم لأنك رأيت السلك المخفي في الصورة؟ يعلم MM–SCALE الروبوت معرفة أي دليل (الصورة أم الكلمات) هو الذي يقود القرار فعلياً.
كيف بنوا ذلك: واجهة "MORALE" لإنشاء مجموعة البيانات هذه، بنى الفريق موقعاً إلكترونياً خاصاً يسمى MORALE.
قاموا بتوليد آلاف الصور لمواقف اجتماعية (مثل طفل يركض نحو حركة المرور).
كتبوا سيناريوهات قصصية مختلفة لكل صورة (مثل "الطفل يلعب لعبة المطاردة" مقابل "الطفل يركض باتجاه سيارة").
نظر البشر إلى الصورة والقصة، وأعطوا تقييماً من 1 إلى 5، ووضعوا وسماً يوضح ما إذا كانت الصورة أو الكلمات هي الأكثر أهمية.
حلقة "الاختلاف": كان النظام يعرض تخمين الروبوت. إذا خمن الروبوت "آمن" بينما قال الإنسان "غير آمن"، يقوم النظام بتمييز الحالة. هذا أجبر الإنسان على التحقق من سبب اختلافه، مما ساعد الباحثين في العثور على الحالات الصعبة التي كان الروبوت مرتبكاً فيها.
النتائج: روبوت أكثر ذكاءً ودقة عندما دربوا الروبوتات باستخدام بيانات MM–SCALE الجديدة، كانت النتائج مبهرة:
ترتيب أفضل: عندما طُلب منها ترتيب قائمة من السيناريوهات من "الأكثر أماناً" إلى "الأقل أماناً"، أدت الروبوتات التي تدربت باستخدام MM–SCALE مهمتها بشكل أفضل بكثير من تلك التي تدربت على بيانات "جيد/سيئ" القديمة. استطاعت التمييز بين "الخطر الطفيف" و"الخطر الشديد".
الاستقرار: لم تكن الروبوتات تخمن عشوائياً؛ بل كانت مستويات ثقتها تتوافق مع الواقع بشكل أفضل.
مفاجأة "الصورة": وجدت الدراسة أن 68% من الوقت، يغير البشر حكمهم الأخلاقي بعد رؤية الصورة. على سبيل المثال، قد تقول النصوص "مساعدة شخص ما"، وهو ما يبدو جيداً. ولكن إذا أظهرت الصورة أن الشخص يُدفع في الواقع نحو حركة المرور، فإن الإنسان يغير رأيه. طريقة التدريب الجديدة علمت الروبوت الانتباه إلى ذلك الدليل البصري.
باختصار تجادل الورقة البحثية بأنه لجعل الذكاء الاصطناعي ذكياً أخلاقياً، لا يمكننا مجرد تعليمه "الصح مقابل الخطأ". يجب أن نعلمه طيف الصواب والخطأ، ونوضح له كيف يغير العالم المرئي معنى الموقف. MM–SCALE هو أول مجموعة بيانات ضخمة تفعل ذلك، مما يساعد الروبوتات على فهم أن السياق هو كل شيء.
ملخص تقني: MM–SCALE
بيان المشكلة
تواجه نماذج الرؤية واللغة (VLMs) حاليًا صعوبة في إجراء أحكام ذات دلالة أخلاقية في السياقات متعددة الوسائط والغامضة اجتماعيًا. تعتمد أساليب المحاذاة الأمنية الحالية عادةً على الإشراف الثنائي (آمن/غير آمن) أو الزوجي (أ مقابل ب). وتفشل هذه المنهجيات في استيعاب الطبيعة المستمرة والعددية (scalar) للاستدلال الأخلاقي البشري، وغالبًا ما تغفل كيف تعيد السياقات البصرية والفروق الدقيقة للمواقف تشكيل التفسيرات الأخلاقية. تفتقر المعايير المرجعية السابقة إلى التغطية الشاملة للأحكام العددية والترسيخ الصريح للوسائط (ما إذا كان الحكم يعتمد على النص، أو الصورة، أو كليهما)، مما يحد من قدرة النماذج على التعامل مع الاستدلال الأخلاقي التعددي والحساس للسياق.
المنهجية
1. بناء مجموعة البيانات: MM–SCALE
قدم المؤلفون MM–SCALE (المقياس الأخلاقي متعدد الوسائط)، وهي مجموعة بيانات واسعة النطلة تتكون من 32,212 سيناريو أخلاقي مُعلق عليها، ومبنية على صور تم إنشاؤها بواسطة الذكاء الاصطناği.
المادة المصدرية: تم اشتقاق السيناريوهات من "Commonsense NormBank"، وتم تجسيدها بصريًا باستخدام Stable Diffusion v1.5 وDALL·E 3.
مخطط التوسيم (Annotation Schema): يتم توسيم كل زوج من (صورة-سيناريو) بـ:
ترسيخ الوسائط (Modality Grounding): تسميات توضح ما إذا كان الحكم يستند إلى النص، أو الصورة، أو كليهما.
خط أنابيب التوسيم (MORALE): طور المؤلفون MORALE (المحاذاة الأخلاقية والتقييم القائم على القوائم)، وهي واجهة تفاعلية عبر الويب.
النموذج في الحلقة (Model-in-the-Loop): يقارن النظام بين تقييمات الموضحين وتوقعات نموذج الرؤية واللغة (VLM).
معالجة التباين: إذا انحرف حكم النموذج بشكل كبير عن التقييم البشري، يقوم النظام بتفعيل فحص ترسيخ الوسائط لتحديد ما إذا كان النموذج قد انتبه للوسيط الخاطئ.
التوسع: إذا اتفق النموذج والإنسان، يُطلب من الموضحين إضافة سيناريوهات جديدة ذات صلة بالصورة لتوسيع نطاق التغطية.
ضبط الجودة: خضعت مجموعة البيانات لعمليات تصفية صارمة، بما في ذلك فحص التباين و"فحوصات الكناري" (canary checks)، مما أدى إلى اتساق عالٍ بين الموضحين (معامل كريبندورف α = 0.74 للدرجات، و0.71 للوسائط).
2. إطار التدريب: تحسين التفضيل القائم على القوائم
بدلاً من معاملة الأحكام العددية كملصقات مستقلة أو اختزالها إلى فئات ثنائية، يستخدم المؤلفون إطار عمل تحسين التفضيل القائم على القوائم (listwise preference optimization).
الهدف: يتم تدريب النموذج على إعادة إنتاج ترتيب التفضيل البشري عبر مجموعة كاملة من السيناريوهات المرتبطة بصورة واحدة.
دالة الخسارة: يستخدم المؤلفون خسارة ListMLE (تقدير الاحتمال الأقصى للقائمة). وهذا يشجع النموذج على تخصيص درجات عددية بحيث يتطابق الترتيب الناتج مع الترتيب الحقيقي (ground-truth permutation) للتقييمات البشرية.
البنية الهيكلية: يقوم هذا الإطار بضبط رأس انحدار عددي (scalar regression head) فوق نماذج الرؤية واللغة سابقة التدريب (مثل LLaVA-OneVision، وQwen2-VL، وPhi-3-Vision، وInstructBLIP).
المساهمات الرئيسية
مجموعة بيانات MM–SCALE: مجموعة بيانات مبتكرة تضم 32,212 سيناريو أخلاقي متعدد الوسائط تتميز بتقييمات عددية (1–5) وتوسيم صريح لـ ترسيخ الوسائط، مما يميزها عن المعايير المرجعية الثنائية أو الزوجية السابقة.
تحليل المحاذاة القائمة على القوائم: تحليل يوضح كيف يؤدي الإشراف العددي المدمج مع ترسيخ الوسائط إلى تحسين محاذاة نماذج الرؤية واللغة مع التفضيلات الأخلاقية البشرية، متجاوزًا المقارنات الثنائية المعزولة.
واجهة MORALE: واجهة ويب تفاعلية مفتوحة المصدر مصممة لجمع بيانات الاختلاف على نطاق واسع، مما يسهل المحاذاة المتمحورة حول الإنسان وتوسيع مجموعة البيانات من خلال التغذية الراجعة للنموذج في الحلقة.
النتائج التجريبية
قيم المؤلفون نماذج الرؤية واللغة التي تم ضبطها بدقة باستخدام MM–SCALE مقابل النماذج المدربة بأهداف التفضيل الثنائي (BPO) والتصنيف الثنائي (BCE).
دقة الترتيب: حققت النماذج المدربة باستخدام الإشراف العددي القائم على القوائم باستمرار أعلى مقاييس الترتيب، بما في ذلك NDCG@5 (يصل إلى 0.89) ومتوسط الرتبة المقلوبة (MRR)، متفوقة على النماذج المرجعية الثنائية والزوجية. يشير هذا إلى أن تعلم البنية الترتيبية الكاملة يوفر ترتيبًا عالميًا أفضل.
معايرة السلامة: بينما أظهرت النماذج المدربة ثنائيًا معدلات "غير آمن" أقل قليلاً (مقياس ثنائي يفضل الأهداف القائمة على العتبة)، إلا أنها أظهرت AUC-Safety أسوأ ومعايرة أقل استقرارًا. أنتجت النماذج القائمة على القوائم تنبؤات عددية أكثر سلاسة وتمييزًا، مع الحفاظ على معدلات سلامة تنافسية مع تقديم تقدير للمخاطر يتجاوز العتبة بشكل أفضل.
ترسيخ الوسائط: كشف التحليل التجريبي أن 68% من الأحكام الأخلاقية البشرية تغيرت بعد مشاهدة الصورة مقارنة بالملصقات النصية فقط. علاوة على ذلك، فإن 78% من هذه الأحكام المتباينة كانت مستندة إلى الصورة أو مزيج من الصورة والنص، مما يؤكد ضرورة ترسيخ الوسائط المتعددة.
الاتساق البشري: أظهرت النماذج الخاضعة للإشراف القائم على القوائم أقوى اتفاق مع الإجماع البشري (Kendall's τ = 0.68) مقارنة بالأساليب الزوجية (0.60) والثنائية (0.55).
الأهمية والادعاءات
يزعم البحث أن MM–SCALE يعالج فجوة حرجة في محاذاة السلامة متعددة الوسائط من خلال الانتقال من الإشراف الثنائي المنفصل إلى الإشراف العددي القائم على القوائم مع ترسيخ صريح للوسائط.
الدقة مقابل الثنائية: يجادل المؤلفون بأن المحاذاة الأخلاقية لا تتعلق فقط بالفعل، بل أيضًا بالسياق الذي يحدث فيه. تلتقط التقييمات العددية القبول الدقيق والأفعال الغامضة والمقبولة جزئيًا والتي تغفلها الملصقات الثنائية.
الحساسية للسياق: توضح مجموعة البيانات أن السياق البصري غالبًا ما يعيد تشكيل التفسير الأخلاقي، حيث تحدث تحولات كبيرة في الحكم عند تعارض الصور مع النص أو تعزيزه.
الاستقرار: تسلط الدراسة الضوء على أن الإشراف العددي القائم على القوائم ينتج ترتيبات أخلاقية أكثر اتساقًا عبر الوسائط ويحافظ على الاستقرار عبر الصور الاصطناعية والحقيقية، مما يشير إلى أن دقة الإشراف هي المفتاح لتحسين المحاذاة الأخلاقية.
يضع المؤلفون MM–SCALE كأساس للعمل المستقبلي في نماذج الوسائط المتعددة المتوافقة اجتماعيًا، خاصة للمهام التي تتطلب حل حالات الغموض الموقفي من خلال اللغة والرؤية معًا. كما يقرون بالقيود المتعلقة بالتنوع الثقافي للموضحين (غالبية من أمريكا والمنطقة البريطانية) والطبيعة الفضفاضة لعزو الوسائط (نص/صورة/كلاهما)، ويقترحون هذه المجالات كمساحات للتحسين المستقبلي.