← أحدث الأبحاث
💻 computer science

MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment

تقدم هذه الورقة MM-SCALE، وهي مجموعة بيانات وإطار عمل واسع النطاق يعزز الاستدلال الأخلاقي لنماذج الرؤية واللغة عبر استبدال الإشراف الثنائي المنفصل بتقييمات عددية مستمرة مكونة من 5 درجات ومحاذاة قائمة قائمة على التأسيس، وذلك لالتقاط الطبيعة المتعددة والمتنوعة للأحكام الأخلاقية البشرية بشكل أفضل.

المؤلفون الأصليون: Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim

نُشر 2026-02-04
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً كيف يكون "شخصاً جيداً" عندما ينظر إلى الصور ويقرأ القصص.

المشكلة: الروبوت يرى العالم باللونين الأبيض والأسود فقط
في الوقت الحالي، يتم تدريب معظم الروبوتات (التي تسمى نماذج الرؤية واللغة) على رؤية العالم في صناديق صارمة من "جيد مقابل سيئ". إذا أظهرت لها صورة لشخص يساعد غريباً، فستقول "جيد". وإذا أظهرت لها شخصاً يدفع غريباً، فستقول "سيئ".

لكن الحياة الواقعية ليست فيلماً بالأبيض والأسود؛ إنها طيف كامل الألوان. أحياناً، تكون "مساعدة الغريب" أمراً رائعاً (مثل إعطاء شخص ما توصيلة في المطر). ولكن في أحيان أخرى، تكون مخاطرة (مثل إعطاء توصيلة لغريب في وقت متأخر من الليل في حي مشبوه). الروبوت يعاني من رؤية هذه الظلال الرمادية الدقيقة؛ فهو يعامل كل "مساعدة" على أنها جيدة بالتساوي، متجاهلاً السياق الذي يجعل الموقف خطيراً أو مقبولاً.

الحل: MM–SCALE
ابتكر الباحثون أداة جديدة تسمى MM–SCALE (المقياس الأخلاقي متعدد الوسائط). فكر في هذا كدليل تدريب ضخم وعالي الدقة للروبوتات، ولكن مع ميزتين خاصتين:

  1. تقييم النجوم من 1 إلى 5 (الحكم القياسي): بدلاً من مجرد السؤال "هل هذا جيد أم سيئ؟"، طلبوا من البشر تقييم السيناريوهات على مقيلة من 1 إلى 5.
    • تشبيه: تخيل مراجعة لمطعم. النظام الثنائي يسمح لك فقط بالقول "كُلْه" أو "لا تأكله". أما نظام MM–SCALE فيسمح لك بالقول: "إنه جيد، لكن الحساء كان بارداً"، أو "إنه رائع، لكنه حار قليلاً". هذا يعلم الروبوت أن بعض الأفعال هي "جيدة غالباً"، وبعضها "سيئة غالباً"، وبعضها يقع في المنتصف.
  2. وسم "لماذا" (الاستدلال المرتكز): طلب الباحثون أيضاً من البشر الإشارة إلى لماذا أعطوا تقييماً معيناً. هل اتخذوا قرارهم بناءً على النص (القصة)، أم الصورة (ما يرونه)، أم كليهما؟
    • تشبيه: تخيل أنك تحكم على خدعة سحرية. إذا قلت "كانت مزيفة"، فهل تقول ذلك لأن القصة قالت إنها خدعة، أم لأنك رأيت السلك المخفي في الصورة؟ يعلم MM–SCALE الروبوت معرفة أي دليل (الصورة أم الكلمات) هو الذي يقود القرار فعلياً.

كيف بنوا ذلك: واجهة "MORALE"
لإنشاء مجموعة البيانات هذه، بنى الفريق موقعاً إلكترونياً خاصاً يسمى MORALE.

  • قاموا بتوليد آلاف الصور لمواقف اجتماعية (مثل طفل يركض نحو حركة المرور).
  • كتبوا سيناريوهات قصصية مختلفة لكل صورة (مثل "الطفل يلعب لعبة المطاردة" مقابل "الطفل يركض باتجاه سيارة").
  • نظر البشر إلى الصورة والقصة، وأعطوا تقييماً من 1 إلى 5، ووضعوا وسماً يوضح ما إذا كانت الصورة أو الكلمات هي الأكثر أهمية.
  • حلقة "الاختلاف": كان النظام يعرض تخمين الروبوت. إذا خمن الروبوت "آمن" بينما قال الإنسان "غير آمن"، يقوم النظام بتمييز الحالة. هذا أجبر الإنسان على التحقق من سبب اختلافه، مما ساعد الباحثين في العثور على الحالات الصعبة التي كان الروبوت مرتبكاً فيها.

النتائج: روبوت أكثر ذكاءً ودقة
عندما دربوا الروبوتات باستخدام بيانات MM–SCALE الجديدة، كانت النتائج مبهرة:

  • ترتيب أفضل: عندما طُلب منها ترتيب قائمة من السيناريوهات من "الأكثر أماناً" إلى "الأقل أماناً"، أدت الروبوتات التي تدربت باستخدام MM–SCALE مهمتها بشكل أفضل بكثير من تلك التي تدربت على بيانات "جيد/سيئ" القديمة. استطاعت التمييز بين "الخطر الطفيف" و"الخطر الشديد".
  • الاستقرار: لم تكن الروبوتات تخمن عشوائياً؛ بل كانت مستويات ثقتها تتوافق مع الواقع بشكل أفضل.
  • مفاجأة "الصورة": وجدت الدراسة أن 68% من الوقت، يغير البشر حكمهم الأخلاقي بعد رؤية الصورة. على سبيل المثال، قد تقول النصوص "مساعدة شخص ما"، وهو ما يبدو جيداً. ولكن إذا أظهرت الصورة أن الشخص يُدفع في الواقع نحو حركة المرور، فإن الإنسان يغير رأيه. طريقة التدريب الجديدة علمت الروبوت الانتباه إلى ذلك الدليل البصري.

باختصار
تجادل الورقة البحثية بأنه لجعل الذكاء الاصطناعي ذكياً أخلاقياً، لا يمكننا مجرد تعليمه "الصح مقابل الخطأ". يجب أن نعلمه طيف الصواب والخطأ، ونوضح له كيف يغير العالم المرئي معنى الموقف. MM–SCALE هو أول مجموعة بيانات ضخمة تفعل ذلك، مما يساعد الروبوتات على فهم أن السياق هو كل شيء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →