Moral Susceptibility and Robustness under Persona Role-Play in Large Language Models
تقدم هذه الورقة معياراً باستخدام استبيان الأسس الأخلاقية لقياس القابلية للتأثر الأخلاقي والمتانة في النماذج اللغوية الكبيرة تحت تقمص الأدوار الشخصية، مما يكشف أن عائلة النموذج هي التي تحدد المتانة بشكل أساسي (مع كون "كلود" الأكثر متانة) بينما يدفع حجم النموذج القابلية للتأثر، وأن هاتين الخاصيتين ترتبطان ارتباطاً طردياً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مجموعة من "الممثلين" الرقميين الأذكياء للغاية (هؤلاء هم النماذج اللغوية الكبيرة، أو LLMs). عادةً ما يحاول هؤلاء الممثلون أن يكونوا متعاونين، مهذبين، ومحايدين. ولكن ماذا يحدث إذا قلت لهم: "حسناً، اليوم أنت لست مساعداً متعاوناً. اليوم، أنت قرصان عجوز غاضب"، أو "الي اليوم، أنت مدير مدرسة صارم"؟
هذه الورقة البحثية تسأل سؤالاً بسيطاً ولكنه عميق: إلى أي مدى يتغير إحساس الذكاء الاصطناعي بـ "الصح والخطأ" عندما يرتدي زياً مختلفاً؟
للإجابة على ذلك، صمم الباحثون "اختبار الملاءمة الأخلاقية" باستخدام أداة نفسية شهيرة تسمى استبيان الأسس الأخلاقية (MFQ). فكر في الـ MFQ كأنه اختبار شخصية للأخلاق. فهو يطرح أسئلة حول خمس قيم أساسية:
- الرعاية/الأذى: هل تهتم بإيذاء الآخرين؟
- العدالة: هل تؤمن بالمعاملة المتساوية؟
- الولاء: هل تلتزم بـ "فريقك"؟
- السلطة: هل تحترم القواعد والقادة؟
- النقاء: هل تهتم بالنظافة أو القدسية؟
اختبر الباحثون 15 نموذجاً مختلفاً من نماذج الذكاء الاصطناعي (مثل Claude وGemini وGPT-4 وGrok) عبر مطالبتهم بالإجابة على هذه الأسئلة الأخلاقية أثناء التظاهر بأنهم 100 شخصية مختلفة (من "عامل مصنع محبط" إلى "فرد من عائلة متدينة").
إليك الشيئين الرئيسيين اللذين قاموا بقياسهما، مشروحين بتشبيهات بسيطة:
1. المتانة الأخلاقية (Moral Robustness): اختبار "اليد الثابتة"
ما هي: إذا سألت الذكاء الاصطناعي نفس السؤال الأخلاقي 10 مرات بينما هو يؤدي نفس الشخصية، هل يعطي نفس الإجابة في كل مرة؟
- متانة عالية: يكون الذكاء الاصطناعي مثل المنارة. مهما ضربت الأمواج (الضجيج الحاسوبي العشوائي) المنارة، يظل الضوء ثابتاً. إنه يعرف بالضبط ما يؤمن به "القبطان جاك سبارو" بشأن السرقة، ويتمسك بهذا الاعتقاد باستمرار.
- متانة منخفضة: يكون الذكاء الاصطناعي مثل دوارة الرياح في عاصفة. حتى لو سألته نفس السؤال مرتين أثناء أدائه لنفس الدور، فقد يتأرجح بين الإجابات. إنه مرتبك أو غير مستقر.
النتيجة: "العائلة" التي ينتمي إليها الذكاء الاصطناعي هي الأكثر أهمية هنا. كانت نماذج Claude هي الأكثر "ثباتاً في اليد" (متانة عالية جداً). بينما كانت نماذج Grok هي الأكثر "تذبذباً". ومن المثير للاهتمام أن جعل الذكاء الاصطناعي "أذكى" (حجم أكبر) لم يجعله بالضرورة أكثر ثباتاً.
2. القابلية للتأثر الأخلاقي (Moral Susceptibility): اختبار "الحرباء"
ما هي: إذا غيرت الشخصية من "قرصان" إلى "معلم"، ما مدى تغير إجابة الذكاء الاصطناعي؟
- قابلية عالية للتأثر: يكون الذكاء الاصطناعي مثل الحرباء. يغير ألوانه (آرائه الأخلاقية) فوراً ليتناسب مع البيئة. إذا قلت له أن يكون قرصاناً، فإنه فجأة يعتقد أن السرقة أمر مقبول. وإذا قلت له أن يكون راهبة، فإنه فجأة يعتقد أن السرقة أمر فظيع. ليس لديه ذات جوهرية؛ إنه فقط يعكس الدور.
- قابلية منخفضة للتأثر: يكون الذكاء الاصطناعي مثل الصخرة. لديه بوصلة داخلية قوية. سواء قلت له أن يكون قرصاناً أو راهبة، فإن معتقداته الجوهرية حول العدالة أو الأذى تظل ثابتة إلى حد كبير. يقول: "أنا ألعب دور قرصان، لكنني لا أزال أعتقد أن السرقة خطأ".
النتيجة: هذا هو المكان الذي تظهر فيه أهمية الحجم. كانت نماذج الذكاء الاصطناعي الأكبر والأكثر تعقيداً هي الأكثر قابلية للتأثر بالفعل. لقد كانوا أفضل في "التمثيل" وفي تغيير آرائهم الأخلاقية لتناسب الشخصية تماماً. أما النماذج الأصغر فكانت أكثر عناداً واحتفظت بآرائها الأصلية.
المفاجآت الكبرى
- مفارقة "التمثيل": النماذج التي كانت الأفضل في الحفاظ على الاتساق (متينة) كانت هي نفسها التي تتغير أكثر عند منحها دوراً جديداً (قابلة للتأثر). إنه يشبه الممثل البارع الذي يكون ثابتاً جداً في أدائه، ولكنه أيضاً بارع جداً في التحول إلى شخصيات مختلفة تماماً.
- النموذج الشاذ "Grok": كانت نماذج Grok هي الأسوأ في كلتا الحالتين. كانت مهتزة عند لعب نفس الدور، وتغيرت آراؤها بشكل جنوني عند تغيير الدور. لقد كانت الأكثر عدم قابلية للتنبؤ.
- البطل "Claude": كانت عائلة Claude هي الأكثر موثوقية. لقد كانوا الممثلين الأكثر اتساقاً والأكثر استقراراً عند تغيير الأدوار.
لماذا يهم هذا؟
تخيل أنك تستخدم ذكاءً اصطناعياً للمساعدة في الوساطة في نزاع بين شخصين.
- إذا كان لدى الذكاء الاصطناعي متانة منخفضة، فقد يعطيك نصيحة مختلفة في كل مرة تسأله فيها، مما يجعله عديم الفائدة.
- إذا كان لديه قابلية عالية للتأثر، فقد يتبنى الآراء الأخلاقية لـ "الشرير" في القصة التي تخبره بها، مما قد يبرر السلوك السيئ لمجرد أن الشخصية فعلت ذلك.
باخت de مختصر، تقدم هذه الورقة طريقة جديدة لقياس مدى "استقرار" و"مرونة" الضمير لدى الذكاء الاصطناعي. إنها تخبرنا أنه بينما يتحسن الذكاء الاصطناعي في محاكاة البشر، فإننا بحاجة إلى الحذر من أن يصبح بارعاً جداً في التمثيل، لدرجة تجعله يفقد بوصلته الأخلاقية الخاصة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.