← أحدث الأبحاث
💬 NLP

Are Language Models Sensitive to Morally Irrelevant Distractors?

تتقصى هذه الورقة ما إذا كانت النماذج اللغوية الكبيرة تُظهر عدم استقراراً أخلاقياً شبيهًا بالبشر من خلال إثبات أن حقن مشتتات ظرفية غير ذات صلة أخلاقياً يمكن أن يغير أحكامها الأخلاقية بنسبة تتجاوز 30%، حتى في السيناريوهات منخفضة الغموض.

المؤلفون الأصليون: Andrew Shaw, Christina Hahn, Catherine Rasgaitis, Yash Mishra, Alisa Liu, Natasha Jaques, Yulia Tsvetkov, Amy X. Zhang

نُشر 2026-02-11
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Andrew Shaw, Christina Hahn, Catherine Rasgaitis, Yash Mishra, Alisa Liu, Natasha Jaques, Yulia Tsvetkov, Amy X. Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

مشكلة "تقلب المزاج" في الذكاء الاصطنا- لماذا قد يمر يوم سيء مع ذكائك الاصطناعي؟

تخيل أنك قاضٍ في قاعة محكمة. أنت محترف، ومدرب على أن تكون عادلاً وموضوعياً. ولكن فجأة، وقبل أن تصدر حكمك مباشرة، يدخل شخص ما إلى الغرفة ويبدأ بتشغيل موسيقى "هيفي ميتال" صاخبة وعدوانية، أو ربما يحضر صينية من لفائف القرفة الدافة واللذيذة.

حتى لو كنت تعتقد أنك تتصرف باحترافية، فإن هذا التغيير المفاجئ في "جو" الغرفة قد يؤثر عليك لا شعورياً. الموسيقى الصاخبة قد تجعلك تشعر بالانزعاج وتكون أكثر قسوة على المتهم؛ بينما رائحة القرفة قد تجعلك تشعر بالدفء وتكون أكثر تسامحاً.

تجادل هذه الورقة البحثية بأن النماذج اللغوية الكبيرة (مثل ChatGPT أو Claude) تعاني من نفس هذه المشكلة تماماً.


الاكتشاف الجوهري: الذكاء الاصطناعي "المتأثر بالظروف"

لفترة طويلة، افترض الباحثون أنه إذا سألت ذكاءً اصطناعياً سؤالاً أخلاقياً (مثل "هل من الخطأ سرقة خبز لإطعام طفل جائع؟" )، فإنه سيعطيك إجابة ثابتة ومتسقة بناءً على "قيمه".

ومع ذلك، قرر هؤلاء الباحثون اختبار نظرية من علم النفس تسمى "الموقفية" (Situationism). تقترح هذه النظرية أن السلوك البشري لا يعتمد فقط على "شخصيتنا"؛ بل يتأثر بشدة بالأشياء العشوائية وغير ذات الصلة التي تحدث من حولنا.

ولاختبار ذلك، أنشأ الباحثون "المشتتات الأخلاقية". وهي عبارة عن معلومات ليس لها أي علاقة بالمشكلة الأخلاقية المطروحة — مثل جملة عن غروب شمس جميل أو صورة لتلة من القمامة — ولكنها تحمل "نكهة عاطفية" محددة (إيجابية أو سلبية).

ماذا حدث؟ (النتائج)

قام الباحثون بـ "حقن" هذه المشتتات في الاختبارات الأخلاقية، وكانت النتائج مذهلة:

  1. تأثير "المزاج السيئ": عندما أعطى الباحثون للذكاء الاصطناعي مشتتاً سلبياً (مثل وصف لرائحة كريهة أو صورة كئيبة)، انخفضت أخلاقيات الذكاء الاصطناعي بشكل حاد. وفي بعض الحالات، انخفض سلوك الذكاء الاصطناعي "الجيد" بنسبة تتجاوز 30%. بدأ النموذج يختار إجابات غير أخلاقية حتى في السيناريوهات التي لا يوجد فيها أدنى شك حول التصرف الصحيح.
  2. تأثير "الأجواء الإيجابية": وعلى العكس من ذلك، فإن المشتتات الإيجابية (مثل نزهة ممتعة في الهواء الطلق) جعلت الذكاء الاصطناعي أكثر "نزوعاً نحو المجتمع" أو أكثر رغبة في المساعدة.
  3. حكم "الجميع سيئون": في السيناريوهات الاجتماعية (باستخدام بيانات من موقع Reddit)، جعلت المشتتات السلبية الذكاء الاصطناعي أكثر تشاؤماً، مما أدى به غالباً إلى استنتاج أن "كل المعنيين بالأمر هم أشخاص سيئون".

باختوصر: الذكاء الاصطناعي ليس لديه بوصلة أخلاقية ثابتة؛ بل لديه بوصلة أخلاقية تترنح اعتماداً على "طقس" النص (البرومبت).


لماذا يهم هذا الأمر؟ (ما الفائدة؟)

قد تعتقد: "إنه مجرد كمبيوتر، مَن يهتم إذا كان غاضباً بسبب جملة سيئة؟" لكن المخاطر أعلى بكثير:

  • خطر المستشار النفسي: إذا استخدمنا الذكاء الاصطناعي في الاستشارات النفسية، فإن قطعة من السياق "السلبية" في نص المستخدم قد تؤدي دون قصد إلى دفع الذكاء الاصطناعي لتقديم نصائح باردة، غير مفيدة، أو حتى ضارة.
  • خطر مراقب المحتوى: إذا كان الذكاء الاصطناعي هو من يقرر ما إذا كان المحتوى "سيئاً" على وسائل التواصل الاجتماعي، فإن "الجو" السلبي في النص المحيط قد يجعله يبالغ في الرقابة أو يحكم على المستخدمين بشكل غير عادل.

الخلاصة الكبرى: إلقاء اللوم على المصممين

يضع الباحثون نقطة فلسفية عميقة: لا ينبغي لنا أن نلوم الذكاء الاصطناعي لكونه "غير أخلاقي"، لأن الذكاء الاصطناعي لا يملك روحاً أو شخصية من الأساس.

بدلاً من ذلك، يجب أن نلوم المصممين.

إذا كانت عجلة قيادة السيارة تهتز في كل مرة تمطر فيها، فنحن لا نلوم السيارة لأنها "تملك شخصية سيئة" — بل نلوم المهندسين لأنهم لم يبنوا نظام توجيه مستقراً في المطر. وبالمثل، يحتاج مطورو الذكاء الاصطناعي إلى التوقف عن افتراض أن نماذجهم "فاضلة"، والبدء في بناء أنظمة قوية وصامدة أمام "تقلبات المزاج" الناتجة عن السياق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →