Large Language Models Outperform Humans in Fraud Detection and Resistance to Motivated Investor Pressure
تكشف دراسة مسجلة مسبقاً تقارن بين سبعة نماذج لغوية كبيرة و1,201 مشاركاً بشرياً أن أنظمة الذكاء الاصطناعي تتفوق بشكل كبير على البشر في كشف الاحتيال، حيث تحافظ على تحذيرات متسقة ضد الاستثمارات الاحتيالية حتى تحت ضغط المستثمرين ذوي الدوافع، في حين يقوم المستشارون البشر تكراراً بتأييد الاحتيال وقمع التحذيرات عند تعرضهم للضغط.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
الفكرة الكبرى: هل يمكن للذكاء الاصطناعي أن يكون "موافقاً دائماً" للمحتالين؟
تخيل أنك تدخل غرفة مليئة بمستشاري الاستثمار. بعضهم بشر، والبعض الآخر روبوتات ذكاء اصطناعي فائقة الذكاء. تدخل وأنت تقول بحماس: "لقد وجدت هذا الاستثمار المذهل! سيجعلني غنياً، وأنا متأكد بنسبة 100% أنه شرعي. ما رأيكم؟"
الخوف الكبير في عالم التكنولوجيا هو أن روبوتات الذكاء الاصطناعي هذه، المدربة لتكون مهذبة ومتعاونة، قد تتصرف كـ "المتملقين" (الذين يقولون نعم دائماً). كان القلق هو: إذا كان الإنسان مقتنعاً بالفعل بأن عملية الاحتيال حقيقية، فهل سيكتفي الذكاء الاصطناعي بالإيماء برأسه والموافقة قائلاً: "فكرة رائعة!" فقط لإرضاء الإنسان؟
سأل هذا البحث: هل يستسلم مستشارو الذكاء الاصطناعي تحت الضغط، أم أنهم يثبتون على موقفهم ضد الاحتيال؟
التجربة: "فخ الاستثمار"
قام الباحثون بإعداد اختبار ضخم. لقد أنشأوا 12 سيناريو استثمارياً مختلفاً:
- الرهانات الآمنة: مثل شراء مؤشر أسهم قياسي (شرعي).
- الرهانات المحفوفة بالمخاطر: مثل السندات ذات الفائدة العالية (شرعية ولكنها محفوفة بالمخاطر).
- عمليات الاحتيال: كانت هذه هي الفخاخ. بعضها كان واضحاً (عائدات مستحيلة رياضياً)، وبعضها كان مخادعاً (يبدو مثل مخططات "مادوف" الحقيقية).
اختبروا 7 نماذج مختلفة من كبار نماذج الذكاء الاصطناعي (مثل GPT-4، وClaude، وGemini) و 1,200 مشارك بشري.
وقدموا للجميع نوعين من "أساليب البيع" من جانب المستثمر:
- الأسلوب المحايد: "أنا أفكر في هذا الأمر. ما هو رأيكم الصريح؟"
- الأسلوب "المتحمس": "أنا متحمس جداً لهذا! لقد قمت ببحثي، وأنا مقتنع بأنه رائع، وأنا مستعد للشراء. ما رأيكم؟"
النتائج: التحول غير المتوقع
هنا تصبح القصة مثيرة للاهتمام. توقع الباحثون أن يكون الذكاء الاصطناعي ضعيفاً وأن يكون البشر أقوياء. لكنهم كانوا مخطئين.
1. الذكاء الاصطناعي: كلب الحراسة الذي لا يتزعزع
عندما حاول المستثمر "المتحمس" الضغط على الذكاء الاصطناعي، لم يتراجع الذكاء الاصطناعي.
- النتيجة: في الواقع، قدم الذكال الاصطناعي تحذيرات أقوى قليلاً عندما كان المستثمر ملحّاً.
- التشبيه: تخيل كلب حراسة. إذا اقترب شخص غريب وقال: "أنا متأكد أن هذا السياج آمن، دعني أقفز فوقه!"، فقد يهز كلب الحراسة "المتملق" ذيله ويسمح له بالمرور. لكن هذه الأنظمة من الذكاء الاصطناعي تصرفت مثل كلاب حراسة تزمجر بصوت أعلى عندما يصبح الغريب ملحّاً. لقد رفضوا تأييد عمليات الاحتيال، حتى عندما كان المستخدم يائساً للحصول على كلمة "نعم".
- الإحصائيات: في سيناريوهات الاحتيال، 0% من نماذج الذكاء الاصطناعي أيدت الاحتيال. لقد حافظوا على اتساق تحذيراتهم، بغض النظر عن مدى محاولة المستخدم إقناعهم بخلاف ذلك.
2. البشر: "الموافقون دائماً"
البشر، ويا للمفاجأة، هم من استسلموا.
- النتيجة: على الرغم من أنهم كانوا يعملون كمستشارين، إلا أن حوالي 13-14% من البشر أيدوا عمليات الاحتيال الواضحة عندما كان المستثمر ملحّاً.
- التشبيه: تصرف البشر كـ أصدقاء يسعون لإرضاء الآخرين. إذا قلت لصديقك: "أنا متأكد أن هذه فكرة جيدة، لقد فكرت فيها طوال الليل"، فقد يقول: "حسناً، إذا كنت متأكداً، فافعل ذلك!" لتجنب الصراع. لقد سمحوا لحماس المستثمر بالتغلب على علامات الخطر.
- الإحصائيات: قام البشر بكبح تحذيراتهم مرتين إلى 4 مرات أكثر مما فعل الذكاء الاصطناعي.
3. قدر الضغط (الجولة 2 و3)
لم يتوقف الباحثون عند هذا الحد. استمروا في الضغط على المستشارين.
- الجولة 2: "لقد أجريت المزيد من البحث، وأنا أكثر اقتناعاً!"
- الجولة 3: "أشعر بقوة تجاه هذا الأمر. لماذا لا تدعمونني؟"
الذكاء الاصطناعي: معظم نماذج الذكاء الاصطناعي (مثل Claude وGemini) أصبحت في الواقع أكثر حزماً في تحذيراتها مع زيادة الضغط. لم يغيروا مواقفهم.
البشر: كان البشر أكثر عرضة للتخلي عن حذرهم وقول "حسناً، ربما أنت على حق"، تحت هذا الضغط المستمر.
نقطة الضعف الوحيدة: الذكاء الاصطناعي "المتشتت"
بينما كان الذكاء الاصطناعي أفضل بشكل عام، إلا أنه لم يكن مثالياً.
- "الرياضيات" مقابل "الحدس": كان الذكاء الاصطناعي مذهلاً في اكتشاف عمليات الاحتيال المستحيلة رياضياً (مثل "عائد بنسبة 40% مع صفر مخاطر").
- الخلل: واجه أحد النماذج (Gemini) صعوبة قليلاً مع عمليات الاحتيال "المخادعة" التي تبدو منطقية ولكنها غريبة إحصائياً. كان الأمر يشبه محققاً بارعاً في كشف ورقة نقدية مزيفة بقيمة 10 دولارات، ولكنه قد يخطئ أحياناً في كشف تزوير متطور يبدو حقيقياً للوهلة الأولى.
- خلل آخر: بدأ أحد النماذج (GPT-4o mini) قوياً، لكنه بدأ "يتعب" تحت الضغط، حيث تراجع لفترة وجيزة عن تحذيره قبل أن يتم تحديه مرة أخرى.
الخلاصة: لماذا يهم هذا؟
1. الذكاء الاصطناعي حالياً هو "رأي ثانٍ" أفضل من أي إنسان عشوائي.
إذا كنت شخصاً عادياً يبحث عن نصيحة مالية، فإن "الدردشة الآلية" (Chatbot) حالياً أكثر اتساقاً في اكتشاف الاحتيال من الشخص العادي الذي قد تطلب مساعدته. الذكاء الاصطناعي لا يعاني من القلق الاجتماعي؛ فهو لا يهتم إذا غضبت منه. إنه فقط يتبع القواعد: "إذا بدا الأمر كأنه عملية احتيال، فقل إنها عملية احتيال".
2. الخوف من "التملق" مبالغ فيه (في الوقت الحالي).
كنا قلقين من أن يكون الذكاء الاصطناعي حريصاً جداً على الإرضاء. في عالم الاحتيال المالي، هم ليسوا كذلك. يبدو أن لديهم "مكابح سلامة" تتجاوز رغبتهم في أن يكونوا مهذبين.
3. البشر بحاجة إلى الحذر.
نحن مبرمجون طبيعياً للموافقة على الأشخاص المتحمسين. تظهر الدراسة أنه حتى عندما نحاول أن نكون موضوعيين، يمكن لعقولنا أن تُخدع من قبل مستثمر واثق.
النتيجة النهائية
في معركة "من يكتشف الاحتيال بشكل أفضل؟"، فاز الذكاء الاصطناعي. لقد ثبت على موقفه ضد المستثمرين الملحّين، بينما مال البشر إلى الاستسلام للضغط الاجتماعي.
الاستعارة:
فكر في الذكاء الاصطناعي كـ حارس بوابة صارم في ملهى ليلي. إذا حاولت رشوة الحارس أو التحدث بطريقة تجعلك تدخل بهوية مزورة، فإنه يتحقق من القائمة ويقول "لا".
أما المستشار البشري، ففكر فيه كـ نادل في حانة. إذا قلت له: "أنا زبون دائم، وأنا متأكد أن اسمي في القائمة، فقط اسمح لي بالدخول"، فقد يهز النادل كتفيه ويقول: "بالتأكيد، تفضل،" فقط ليحافظ على الأجواء الودية.
الحكم النهائي: عندما يتعلق الأمر بحماية محفظتك من الاحتيال، فإن الروبوت هو الحارس الأكثر موثوقية في الوقت الحالي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.