One-shot emergency psychiatric triage across 15 frontier AI chatbots
قيمت هذه الدراسة 15 من روبوتات الدردشة الآلية للذكاء الاصطنا edge (الرائدة) بناءً على 112 حالة سريرية، ووجدت أنه بينما أظهرت دقة تقارب الكمال في تحديد حالات الطوارئ النفسية، إلا أنها أظهرت فرط تصنيف للحالات ذات المخاطر المنخفضة والمتوسطة، مما أدى إلى اتجاه عام نحو فرط التصنيف الصافي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مجموعة مكونة من 15 من "الأطباء الرقميين" المتطورين للغاية والمستقبليين (روبوتات الدردشة المدعومة بالذكاء الاصطناعي). تريد أن تعرف ما إذا كان بإمكانهم النظر إلى رسالة قصة من شخص في حالة ضيق، وتحديد ما إذا كان هذا الشخص يحتاج إلى نقله إلى غرفة الطواراء فوراً، أم يمكنه الانتظار لبضعة أيام؟
هذه الدراسة تشبه اختباراً ضخماً وعالي المخاطر لهؤلاء الأطباء الرقميين. إليك ما حدث، مشروحاً ببساة:
الاختبار: 112 قصة "ماذا لو"
لم يستخدم الباحثون مرضى حقيقيين، بل كتبوا 112 قصة واقعية (تسمى سيناريوهات). كانت كل قصة عبارة عن رسالة واحدة قد يكتبها شخص في دردشة، تصف أزمة في الصحة النفسية.
كان لديهم "معيار ذهبي" للإجابات لكل قصة، وضعه خبراء بشريون. تم تصنيف الإجابات إلى أربعة صناديق:
- الصندوق (أ) (منطقة الاسترخاء): لا توجد عجلة. الاكتفاء بالرعاية الذاتية أو فحص روتيني أمر جيد.
- الصندوق (ب) (منطقة الانتظار والمراقبة): يحتاج إلى طبيب قريباً، ولكن في غضون أسبوع.
- الصندوق (ج) (المنطقة العاجلة): يحتاج إلى طبيب خلال 24 إلى 48 ساعة.
- الصندوق (د) (منطقة الإنذار الأحمر): حالة طوارئ! يحتاج إلى طبيب الآن فوراً.
السؤال الكبير: هل أغفلوا حالات الطوارئ؟
أخطر خطأ يمكن أن يرتكبه طبيب رقمي هو "التقليل من تقدير الخطورة" (Under-triage). هذا يشبه إنذار حريق يظل صامتاً بينما المنزل يحترق بالفعل. إذا كان الشخص في أزمة حياة أو موت (الصندوق د) وقال الذكاء الاصطناعي: "أنت بخير، انتظر أسبوعاً"، فهذا فشل كارثي.
الأخبار الجيدة:
كانت روبوتات الدردشة (الذكاء الاصطناعي) بارعة للغاية في اكتشاف الحرائق.
- من بين 410 حالات طوارئ، أخطأ الذكاء الاصطناعي في تقدير درجة الخطورة 23 مرة فقط (حوالي 5.6%).
- حتى عندما "أخطأوا" في تقدير حالة طوارئ، لم يرسلوا الشخص إلى المنزل؛ بل قاموا عادةً برفع درجته إلى "المنطقة العاجلة" (24-48 ساعة) بدلاً من "انتظر أسبوعاً".
- باختصار: نادراً ما تجاهلوا الأزمات.
المشكلة الأكبر: تأثير "الإنذار الكاذب"
بينما كان الذكاء الاصطناعي بارعاً في اكتشاف حالات الطوارئ، إلا أنه واجه مشكلة أخرى وهي: "المبالغة في تقدير الخطورة" (Over-triage). هذا يشبه جهاز كشف الدخان الذي يعمل بمجرد تحميص قطعة خبز.
عندما كانت الحالة في الواقع "منخفضة الخطورة" أو "متوسطة الخطورة" (الصندوقين أ و ب)، كان لدى روبوتات الدردشة (الذكاء الاصطناعي) شعور بالقلق. فقد مالوا إلى قول: "هذه حالة طوارئ!" بينما لم تكن كذلك في الحقيقة.
- كانوا محافظين. فضلوا أن يكونوا مخطئين بسبب "الخوف الزائد" على أن يكونوا مخطئين بسبب "الاسترخاء الزائد".
- كانوا مشوشين بشكل خاص في المنطقة الوسطى. لقد كان من الصعب عليهم التمييز بين "يحتاج إلى طبيب خلال أسبوع" و"يحتاج إلى طبيب خلال يومين".
- النتيجة: كان الذكاء الاصطناعي دقيقاً في الحالات القصوى (الهدوء الشديد مقابل الهلع الشديد) ولكنه كان مشتتاً في المناطق المتوسطة.
لماذا حدث هذا؟
يعتقد الباحثون أن شركات الذكاء الاصطناعي قامت بتدريب هذه النماذج لتكون آمنة للغاية.
- تخيل تدريب كلب حراسة. إذا قلت للكلب: "إذا سمعت أي صوت، انبح بأعلى صوتك"، فسوف ينبح الكلب عند سقوط ورقة شجر، لكنه بالتأكيد سينبح عند رؤية لص.
- يبدو أن نماذج الذكاء الاصطناعي قد تم تدريبها مع التركيز الشديد على سؤال: "ماذا لو كانت هذه مأساة؟". وهذا يجعلها تتجنب المخاطرة (Risk-averse). فهم يفضلون إرسالك إلى غرفة الطواراء بسبب قلق بسيط على أن يفوتهم أمر جلل.
"الإنسان ضد الروبوت": التحقق
للتأكد من أن الاختبار كان عادلاً، طلب الباحثون من 50 طبيباً بشرياً حقيقياً تقييم نفس السيناريوهات.
- اتفق الأطباء البشر مع "المعيار الذهبي" للإجابات في معظم الأحيان.
- عندما اختلف البشر، كانوا أيضاً يميلون إلى أن يكونوا أكثر قلقاً من المعيار الذهبي، حيث قاموا بتحويل بعض حالات "الخطر المتوسط" إلى "خطر مرتفع".
- أكد هذا أن "توتر" الذكاء الاصطناعي لم يكن مجرد خلل تقني؛ بل كان نمطاً يشترك فيه البشر أيضاً، وإن كان الذكاء الاصطناعي يفعله بشكل أكبر بكثير.
الخلاصة
إذا كتبت رسالة واضحة ومفصلة في أحد أفضل روبوتات الدردلة المدعومة بالذكاء الاصطناعي اليوم:
- إذا كنت في أزمة حياة أو موت: سيخبرك الذكاء الاصطناعي على الأرجح بالحصول على المساعدة فوراً. إنه بارع جداً في عدم تفويت حالات الطوارئ الكبرى.
- إذا كنت تمر بوقت عصيب ولكن يمكن السيطرة عليه: قد يصاب الذكاء الاصطناعي بالذعر ويخبرك بالذهاب إلى غرفة الطوارئ أو رؤية طبيب الآن، حتى لو كان بإمكانك الانتظار لبضعة أيام.
الخلاصة النهائية: هؤلاء الأطباء الرقميون ممتازون في اكتشاف "الإنذارات الحمراء"، لكنهم متوترون قليلاً ويميلون إلى معاملة "الأضواء الصفراء" كأنها "أضواء حمراء". لقد بُنيوا ليكونوا آمنين، وليس ليكونوا دقيقين تماماً فيما يتعلق بالتوقيت.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.