Evaluating Large Language Models for Assessment of Psychosis Risk
تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة ذات الأوزان المفتوحة يمكنها استخراج معلومات ذات مغزى سريري بدقة من نصوص المقابلات السريرية لتقييم مخاطر الذهان، مما يوفر أداة قابلة للتوسع وموثوقة لدعم الكشف المبكر والرعاية الوقائية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محقق تحاول حل لغز: من هو الشخص المعرض لخطر الإصابة بحالة صحية عقلية خطيرة تسمى الذهان؟
في الوقت الحالي، الطريقة الوحيدة لحل هذا اللغز هي إرسال متخصص مدرب تدريبًا عاليًا (أي "محقق") لإجراء مقابلة مع الشخص لمدة تصل إلى ساعتين. يستمع المحقق بعناية، ويدون الملاحظات، ثم يستخدم سنوات خبرته ليقرر ما إذا كان الشخص معرضًا للخطر. هذا يشبه وجود طاهٍ ماهر يتذوق الحساء ليقرر ما إذا كان يحتاج إلى المزيد من الملح. إنه أمر دقيق، لكنه بطيء، ومكلف، ولا يوجد عدد كافٍ من الطهاة المهرة للقيام بهذه المهمة. ونتيجة لذلك، يمر الكثير من الناس دون الحصول على المساعدة حتى فوات الأوان.
هذه الورقة تطرح سؤالًا جريئًا: هل يمكننا تعليم كمبيوتر خارق الذكاء (ذكاء اصطناعي) ليكون هو المحقق؟
إليك قصة ما وجدوه، مشروحة ببساًطة:
1. التجربة: تعليم الذكاء الاصطناعي كيف يستمع
أخذ الباحثون 678 تسجيلًا لهذه المقابلات (تحديدًا أول 30 دقيقة من المحادثة). قاموا بتغذية هذه النصوص في 11 نموذجًا لغويًا ضخمًا (LLMs) مختلفًا. فكر في هذه النماذج اللغوية الضخمة كطلاب مختلفين في فصل دراسي واحد:
- "الطلاب الصغار": سريعون، رخيصون، ولكن ربما يكونون ساذجين بعض الشيء (مثل طالب ذكي في المرحلة الثانوية).
- "الطلاب المتوسطون": متوازنون (مثل طالب في السنة الأخيرة من الجامعة).
- "الطلاب الكبار": ضخمون، أقوياء، ومكلفون (مثل أستاذ يحمل درجة الدكتوراه ولديه مكتبة في رأسه).
كانت مهمة الذكاء الاصطناعي هي الاستماع إلى النص والقيام بشيئين:
- إعطاء درجة: تقييم مدى شدة وتكرار الأفكار أو المشاعر الغريبة (على مقياس من 0 إلى 6).
- إصدار حكم: تحديد ما إذا كان الشخص "معرضًا للخطر" أو "غير معرض للخطر".
2. النتائج: الذكاء الاصطناعي يمكنه القيام بالمهمة!
كانت النتائج جيدة بشكل مفاجئ.
- الفائزون الكبار: النماذج الأكبر حجمًا (أساتذة الدكتوراه) أصابت في حوالي 80% من الحالات. لقد كانوا بارعين للغاية في رصد علامات التحذير (حساسية بنسبة 93%)، مما يعني أنهم نادرًا ما يغفلون عن شخص معرض للخطر بالفعل.
- المقايضة: نظرًا لأنهم كانوا حريصين جدًا على رصد كل حالة، فقد أطلقوا أحيانًا إنذارات لأشخاص كانوا بخير في الواقع (إيجابية كاذبة). ومع ذلك، في حالات الفحص، غالبًا ما يكون من الأفضل أن تكون حذرًا أكثر من اللازم بدلاً من تفويت خطر حقيقي.
- الطلاب الصغار: حتى نماذج الذكاء الاصطناعي الأصغر والأرخص أدت عملًا جيدًا. لم يكونوا مثاليين، لكنهم كانوا منافسين بشكل مدهش، خاصة بالنظر إلى أنهم يعملون بسرعة أكبر وتكلفة أقل.
3. فحص "الهلوسة": هل اخترع الذكاء الاصطناعي أشياء من خياله؟
هناك خوف كبير من أن يقوم الذكاء الاصطناالي بـ "الهلوسة" — أي اختراع حقائق ليست موجودة. قام الباحثون بفحص هذا الأمر بعناية.
- الأخبار الجيدة: كان الذكاء الاصطناعي أمينًا جدًا للنص. نادرًا ما اخترع أعراضًا غير موجودة.
- الأخبار السيئة: عندما يرتكب خطأً، فإنه عادة ما يشخص الحالة بشكل مفرط. على سبيل المثال، إذا قال شخص ما: "شعرت بالارتباك لأنني تعرضت للتنمر"، فقد يصنف الذكاء الاصطناعي ذلك كعرض نفسي خطير، بينما قد يدرك البشر أنه رد فعل طبيعي للتنمر. يعامل الذكاء الاصطناعي أحيانًا المخاوف البشرية العادية كحالات طبية طارئة.
4. هل الذكاء الاصطناعي عادل؟
تحقق الباحثون مما إذا كان الذكاء الاصطناعي يعامل المجموعات المختلفة من الناس بعدل (بناءً على العمر، أو العرق، أو الجنس، أو مكان إجراء المقابلة).
- الحكم: كان الذكاء الاصطناعي عادلاً في الغالب عبر الأعمار والأعراق والأجناس.
- الخلل: أدى الذكاء الاصطناعي أداءً مختلفًا اعتمادًا على مكان إجراء المقابلة. المقابلات من مدن أو عيادات مختلفة كانت لها "لهجات" أو أساليب مختلفة، وارتبك الذكنا الاصطناعي بسبب هذه الاختلافات الإقليمية. الأمر يشبه ذكاءً اصطناعيًا تدرب على لهجة نيويورك ثم واجه صعوبة في فهم لهجة محلية في تكساس.
5. معضلة "السرعة مقابل القوة"
نظر الباحثون أيضًا في التكلفة.
- النماذج الكبيرة تشبه سيارات الفيراري: إنها سريعة وقوية للغاية، لكنها تحتاج إلى خزان وقود ضخم (ذاكرة كمبيوتر هائلة) وهي مكلفة للتشغيل.
- النماذح الصغيرة تشبه السيارات الهجينة: هي أبطأ وأقل قوة، لكنها فعالة ويمكن تشغيلها على أجهزة أصغر وأرخص.
- نقطة التوازن المثالية: وجدوا نموذجًا "ذهبيًا" (متوسط الحجم) يقدم توازنًا رائعًا: دقة جيدة دون الحاجة إلى كمبيوتر خارق.
الخلاصة
تظهر هذه الورقة أن الذكاء الاصطناعي يمكن أن يعمل كمساعد قوي لفحص الصحة العقلية.
تخيل مستقبلاً لا يضطر فيه الطبيب لقضاء ساعتين في تسجيل وتقييم مقابلة يدويًا. بدلاً من ذلك، يستمع الذكاء الاصطناعي إلى التسجيل، ويسلط الضبح فورًا على الأجزاء الخطرة، ويعطي درجة أولية، ويكتب ملخصًا. ثم يقوم الطبيب البشري بمراجعة عمل الذكاء الاصطناعي لاتخاذ القرار النهائي.
هذا لا يستبدل الطبيب؛ بل يمنحه عدسة مكبرة فائقة القوة. يمكنه مساعدتنا في فحص ملايين الأشخاص، واكتشاف المخاطر مبكرًا، وتقديم المساعدة لمن يحتاجونها قبل أن تسوء حالتهم.
باختًا: نحن نعلم الكمبيوترات كيف تستمع إلى قصصنا وتكتشف علامات المرض النفسي. إنها ليست مثالية بعد، لكنها تصبح جيدة جدًا في ذلك، ويمكنها قريبًا مساعدتنا في إنقاذ الأرواح من خلال جعل الرعاية الصحية النفسية أسرع وأكثر سهولة في الوصول إليها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.