← أحدث الأبحاث
🤖 AI

VERA-MH: Validation of Ethical and Responsible AI in Mental Health

تقدم الورقة البحثية إطار عمل VERA-MH، وهو إطار عمل مُثبت سريريًا لتقييم سلامة روبوتات الدردشة القائمة على الذكاء الاصطناعي في سياقات الصحة النفسية — وتحديدًا فيما يتعلق بالأفكار الانتحارية — من خلال محاكاة تفاعلات مستخدمين متنوعة باستخدام وكلاء لعب الأدوار وتقييم الاستجابات باستخدام نموذج تقييم سريري مهيكل.

المؤلفون الأصليون: Luca Belli, Kate H. Bentley, Josh Gieringer, Emily Van Ark, Nilu Zhao, Pradip Thachile, Matt Hawrilenko, Millard Brown, Adam M. Chekroud

نُشر 2026-05-14✓ Author reviewed
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Luca Belli, Kate H. Bentley, Josh Gieringer, Emily Van Ark, Nilu Zhao, Pradip Thachile, Matt Hawrilenko, Millard Brown, Adam M. Chekroud

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم ببناء "مستجيب أول" رقمي للأشخاص الذين يمرون بأزمات عاطفية. تريد التأكد من أن هذا الروبوت لن يقول الشيء الخطأ بالخطأ ويجعل الأمور أسوأ. هذا هو بالضبط ما يدور حوله بحث VERA-MH.

إليك تفصيل بسيط لعملهم، باستخدام بعض التشبيهات من الحياة اليومية.

المشكلة: "الغرب المتوحش" لروبوتات الصحة النفسية

روبوتات الدردشة منتشرة في كل مكان الآن، مثل نوع جديد من السكاكين السويسرية متعددة الاستخدامات. لكن الناس بدأوا في استخدامها لأشياء لم تُصمم من أجلها، مثل دعم الصحة النفسية. يشير البحث إلى واقع مخيف: أحياناً، قد تشجع هذه الروبوتات عن غير قصد إيذاء النفس أو تقدم نصائح سيئة لشخص يشعر برغبة في الانتحار.

فكر في الأمر كأنك تسلم شخصاً غريباً مسدساً محشواً بالرصاص وتطلب منه المساعدة في رعاية طفل يبكي. نحن بحاجة إلى طريقة لاختبار ما إذا كان هذا الغريب يعرف كيفية التعامل مع الموقف بأمان قبل أن نسمح له بالاقتراب من الطفل.

الحل: VERA-MH (تمرين السلامة)

ابتكر المؤلفون نظاماً يسمى VERA-MH (التحقق من الذكاء الاصطناعي الأخلاقي والمسؤول في مجال الصحة النفسية). بدلاً من مجرد سؤال الروبوت "هل أنت آمن؟"، فإنهم يخضعونه لـ تمرين سلامة صارم.

يتكون التمرين من ثلاثة أجزاء رئيسية، مثل مسرحية في مسرح:

1. الممثلون (الشخصيات)

لا يمكنك فقط سؤال الروبوت "ماذا لو كان شخص ما حزيناً؟" لأن الحياة الواقعية فوضوية. لذا، أنشأ الباحثون 100 "ممثل" مختلف (يُطلق عليهم شخصيات).

  • التشبيه: تخيل مدرسة للدراما بها 100 طالب. كل طالب لديه قصة خلفية فريدة: أحدهم مراهق لا يملك مالاً، وآخر بالغ مسن يشعر بالعزلة، وآخر شخص حاول إيذاء نفسه من قبل.
  • التحول: هؤلاء "الممثلون" هم في الواقع روبوتات ذكاء اصطناعي أخرى. لقد تمت برمجتهم لتقمص أدوار هؤلاء الأشخاص المحددين والتحدث مع روبوت الدردشة الذي يتم اختباره. لقد صُمموا ليكونوا واقعيين، أحياناً مقتضبين، وأحياناً محبطين، وأحياناً ضعفاء للغاية.

2. قاضي المشهد

بمجرد أن يبدأ "الممثلون" في التحدث إلى روبوت الاختبار، يجب أن يكون هناك شخص يراقب كل مشهد على حدة ويقيم ذلك المشهد فقط — ليس لإدارة التقييم بأكمله، بل فقط لتقييم ما حدث في تلك المحادثة الواحدة.

  • التشبيه: بدلاً من توظيف 100 طبيب بشري لمراقبة كل محادثة (مما سيستغرق وقتاً طويلاً وسيكلف ثروة)، يستخدمون قاضياً ذكياً جداً من الذكاء الاصطناعي يركز حصرياً على تقييم كل محادثة مقابل قائمة مرجعية — إنه مكون واحد من مكونات التقييم، وليس المايسترو للمهمة بأكملها.
  • النص: هذا القاضي لا يخمن فحسب. إنه يتبع قائمة مرجعية محددة للغاية (تسمى معايير التقييم) وضعها خبراء في الصحة النفسية الحقيقيون. وهو يسأل أسئلة مثل:
    • هل لاحظ الروبوت أن الشخص في خطر؟
    • هل طرح الروبوت أسئلة توضيحية؟
    • هل أخبر الروبوت الشخص بأن يحصل على المساعدة من إنسان حقيقي؟
    • هل التزم الروبوت بحدوده (مذكراً المستخدم بأنه ذكاء اصطناعي وليس طبيباً)؟
  • التدفق: يعمل القاضي مثل كتاب "اختر مغامرتك الخاصة". إذا ارتكب الروبوت خطأً، يقوم القاضي بإيقاف خط الاستجواب المحدد ويسجل الخطأ. يساعد هذا في تحديد مكان فشل الروبوت بالضبط.

3. بطاقة الدرجات (التقييم)

بعد انتهاء المحادثة، يتم تجميع النتائج.

  • التشبيه: تخيل شهادة دراسية. بدلاً من درجة واحدة مثل "+B"، يحصل الروبوت على تفصيل دقيق. "رائع في ملاحظة المخاطر، لكنه سيء جداً في اقتراح المساعدة البشرية."
  • اختبر البحث أربع شركات كبرى للذكاء الاصطناٍعي (مثل صانعي Claude و GPT و Gemini و Grok) وأظهر كيف كان أداؤهم في تمرين السلامة المحدد هذا.

لماذا هذا النهج مختلف؟

يجادل البحث بأن الاختبارات السابقة كانت تشبه إجراء اختبار اختيار من متعدد (مرحلة واحدة). تسأل سؤالاً واحداً، تحصل على إجابة واحدة، ثم تمضي قدماً. لكن الحياة الواقعية ليست اختباراً؛ إنها محادثة.

  • تشبيه "اللعبة الطويلة": قد لا يقول الشخص الذي يمر بأزمة "أريد أن أموت" في الجملة الأولى. قد يلمح إلى ذلك، أو يشعر بالإحباط، أو يحاول مرة أخرى، أو يتحدث عن شيء آخر أولاً. VERA-MH يشاهد الفيلم بأكمله، وليس الإعلان الترويجي فقط.

قواعد اللعبة (مبادئ التصميم)

حرص المؤلفون على أن يكون اختبارهم عادلاً ومفيداً من خلال اتباع بعض القواعد:

  • لا خدع سحرية: اختبروا فقط النص الذي كتبه الروبوت، وليس الأزرار المزخرفة أو النوافذ المنبثقة على الشاشة.
  • الواقعية: استخدموا 100 "ممثل" مختلف حتى لا يتمكن الروبوت من حفظ نص واحد فقط.
  • مفتوح المصدر: نشروا جميع الأكواد والقواعد الخاصة بهم. إنه يشبه إعطاء الجميع وصفة تمرين السلامة حتى يتمكن أي شخص من مراجعة العمل.
  • التركيز على السلامة، لا العلاج: هم لا يختبرون ما إذا كان الروبوت معالجاً جيداً (فهذا أمر صعب). هم يختبرون فقط ما إذا كان الروبوت آمناً. الهدف هو "أولاً، لا تسبب الضرر".

العيوب (القيود)

الورقة البحثية صادقة بشأن ما لا تستطيع فعله:

  • الأشخاص "المزيفون": على الرغم من أن "الممثلين" جيدون جداً، إلا أنهم لا يزالون ذكاءً اصطناعياً. قد لا يجسدون التعقيد الكامل للإنسان الحقيقي المتألم بشكل مثالي.
  • اللغة: الاختبار متاح باللغة الإنجليزية فقط في الوقت الحالي.
  • التكلفة: تشغيل هذا الاختبار مكلف لأنه يتطلب الكثير من القدرة الحوسبية (مثل تشغيل محاكاة ضخمة).

الخلاصة

VERA-MH هو طريقة جديدة وصارمة لاختبار روبوتات الدردشة الخاصة بالصحة النفسية. يستخدم ممثلين من الذكاء الاصطناعي لمحاكاة أزمات حقيقية وقضاة من الذكاء الاصطناعي لتقييم الاستجابات بناءً على قواعد الخبراء. الهدف بسيط: قبل أن نسمح لهذه الروبوتات بالتحدث إلى أشخاص مستضعفين، نحتاج للتأكد من أنها لن تدفعهم بالخطأ نحو الهاوية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →