When Do Physicians Trust AI? The Role of Clinical Context in Decision Support: SMART vignette study
تكشف هذه الدراسة التي شملت 420 طبيبًا من الولايات المتحدة أن التعرض المسبق للذكاء الاصطناعي، وليس السياق السريري المحدد أو كمية المعلومات المقدمة، هو العامل الرئيسي الذي يؤثر إيجابًا على ثقة الأطباء في أدوات دعم القرار السريري المعززة بالذكاء الاصطناعي وإيمانهم بها.
المؤلفون الأصليون:Bohye Kim, Katie Ryan, Max Kasun, Jane Paik Kim
في الطب الحديث، بدأ الأطباء في استخدام نوع جديد من المساعدين: الذكاء الاصطناعي. هذه البرامج الحاسوبية، التي تُسمى غالباً أنظمة دعم القرار السريري، يمكنها فحص سجلات المرضى واقتراح الخطوات التالية، مثل ما إذا كان ينبغي وصف دواء أو إحالة المريض إلى أخصائي. والوعد هنا هو أن هذه الأدوات ستساعد الأطباء على اتخاذ خيارات أفضل وأسرع. ومع ذلك، فإن الأداة لا تكون مفيدة إلا إذا وثق فيها الشخص المستخدم بما يكفي للاستماع إليها. فإذا تجاهل الطبيب نصيحة الكمبيوتر لأنه لا يفهمها أو لا يعتقد أنها صحيحة، فإن التكنولوجيا تفشل. والسؤال الكبير الذي يواجه المستشفيات والباحثين ليس فقط ما إذا كان البرنامج يعمل على جهاز الكمبيوتر، بل ما الذي يجعل الطبيب البشري يشعر بالثقة الكافية لاستخدامه في العالم الحقيقي. هل هو نوع المشكلة الطبية؟ أم هي كمية المعلومات التي يحصل عليها الطبيب حول كيفية تفكير الكمبيوتر؟ أم هو ببسا بسا هل سبق للطبيب استخدام هذا النوع من التكنولوجيا من قبل؟
لقد وضع فريق من الباحثين في جامعة ستانفوردد هدفاً للإجابة على هذه الأسئلة من خلال سؤال أربعمائة وعشرين من أطباء طب الأسرة والطب الباطني في الولايات المتحدة أن يتخيلوا أنفسهم في مواقف طبية محددة. لم يطلب منهم استخدام برنامج حاسوبي حقيقي على مرضى حقيقيين. بدلاً من ذلك، استخدموا طريقة استقصائية مصممة بعناية حيث قرأ الأطباء قصصاً قصيرة، أو سيناريوهات، عن امرأة تبلغ من العمر ثلاثة وثلاثين عاماً تدعى "جيس" تظهر عليها أعراض مشكلة صحية. في بعض القصال، كانت جيس بحاجة إلى وصفة طبية لعلاج الاكتئاب، بينما في حالات أخرى، كانت بحاجة إلى إحالة إلى أخصائي لمشاكل الانتباه. قام الباحثون بتغيير تفاصيل القصة لاختبار ثلاثة أشياء مختلفة. أولاً، قاموا بتغيير نوع القرار الطبي، بمقارنة وصف الدواء بالإحالة إلى أخصائي. ثانياً، قاموا بتغيير مقدار المعلومات التي يتلقاها الطبيب عن أداة الذكاء الاصطناعي نفسها؛ حيث حصل بعض الأطباء على وصف قصير، بينما حصل آخرون على وصف أطول بكثير يتضمن تفاصيل حول مكان بناء الأداة وكيفية تدريبها. ثالثاً، نظروا في تاريخ الأطباء الخاص، مع ملاحظة أي منهم قد استخدم الذكاء الاصطناعي في أبحاثهم أو ممارساتهم من قبل.
أراد الباحثون معرفة ما إذا كانت هذه التغييرات ستجعل الأطباء يشعرون بمزيد من الثقة في قرارهم النهائي. وقد افترضوا أن الأطباء سيشعرون بمزيد من الثقة إذا عرفوا المزيد عن كيفية عمل الأداة، وأنهم سيكونون أكثر تشككاً في الأداة عندما يتضمن القرار مخاطر أعلى، مثل وصف دواء جديد. كما تساءلوا أيضاً عما إذا كان الأطباء الذين لديهم دراية مسبقة بالذكاء الاصطناعي سيتفاعلون بشكل مختلف مع كمية المعلومات المقدمة. ووجدت الدراسة أن كمية المعلومات لم تكن مهمة بقدر المتوقع. وسواء قرأ الطبيب خمس جمل أو عشر جمل عن الأداة، فإن ثقته في القرار ظلت كما هي. كما أن نوع القرار الطبي لم يغير مدى ثقة الأطباء بشكل عام، لكنه غير نظرتهم للأداة نفسها. فعندما تضمن السيناريو وصف دواء، كان الأطباء أقل عرضة للثقة في أن الأداة ستقدم نصيحة متسقة لكل مريض، وكانوا أكثر عرضة للاعتماد على حكمهم الخاص بدلاً من اقتراح الكمبيوتر. وفي المقابل، عندما تضمن السيناريو الإحالة، كانوا أكثر استعداداً للثقة في اتساق الأداة.
ومع ذلك، جاءت النتيجة الأكثر أهمية من النظر في تجارب الأطباء الماضية. فقد أظهرت الدراسة أن الأطباء الذين سبق لهم استخدام الذكاء الاصطناعي في أبحاثهم أو ممارساتهم السريرية شعروا بثقة أكبر بكثير في قراراتهم النهائية عند استخدام الأداة. كما كان هؤلاء الأطباء ذوو الخبرة أكثر عرضة للقول بأن الأداة حسنت الرعاية التي يمكنهم تقديمها وأن نتيجة الكمبيوتر ساهمت في اختيارهم النهائي. وهذا يشير إلى أن الألفة تولد الثقة. ومن المثير للاهتمام أن الباحثين وجدوا أن الخبرة السابقة لم تجعل الأطباء يثقون في الأداة بشكل أعمى؛ بل جعلتهم يشعرون بمزيد من الأمان في قدرتهم الخاصة على استخدام الأداة بفعالية. كما استبعدت الدراسة فكرة أن مجرد إغراق الطبيب بالتفاصيل التقنية حول البرنامج سيجعله يثق به أكثر. في الواقع، لم يكن للمعلومات الإضافية أي تأثير ملموس على ثقتهم أو تصورهم لفعالية الأداة.
تشير هذه النتائج إلى أن الطريق نحو دمج الذكاء الاصطناعي في الطب لا يتعلق بإتقان دليل المستخدم بقدر ما يتعلق بإعداد الأشخاص الذين سيستخدمونه. ويخلص الباحثون إلى أن تدريب أطباء المستقبل يجب أن يركز على كيفية موازنة اقتراحات الكمبيوتر جنباً إلى جنب مع حكمهم السريري، بدلاً من مجرد تعليمهم كيفية تشغيل البرنامج. فإذا أراد الأطباء الوثوق بهذه الأدوات، فهم بحاجة إلى فهم كيفية استخدامها في السياق، ويبدو أن ثقتهم تنمو بشكل طبيعي مع الخبرة. وتسلط الدراسة الضوء على أنه بينما تتقدم التكنولوجيا بسرعة، يظل العنصر البشري هو العامل الحاسم. ولكي يساعد الذكاء الاصطناعي المرضى حقاً، يجب على المجتمع الطبي ضمان شعور الأطباء بالاستعداد والرغبة في العمل جنباً إلى جنب معه، وهو الاستعداد الذي يبدو أنه يأتي من التعرض والممارسة وليس فقط من المزيد من البيانات.
ملخص تقني: متى يثق الأطباء بالذكاء الاصطناعي؟ دور السياق السريري في دعم القرار
بيان المشكلة على الرغم من التكامل المتزايد لأنظمة دعم القرار السريري المدعومة بالذكاء الاصطناعي (AI-CDSS) في سير العمل الرعائي، إلا أن ترجمة الأداء الخوارزمي إلى تأثير سريري ملموس لا تزال محدودة، حيث لا يتجاوز 2% من نماذج الذاء الاصطناعي مرحلة النماذج الأولية. ويتمثل أحد العوائق الرئيسية أمام الاعتماد في "فجوة الترجمة" الناتجة عن العوامل البشرية: وتحديداً، كيفية تقييم الأطباء للمخرقات الخوارزمية وتفسيرها ودمجها مع الحكم السريري المستقل. وبينما تتزايد الموافقات التنظيمية، فإن التنفيذ الناجح يتشكل بقوة من خلال ثقة الطبيب، وإدراك اضطرابات سير العمل، وخطر "إجهاد التنبيه"، حيث يتجاهل الأطباء التنبيهات بسبب العبء المعرفي بدلاً من الاستناد إلى التفكير السريري. علاوة على ذلك، غالباً ما تبحث الدراسات الحالية في العوامل التي تؤثر على ثقة الأطباء (مثل إدراك المخاطر، وتأطير المعلومات، والتعرض المسبق) بشكل منعزل، مما يؤدي إلى الفشل في مراعاة علاقاتها المتبادلة أو تفاعلاتها ضمن السياقات السريرية الواقعية. تعالج هذه الدراسة الحاجة الملحة لفهم كيف يؤثر نوع القرار السريري (ملف المخاطر)، وكمية المعلومات المفصح عنها حول الذكاء الاصطناعي، والتعرض المسبق للطبيب للذكاء الاصطناعي، بشكل جماعي على الثقة، والفعالية المدركة، والاعتماد على أدوات الذكاء الاصطناعي.
المنهجية استخدمت الدراسة تصميم المخطط التجريبي المتسلسل متعدد التعيين (SMART vignette)، وهو منهجية استقصائية مبتكرة تم تكييفها للبحوث عبر الإنترنت.
المشاركون: أجريت الدراسة على 420 طبيباً ممارساً في الولايات المتحدة متخصصين في طب الأسرة أو الطب الباطني، تم استقطابهم عبر ملف البيانات المهنية لأطباء الجمعية الطبية الأمريكية (AMA).
التصميم التجريبي: عُرضت على المشاركين سلسلة من السيناريوهات المصغرة المتسلسلة ("السيناريوهات الفرعية") بدلاً من سرد ثابت واحد. ومن خلال التعيين الاحتمالي، قامت الدراسة بتغيير ثلاث خصائص رئيسية بشكل منهجي عبر العينة:
نوع القرار السريري: وصفة طبية (مخاطر أعلى) مقابل إحالة (مخاطر أقل).
كمية المعلومات: معلومات "أكثر" (10 جمل، تشمل بيانات التطوير، وبيانات التدريب، وقيم المساحة تحت المنحنى AUC) مقابل معلومات "أقل" (5 جمل، تركز على الاستخدام وسجلات المرضى).
توصية الذكاء الاصطناعي: علاج أم عدم علاج.
المقاييس: شملت النتائج الأولية الثقة المبلغ عنها ذاتياً في القرار النهائي والفعالية المدركة لنظام (AI-CDSS) (باستخدام مقاييس ليكرت الخماسية). وقيمت النتائج الاستكشافية تصورات استخدام الذكاء الاصطناعي في الممارسة، والاعتماد على الحكم الشخصي مقابل الذكاء الاصطناعي، والرغبة في استخدام الأداة.
المتغيرات المستقلة: ركز التحليل على نوع القرار السريري، وحجم المعلومات، والتصنيف الثنائي لـ التعرض المسبق للذكاء الاصطناعي (المحدد من خلال الاستخدام المبلغ عنه ذاتياً في البحث أو الممارسة، أو درجات الألفة العالية).
التحليل الإحصائي: استُخدمت نماذج الانحدار الخطي لتقييم التأثيرات الرئيسية ومصطلحات التفاعل (التعديل). كما طُبقت الاختبارات أحادية الجانب مع تصحيح بنجاميني-هوخبرج (Benjamini-Hochberg) للفرضيات الأولية، بينما استُخدمت الاختبارات ثنائية الجوانب للتحليلات الاستكشافية.
النتائج الرئيسية
تأثير التعرض المسبق: أظهر الأطباء ذوو التعرض المسبق للذكاء الاصطناعي ثقة أعلى بكثير في قراراتهم النهائية (β=0.274, p adjusted=0.042) وصنفوا نظام (AI-CDSS) على أنه أكثر فعالية في تحسين رعاية المرضى (β=0.350, p adjusted=0.006). كما ارتبط التعرض المسبق باحتمالية أكبر للموافقة على أن نتيجة الذكاء الاصطناعي ساهمت في القرار النهائي (β=0.305, p=0.010).
تأثير حجم المعلومات: خلافاً للفرضية القائلة بأن زيادة الشفافية ستزيد الثقة، لم يكن لحجم المعلومات المقدمة حول (AI-CDSS) (أكثر مقابل أقل) أي تأثير معنوي على ثقة الأطباء أو تصوراتهم للفعالية.
تأثير نوع القرار السريري: أثر نوع القرار السريري بشكل كبير على الثقة والاعتماد. سجل الأطباء المخصصون لـ سيناريو الوصفة الطبية (مخاطر أعلى):
ثقة أقل في قدرة الذكاء الاصطناعي على تقديم توصيات متسقة (β=−0.211, p=0.027).
فوائد مدركة أقل تفوق المخاطر (β=−0.179, p=0.042).
اعتماد أكبر على فحصهم الخاص مقابل توصية الذكاء الاصطناعي (β=0.154, p=0.027).
في المقابل، أظهر أولئك في سيناريو الإحالة ثقة أعلى واعتماداً أقل على الحكم المستقل.
تأثيرات التعديل: لم يؤثر التعرض المسبق للذكاء الاصطناعي بشكل معنوي في تعديل تأثير حجم المعلومات على مستويات الثقة أو تقييمات الفعالية.
الأهمية والادعاءات تفترض الورقة أن النشر الناجح لأنظمة (AI-CDSS) يتطلب تقييماً للعوامل البشرية قبل النشر، مع تسليط الضوء بشكل خاص على أن المعرفة والتعرض المسبق للذكاء الاصطناعي هما محركان حاسمان لثقة الأطباء وفعالية الأداة المدركة. وتشير النتائج إلى ما يلي:
التدريب ضروري: إن دمج استخدام الذكاء الاصطناعي واتخاذ القرار بمساعدة الذكاء الاصطناعي في تعليم الأطباء أمر حيوي. ويجادل المؤلفون بأن التدريب يجب أن يركز على كيفية وزن المدخلات الناتجة عن الذكاء الاصطناعي جنباً إلى جنب مع سياق المريض والحكم السريري، بدلاً من التسليم المطلق للخوارزميات.
السياق مهم: يميز الأطباء بين ملفات المخاطر؛ فهم أكثر تشككاً وأقل اعتماداً على الذكاء الاصطناعي في السيناريوهات عالية المخاطر (مثل وصف الأدوية) مقارنة بالسيناريوهات الأقل خطورة (مثل الإحالات). يجب أن تأخذ استراتيجيات التنفيذ في الاعتبار هذه الاختلافات المرتبطة بالمهام المحددة للثقة.
حدود تأطير المعلومات: مجرد تقديم تفاصيل تقنية أكثر حول نموذج الذكاء الاصطناعي (مثل بيانات التدريب، أو قيمة AUC) لا يعزز بالضرورة الثقة أو الفعالية المدركة لدى الأطباء المشغولين، مما يشير إلى أن عوامل الواجهة أو طريقة العرض قد تكون أكثر تأثيراً.
السلامة والمعايرة: لمنع الاعتماد غير المناسب على الذكاء الاصطناعي، والذي يشكل مخاطر على المرضى، يجب تطوير ضمانات لمواءمة ثقة الطبيب مع الموثوقية الفعلية للنموذج. ويتضمن ذلك عمليات التدقيق وآليات التغذية الراجعة.
تخلص الدراسة إلى أنه بينما يعد الأداء الخوارزمي ضرورياً، فإن ديناميكيات "الإنسان في الحلقة" (human-in-the-loop) — وتحديداً خلفية الطبيب، وتعرضه، والسياق السريري المحدد — هي العوامل الحاسمة فيما إذا كانت أدوات الذكاء الاصطناعي سيتم اعتمادها، أو فحصها، أو تجاهلها في الممارسة السريرية.